换个角度想
参数像调音台上的旋钮。训练就是把几十亿个旋钮一点点拧到合适的位置,让模型的输出越来越对。旋钮越多,能调出的声音越细腻,但调音台也越大,得有更大的房间才放得下。
术语 · AI
Parameters
模型在训练中学到的数字一共有多少个。模型名里的 7B、70B 就是参数量,B 是十亿:7B 即 70 亿。参数越多,通常能力越强,运行时占用的内存也越大。
参数越多,装下的越多,要的内存也越多
参数像调音台上的旋钮。训练就是把几十亿个旋钮一点点拧到合适的位置,让模型的输出越来越对。旋钮越多,能调出的声音越细腻,但调音台也越大,得有更大的房间才放得下。
7B7 Billion,70 亿个参数
70B70 Billion,700 亿个参数
70 亿 × 2 字节
约 14GB,一张大显存的显卡放得下
700 亿 × 2 字节
约 140GB,要好几张数据中心显卡
看懂模型名里的数字
同一个模型常有好几个版本,比如 8B、32B、235B,数字就是参数量,决定了强弱和贵贱。
想在自己电脑上跑模型,先用参数量估算内存,再看自己的显卡或内存够不够。
参数越多,每次计算越费算力,所以同一家的大模型 API 通常比小模型贵。
一个新出的 8B 模型,评测成绩超过了两年前的一个 70B 模型。参数少了这么多,为什么反而更强?
参数量只是决定能力的因素之一。训练数据的质量和数量、训练方法、模型结构都在进步,新的小模型可以超过旧的大模型。参数量更适合用来比较同一代、同一系列的模型。
参数多不等于一定更好,新的小模型常常能打败旧的大模型。很多闭源模型也不公布参数量,网上流传的数字多半是猜测。遇到 MoE 模型,还要分清总参数和激活参数:前者决定占多少内存,后者决定每次算多少。