术语 · AI

参数量

Parameters

模型在训练中学到的数字一共有多少个。模型名里的 7B、70B 就是参数量,B 是十亿:7B 即 70 亿。参数越多,通常能力越强,运行时占用的内存也越大。

参数越多,装下的越多,要的内存也越多

参数量 × 每个的大小 = 内存
数字大十倍,机器也要大十倍
参数是模型训练时调出来的一个个数字,模型的「知识」和「本事」都存在这些数字里。每个参数都要占内存,所以参数量基本决定了模型要多大的机器才跑得动。

换个角度想

参数像调音台上的旋钮。训练就是把几十亿个旋钮一点点拧到合适的位置,让模型的输出越来越对。旋钮越多,能调出的声音越细腻,但调音台也越大,得有更大的房间才放得下。

7B 和 70B,差的只是一个零吗?

  1. 模型名里的数字

    7B7 Billion,70 亿个参数

    模型名里的数字

    70B70 Billion,700 亿个参数

  2. 70 亿 × 2 字节

    约 14GB,一张大显存的显卡放得下

    700 亿 × 2 字节

    约 140GB,要好几张数据中心显卡

  3. 审 50 页合同:明显的风险条款能找出来,前后条款互相矛盾的地方常漏掉
    审 50 页合同:能对照前后条款,指出第 12 条和第 37 条说法冲突
  4. 轻便本地能跑,又快又省适合改写、分类、摘要这类简单活
    昂贵要上服务器,每次调用更贵、更慢留给真正需要它的难题

看懂模型名里的数字

什么时候会遇到它

  1. 看模型名

    同一个模型常有好几个版本,比如 8B、32B、235B,数字就是参数量,决定了强弱和贵贱。

  2. 本地部署

    想在自己电脑上跑模型,先用参数量估算内存,再看自己的显卡或内存够不够。

  3. 理解价格

    参数越多,每次计算越费算力,所以同一家的大模型 API 通常比小模型贵。

想一想

一个新出的 8B 模型,评测成绩超过了两年前的一个 70B 模型。参数少了这么多,为什么反而更强?

看答案

参数量只是决定能力的因素之一。训练数据的质量和数量、训练方法、模型结构都在进步,新的小模型可以超过旧的大模型。参数量更适合用来比较同一代、同一系列的模型。

最容易踩的坑

参数多不等于一定更好,新的小模型常常能打败旧的大模型。很多闭源模型也不公布参数量,网上流传的数字多半是猜测。遇到 MoE 模型,还要分清总参数和激活参数:前者决定占多少内存,后者决定每次算多少。

⌘K搜索知识库

最近收录

正在载入知识索引…