返回术语

AI

置信区间Confidence Interval

你可能会问

置信区间为什么不只报一个分数,还要带上一个范围?

馆长说,简单来说

只测一部分题,算出的分数难免有偶然性。置信区间就是给这个估计配上一个范围,提醒你不要把单次分数看得太精确。例如 70% ± 3 个百分点,表示区间从 67% 到 73%。

图解 · 示意数据

70% ± 3,分别在说什么?

50%60%70%80%90%70%67%73%
圆点表示“这次测到了 70%”,蓝线表示“估计还有不确定性,算出的范围是 67%–73%”。这里的 ± 3,就是从 70% 往左、往右各 3 个百分点。这是一组用来说明记号的数字,不是下方 100 次抽样的计算结果。

01 · 先这样理解

把抽象概念放进真实场景

只测一部分题,算出的分数难免有偶然性。置信区间就是给这个估计配上一个范围,提醒你不要把单次分数看得太精确。例如 70% ± 3 个百分点,表示区间从 67% 到 73%。

换个角度想

想象桌上有一大罐混合糖果,你想知道红色糖果占多少,却不想把整罐都数完。于是闭着眼随机摸 100 次,每次记下颜色,再放回去摇匀。结果有 70 次摸到了红色,你会猜:整罐大概有 70% 是红色。

但换个人再摸 100 次,可能摸到 66 次,也可能是 74 次。罐子没有变,变的是这次恰好摸到了什么。所以,与其咬定“就是 70%”,不如用一种统计方法算出一个范围,表达这次估计还不够精确——这就是置信区间在做的事。

那“95%”呢?想象很多人都按相同规则来摸糖,每人算出一个范围。在抽样和计算方法合适的前提下,这些范围中,长期来看大约 95% 能罩住整罐红糖的真实比例,也会有一些漏掉。不是每 100 人都恰好有 95 人猜中,更不是说罐里有 95% 的红糖。

回到 AI 榜单:把“摸糖”换成“抽题测试”,把“红糖占比”换成“通过率”。置信区间提醒我们:这次测出 70%,不代表模型在所有同类任务上都恰好是 70%。

02 · 动手看看

同样是 70%,测多少题有区别吗?

接着上面的糖果例子,把抽一次糖换成测一道题。下面三组示意结果都恰好有 70% 通过;点一下题数,看看蓝线怎么变。

如果分别测了这么多题
60.4%–78.1%95% 置信区间 · 70 / 100 题通过
50%60%70%80%90%

区间总宽度约为 17.7 个百分点。就像只摸了一小部分糖,估计范围还比较宽。

65.3%–74.3%95% 置信区间 · 280 / 400 题通过
50%60%70%80%90%

区间总宽度约为 8.9 个百分点。分数还是 70%,范围却收窄了:我们估得更准了,模型并没有因此变强。

67.7%–72.2%95% 置信区间 · 1,120 / 1,600 题通过
50%60%70%80%90%

区间总宽度约为 4.5 个百分点。分数还是 70%,范围却收窄了:我们估得更准了,模型并没有因此变强。

想深入一点:这些范围怎么算?

三组结果都使用 95% Wilson 置信区间(z = 1.96),假设每道题彼此独立、来自同一类目标任务,结果只有通过或失败。这是教学数据,不是真实模型成绩。

重复同一道题,或者只挑一类很相似的题,不能简单当成增加了同样多的独立样本。“95%”描述这种方法长期能覆盖真实值的比例,不是对已经算出的某一个区间再分配 95% 的概率。

区间不一定左右对称;榜单上的 ± 也可能表示标准差等其他东西,要看说明。两个模型的区间有重叠,不能直接证明它们没有差异,需要针对分数之差做合适的统计分析。

03 · 放进真实任务

什么时候会遇到它

读模型榜单

A 得 70 分,B 得 71 分,但两者的估计都还有几分的不确定性。就像两个人摸糖只差一次,不能立刻说其中一个更准;需要看看这种差距能否在公平测试中稳定出现。

决定要测多少题

只摸几次糖容易碰巧,认真随机摸更多次,通常更容易估准。评测也是一样:其他条件不变,多测一些有代表性的独立题目,通常能把范围收窄。

核对统计口径

先看榜单在比较什么:是换一批题会差多少,还是同一整套评测重跑几轮会差多少?DeepSWE 采用后者,不能直接套用前面的抽题示例。

04 · 想一想

用一个问题检查理解

两个人从同一罐糖果里随机抽样,都摸到约 70% 的红糖。一个只摸了 100 次,另一个摸了 1,600 次。谁的估计范围通常更窄?这说明糖果变了吗?

查看答案

在相同抽样规则和置信水平下,摸 1,600 次的人通常能给出更窄的范围。糖果没有变,只是他拿到的信息更多,估得更精确。模型多测一些题也是如此:更窄的区间不等于模型变强。

老师提醒

最容易踩的坑

如果你专挑看起来像红色的糖去摸,摸再多也可能估错。评测同样如此:题目选得偏、答案被模型提前见过,再窄的区间也不能保证公平。另外,95% 不是模型“有 95% 把握答对”,区间也不是下一次分数一定会落入的范围。

⌘K搜索知识库

最近收录

正在载入知识索引…