Benchmarks

Artificial Analysis Intelligence Index

综合智力:知识、推理、数学、编程混在一起的总分

它测什么

Artificial Analysis 是一家独立评测机构。它用同一套流程自己跑十余项公开评测(知识问答、科学推理、数学竞赛题、编程题、终端任务等),再把成绩加权合成一个 0–100 的指数。

数字越高,模型的总体水平越强。它适合快速回答“这个模型大概处在什么位置”,但看不出某项具体能力的强弱。

同一模型的不同推理强度(low / high / max)会被当作不同条目分别计分。

怎么看分数

0–100 的相对指数,只在同一时期的模型之间比较有意义;指数的构成会随评测项更新而调整。

来源Artificial Analysis

模型表现

核对于 20 条成绩

Artificial Analysis Intelligence Index — 模型表现。选择列标题可排序。
Claude Fable 5.1 (max)Anthropic53
Claude Fable 5.1 (xhigh)Anthropic53
GPT-6 Astra (max)OpenAI53
GPT-6 Astra (xhigh)OpenAI53
Claude Fable 5.1 (high)Anthropic51
GPT-6 Astra (high)OpenAI51
Claude Opus 5 (max)Anthropic51
Claude Fable 5Anthropic50
GPT-6 Astra (medium)OpenAI50
Claude Opus 5 (xhigh)Anthropic50
Claude Fable 5.1 (medium)Anthropic49
Claude Opus 5 (high)Anthropic48
Muse Spark 1.3 (max)Meta48
GPT-5.6 Sol (max)OpenAI47
Claude Fable 5.1 (low)Anthropic47
GPT-6 Astra (low)OpenAI46
GPT-6 Astra (Non-reasoning)OpenAI45
Muse Spark 1.3 (xhigh)Meta45
Claude Opus 5 (medium)Anthropic45
GLM-5.3 (max)Z AI45

⌘K搜索知识库

最近收录

正在载入知识索引…