Artificial Analysis Intelligence Index
综合智力:知识、推理、数学、编程混在一起的总分
它测什么
Artificial Analysis 是一家独立评测机构。它用同一套流程自己跑十余项公开评测(知识问答、科学推理、数学竞赛题、编程题、终端任务等),再把成绩加权合成一个 0–100 的指数。
数字越高,模型的总体水平越强。它适合快速回答“这个模型大概处在什么位置”,但看不出某项具体能力的强弱。
同一模型的不同推理强度(low / high / max)会被当作不同条目分别计分。
怎么看分数
0–100 的相对指数,只在同一时期的模型之间比较有意义;指数的构成会随评测项更新而调整。
模型表现
| Claude Fable 5.1 (max)Anthropic | 53 |
|---|---|
| Claude Fable 5.1 (xhigh)Anthropic | 53 |
| GPT-6 Astra (max)OpenAI | 53 |
| GPT-6 Astra (xhigh)OpenAI | 53 |
| Claude Fable 5.1 (high)Anthropic | 51 |
| GPT-6 Astra (high)OpenAI | 51 |
| Claude Opus 5 (max)Anthropic | 51 |
| Claude Fable 5Anthropic | 50 |
| GPT-6 Astra (medium)OpenAI | 50 |
| Claude Opus 5 (xhigh)Anthropic | 50 |
| Claude Fable 5.1 (medium)Anthropic | 49 |
| Claude Opus 5 (high)Anthropic | 48 |
| Muse Spark 1.3 (max)Meta | 48 |
| GPT-5.6 Sol (max)OpenAI | 47 |
| Claude Fable 5.1 (low)Anthropic | 47 |
| GPT-6 Astra (low)OpenAI | 46 |
| GPT-6 Astra (Non-reasoning)OpenAI | 45 |
| Muse Spark 1.3 (xhigh)Meta | 45 |
| Claude Opus 5 (medium)Anthropic | 45 |
| GLM-5.3 (max)Z AI | 45 |