Benchmarks

综合能力

Vals Index

综合金融、编程与法律任务,按行业经济权重衡量 Agent 的工作能力

它测什么

Vals Index 是 Vals AI 汇总真实工作任务表现的综合指数,目前采用 v2 版本。它包含金融、编程和法律三个领域:金融看财报研究与 Excel 财务建模,编程看终端任务、应用开发与代码迁移,法律看检索研究和长流程法律工作。

你可以把它理解成一张有不同科目权重的成绩单:先算出每个领域的平均分,再把三个领域合成总分。金融权重最高,所以两个模型即使编程成绩接近,也可能因为财务研究和建模能力不同而拉开总分。

金融由 Finance Agent v2 和 Excel Modeling Benchmark 组成,编程由 Terminal-Bench 2.1、Vibe Code Bench 和 Code Migration 组成,法律由 Legal Research Bench 和 Harvey’s Legal Agent Benchmark 组成。权重参考对应行业在美国 GDP 中的占比:金融与保险 8.0、信息行业 5.6、法律服务 1.2,合计 14.8;归一化后约为 54.1%、37.8% 和 8.1%。

怎么看分数

分数越高,表示在这组任务和权重下的综合表现越好。计算方式为(8 × 金融平均分 + 5.6 × 编程平均分 + 1.2 × 法律平均分)÷ 14.8。例如三个领域分别得 60、80、40 分,综合指数约为 65.9%。它不是所有任务的简单正确率,也不表示已经能替代相同比例的岗位或创造相同比例的 GDP。收录官方标注 2026 年 9 月 11 日更新的 v2 榜单全部 57 条模型成绩,保留官方公布的推理设置;不同版本的组成与权重会变化,不宜直接比较。Code Migration 在此指数中使用固定子集:50 个 CLI 迁移任务和全部 10 个 COBOL 任务,按 75% / 25% 加权,不能直接拿其完整榜单总分替代。表中保留官方综合分,不用本站其他评测的分数重新拼算;来源中的标准误也不作为 95% 置信区间展示。

来源Vals AI

查看金融分项:Finance Agent v2

模型表现

核对于 57 条成绩

Vals Index — 模型表现。选择列标题可排序。
Claude Fable 5.1 (max)Anthropic
68.8%1
Claude Opus 5 (max)Anthropic
67.2%2
GPT-6 Astra (max)OpenAI
66.6%3
Claude Fable 5 (max)Anthropic
66.0%4
Muse Spark 1.3 Max (max)Meta
64.5%
GPT-5.6 Sol (max)OpenAI
63.7%
Gemini 3.8 Flash (high)Google
62.3%
Claude Opus 4.8 (max)Anthropic
60.9%
Muse Spark 1.3 (xhigh)Meta
60.3%
GPT-5.6 Luna (max)OpenAI
59.9%5
Claude Sonnet 5 (max)Anthropic
59.6%
GPT-5.6 Terra (max)OpenAI
59.6%6
Gemini 3.7 Flash (high)Google
59.3%
Grok 4.6 (high)xAI
59.2%
DeepSeek V4.1 Flash (high)DeepSeek
57.9%
Kimi K3Moonshot AI
57.8%
GPT-5.5 (xhigh)OpenAI
57.4%
Muse Spark 1.2 (xhigh)Meta
57.1%
GLM-5.3 (max)Z AI
57.0%
Claude Opus 4.7 (high)Anthropic
56.1%
Gemini 3.6 Flash (high)Google
55.4%
Muse Spark 1.1 (xhigh)Meta
54.8%
DeepSeek V4 Flash 0731 (high)DeepSeek
53.6%
GLM-5.2Z AI
53.1%
Gemini 3.5 Flash (high)Google
53.1%
DeepSeek V4 Pro 0813 (max)DeepSeek
52.4%
Qwen 3.8 MaxAlibaba
51.8%
Grok 4.5 (high)xAI
51.5%
Claude Sonnet 4.6 (max)Anthropic
50.6%
Qwen 3.8 27B (xhigh)Alibaba
48.5%
GLM-5.3 Flash (max)Z AI
47.2%
Qwen 3.7 MaxAlibaba
44.8%
Kimi K2.6Moonshot AI
43.5%
DeepSeek V4 Pro (max)DeepSeek
42.9%
MiniMax-M3MiniMax
42.7%
Gemini 3.1 Pro Preview (02/26) (high)Google
41.9%
MiMo V2.5 ProXiaomi
41.0%
MiMo V2.5Xiaomi
39.9%
GPT 5.4 Mini (xhigh)OpenAI
39.6%
Qwen 3.7 PlusAlibaba
38.6%
Gemini 3.5 Flash Lite (high)Google
36.7%
Inkling (0.99)Thinking Machines
34.1%
GPT 5.4 Nano (high)OpenAI
33.0%
Qwen 3.6 PlusAlibaba
32.0%
Inkling Small (0.99)Thinking Machines
31.9%
Gemini 3 Flash (12/25) (high)Google
29.4%
Nemotron 3 UltraNVIDIA
27.4%
Kimi K2.5Moonshot AI
26.3%
MiniMax-M2.7MiniMax
24.6%
Grok 4.3 (high)xAI
24.3%
Claude Haiku 4.5 (Thinking)Anthropic
22.9%
Ling 3.0 FlashAnt Group
21.7%
Mistral Medium 3.5 (high)Mistral
17.9%
Grok 4.20 (Reasoning)xAI
17.6%
Gemini 3.1 Flash Lite Preview (high)Google
15.5%
Mercury 2.5 (high)Inception
13.0%
Nemotron 3.5 LightningNVIDIA
11.5%
  1. 使用官网默认成绩,包含拒答后的备用模型结果。Vals AI 标注:1,257 个任务结果中有 35 次 fallback(2.78%);这不是所有任务都由单一模型独立完成的成绩。来源
  2. 使用官网默认成绩,包含拒答后的备用模型结果。Vals AI 标注:2,157 个任务结果中有 9 次 fallback(0.42%);这不是所有任务都由单一模型独立完成的成绩。来源
  3. Vals AI 标注:1,257 个任务结果中有 31 次提供商拒答(2.47%),按失败计分。来源
  4. 使用官网默认成绩,包含拒答后的备用模型结果。Vals AI 标注:2,156 个任务结果中有 84 次 fallback(3.90%);这不是所有任务都由单一模型独立完成的成绩。来源
  5. Vals AI 标注:2,157 个任务结果中有 1 次提供商拒答(0.05%),按失败计分。来源
  6. Vals AI 标注:1,257 个任务结果中有 31 次提供商拒答(2.47%),按失败计分。来源

⌘K搜索知识库

最近收录

正在载入知识索引…