综合能力
Vals Index
综合金融、编程与法律任务,按行业经济权重衡量 Agent 的工作能力
它测什么
Vals Index 是 Vals AI 汇总真实工作任务表现的综合指数,目前采用 v2 版本。它包含金融、编程和法律三个领域:金融看财报研究与 Excel 财务建模,编程看终端任务、应用开发与代码迁移,法律看检索研究和长流程法律工作。
你可以把它理解成一张有不同科目权重的成绩单:先算出每个领域的平均分,再把三个领域合成总分。金融权重最高,所以两个模型即使编程成绩接近,也可能因为财务研究和建模能力不同而拉开总分。
金融由 Finance Agent v2 和 Excel Modeling Benchmark 组成,编程由 Terminal-Bench 2.1、Vibe Code Bench 和 Code Migration 组成,法律由 Legal Research Bench 和 Harvey’s Legal Agent Benchmark 组成。权重参考对应行业在美国 GDP 中的占比:金融与保险 8.0、信息行业 5.6、法律服务 1.2,合计 14.8;归一化后约为 54.1%、37.8% 和 8.1%。
怎么看分数
分数越高,表示在这组任务和权重下的综合表现越好。计算方式为(8 × 金融平均分 + 5.6 × 编程平均分 + 1.2 × 法律平均分)÷ 14.8。例如三个领域分别得 60、80、40 分,综合指数约为 65.9%。它不是所有任务的简单正确率,也不表示已经能替代相同比例的岗位或创造相同比例的 GDP。收录官方标注 2026 年 9 月 11 日更新的 v2 榜单全部 57 条模型成绩,保留官方公布的推理设置;不同版本的组成与权重会变化,不宜直接比较。Code Migration 在此指数中使用固定子集:50 个 CLI 迁移任务和全部 10 个 COBOL 任务,按 75% / 25% 加权,不能直接拿其完整榜单总分替代。表中保留官方综合分,不用本站其他评测的分数重新拼算;来源中的标准误也不作为 95% 置信区间展示。
来源Vals AI
模型表现
Claude Fable 5.1 (max)Anthropic | 68.8%1 |
|---|---|
Claude Opus 5 (max)Anthropic | 67.2%2 |
GPT-6 Astra (max)OpenAI | 66.6%3 |
Claude Fable 5 (max)Anthropic | 66.0%4 |
Muse Spark 1.3 Max (max)Meta | 64.5% |
GPT-5.6 Sol (max)OpenAI | 63.7% |
Gemini 3.8 Flash (high)Google | 62.3% |
Claude Opus 4.8 (max)Anthropic | 60.9% |
Muse Spark 1.3 (xhigh)Meta | 60.3% |
GPT-5.6 Luna (max)OpenAI | 59.9%5 |
Claude Sonnet 5 (max)Anthropic | 59.6% |
GPT-5.6 Terra (max)OpenAI | 59.6%6 |
Gemini 3.7 Flash (high)Google | 59.3% |
Grok 4.6 (high)xAI | 59.2% |
DeepSeek V4.1 Flash (high)DeepSeek | 57.9% |
Kimi K3Moonshot AI | 57.8% |
GPT-5.5 (xhigh)OpenAI | 57.4% |
Muse Spark 1.2 (xhigh)Meta | 57.1% |
GLM-5.3 (max)Z AI | 57.0% |
Claude Opus 4.7 (high)Anthropic | 56.1% |
Gemini 3.6 Flash (high)Google | 55.4% |
Muse Spark 1.1 (xhigh)Meta | 54.8% |
DeepSeek V4 Flash 0731 (high)DeepSeek | 53.6% |
GLM-5.2Z AI | 53.1% |
Gemini 3.5 Flash (high)Google | 53.1% |
DeepSeek V4 Pro 0813 (max)DeepSeek | 52.4% |
Qwen 3.8 MaxAlibaba | 51.8% |
Grok 4.5 (high)xAI | 51.5% |
Claude Sonnet 4.6 (max)Anthropic | 50.6% |
Qwen 3.8 27B (xhigh)Alibaba | 48.5% |
GLM-5.3 Flash (max)Z AI | 47.2% |
Qwen 3.7 MaxAlibaba | 44.8% |
Kimi K2.6Moonshot AI | 43.5% |
DeepSeek V4 Pro (max)DeepSeek | 42.9% |
MiniMax-M3MiniMax | 42.7% |
Gemini 3.1 Pro Preview (02/26) (high)Google | 41.9% |
MiMo V2.5 ProXiaomi | 41.0% |
MiMo V2.5Xiaomi | 39.9% |
GPT 5.4 Mini (xhigh)OpenAI | 39.6% |
Qwen 3.7 PlusAlibaba | 38.6% |
Gemini 3.5 Flash Lite (high)Google | 36.7% |
Inkling (0.99)Thinking Machines | 34.1% |
GPT 5.4 Nano (high)OpenAI | 33.0% |
Qwen 3.6 PlusAlibaba | 32.0% |
Inkling Small (0.99)Thinking Machines | 31.9% |
Gemini 3 Flash (12/25) (high)Google | 29.4% |
Nemotron 3 UltraNVIDIA | 27.4% |
Kimi K2.5Moonshot AI | 26.3% |
MiniMax-M2.7MiniMax | 24.6% |
Grok 4.3 (high)xAI | 24.3% |
Claude Haiku 4.5 (Thinking)Anthropic | 22.9% |
Ling 3.0 FlashAnt Group | 21.7% |
Mistral Medium 3.5 (high)Mistral | 17.9% |
Grok 4.20 (Reasoning)xAI | 17.6% |
Gemini 3.1 Flash Lite Preview (high)Google | 15.5% |
Mercury 2.5 (high)Inception | 13.0% |
Nemotron 3.5 LightningNVIDIA | 11.5% |