Terminal-Bench 4.0
Agent 能力:在真实终端里独立完成任务
它测什么
把模型放进一个只有命令行的容器,给它一句任务描述——编译一个项目、修一个 bug、处理一批数据、配好一个服务——然后不再干预。模型要自己敲命令、看输出、改方案,直到任务完成;最后由预先写好的测试脚本判定成败。
分数是解决任务的比例。它测的不是“知道多少”,而是“能不能把事情做完”。
注意成绩属于“模型 + agent 框架”这一组合:同一个模型换成 Claude Code、Codex 或 mini-SWE-agent 跑,结果会不同,所以表里把 agent 标在分数旁。
怎么看分数
解决率百分比,附 95% 置信区间;官方榜与厂商自报可能不同,不同时另加脚注。
模型表现
| GPT-6 Astra (max)OpenAIAgent · Codex | Codex | 58.2%± 2.8 |
|---|---|---|
| Claude Fable 5.1 (max)AnthropicAgent · Claude Code | Claude Code | 57.9%1± 3.8 |
| Claude Opus 5 (max)AnthropicAgent · Claude Code | Claude Code | 51.8%± 3.4 |
| Claude Fable 5AnthropicAgent · Claude Code | Claude Code | 44.5%2± 3.8 |
| GLM-5.3 (max)Z AIAgent · Claude Code | Claude Code | 41.8%± 3.2 |
| GPT-5.6 Sol (max)OpenAIAgent · Codex | Codex | 37.3%± 3.8 |