Benchmarks

Terminal-Bench 4.0

Agent 能力:在真实终端里独立完成任务

它测什么

把模型放进一个只有命令行的容器,给它一句任务描述——编译一个项目、修一个 bug、处理一批数据、配好一个服务——然后不再干预。模型要自己敲命令、看输出、改方案,直到任务完成;最后由预先写好的测试脚本判定成败。

分数是解决任务的比例。它测的不是“知道多少”,而是“能不能把事情做完”。

注意成绩属于“模型 + agent 框架”这一组合:同一个模型换成 Claude Code、Codex 或 mini-SWE-agent 跑,结果会不同,所以表里把 agent 标在分数旁。

怎么看分数

解决率百分比,附 95% 置信区间;官方榜与厂商自报可能不同,不同时另加脚注。

来源tbench.ai

模型表现

核对于 6 条成绩

Terminal-Bench 4.0 — 模型表现。选择列标题可排序。
GPT-6 Astra (max)OpenAIAgent · CodexCodex58.2%± 2.8
Claude Fable 5.1 (max)AnthropicAgent · Claude CodeClaude Code57.9%1± 3.8
Claude Opus 5 (max)AnthropicAgent · Claude CodeClaude Code51.8%± 3.4
Claude Fable 5AnthropicAgent · Claude CodeClaude Code44.5%2± 3.8
GLM-5.3 (max)Z AIAgent · Claude CodeClaude Code41.8%± 3.2
GPT-5.6 Sol (max)OpenAIAgent · CodexCodex37.3%± 3.8
  1. Anthropic system card 自报 55.8%。来源
  2. Terminal-Bench 以 max 推理强度运行。

⌘K搜索知识库

最近收录

正在载入知识索引…