Coding
ProgramBench
从零开发能力:只运行参考程序、阅读文档,重建行为一致的软件
它测什么
ProgramBench 由 Meta Superintelligence Labs、斯坦福大学和哈佛大学的研究者提出,考察 Coding Agent 能否从零设计并实现一个完整程序。它包含 200 个任务,覆盖 jq、ripgrep 这样的命令行工具,也包括 SQLite、FFmpeg 和 PHP 等大型项目,总计使用超过 248,000 个行为测试。
你可以把它想成拿到一台没有设计图的机器:能按按钮、观察输出,也能看说明书,但不能拆开看内部;Agent 要自己摸清它的行为,再造出一个对外表现一致的版本。评测中,Agent 可以运行参考程序,却不能阅读源码、反编译或联网获取实现;编程语言、模块拆分和整体架构都要自己决定,并提交源码与构建脚本。
隐藏测试会给原程序和新实现输入相同的数据,比较它们的行为;只有某个任务的全部测试都通过,这个任务才算完全解决。它与在已有代码库中修 bug、加功能的 DeepSWE 不同,更侧重从空白起步、探索需求和持续验证的能力;目前官方榜单使用 mini-SWE-agent,成绩应理解为模型与这套 Agent 框架组合的表现。
怎么看分数
主指标 Resolved(完全解决率)是通过全部隐藏行为测试的任务占比,不是平均测试通过率。比如 200 个任务中有 9 个全部通过,完全解决率就是 4.5%;即使其他任务各自通过了很多测试,也不能计入这 9 个。Almost(接近解决率)是至少通过 95% 测试的任务占比,包含已完全解决的任务,两列不能相加;它只帮助观察部分进展,不能替代主指标。本页收录官网 2026 年 9 月 9 日更新的 21 条模型配置结果,保留官方推理档位;默认先按完全解决率排序,同分时依次比较接近解决率、平均测试通过率。得分很低反映的是完整复现程序的严格要求,0% 不等于完全不会编程;测试也不能覆盖所有输入,100% 通过不代表已经证明两个程序在所有情况下等价。本站精选阅读中 Factory 的实验只选择了 24 个任务、使用不同运行方式,不能与这里的完整 200 任务官方榜单直接混排。
模型表现
Claude Opus 5 (xhigh)AnthropicAgent · mini-SWE-agent | mini-SWE-agent | 4.5% | 37.0% |
|---|---|---|---|
GPT-5.6 Sol (xhigh)OpenAIAgent · mini-SWE-agent | mini-SWE-agent | 1.0% | 15.5% |
GPT-5.5 (xhigh)OpenAIAgent · mini-SWE-agent | mini-SWE-agent | 0.5% | 13.5% |
GPT 5.5 (high)OpenAIAgent · mini-SWE-agent | mini-SWE-agent | 0.5% | 5.0% |
Gemini 3.6 FlashGoogleAgent · mini-SWE-agent | mini-SWE-agent | 0.5% | 4.0% |
GPT-5.6 SolOpenAIAgent · mini-SWE-agent | mini-SWE-agent | 0.5% | 2.5% |
Claude Opus 4.8 (xhigh)AnthropicAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 16.5% |
GLM-5.2Z AIAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 8.5% |
Gemini 3.7 FlashGoogleAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 5.5% |
Claude Opus 4.7 (xhigh)AnthropicAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 4.5% |
Gemini 3.5 FlashGoogleAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 3.0% |
Claude Opus 4.7AnthropicAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 3.0% |
Claude Opus 4.6AnthropicAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 2.5% |
GPT 5.5OpenAIAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 1.5% |
Claude Sonnet 4.6AnthropicAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 1.0% |
GPT 5.4OpenAIAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 0.0% |
Gemini 3.1 ProGoogleAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 0.0% |
Gemini 3 FlashGoogleAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 0.0% |
Claude Haiku 4.5AnthropicAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 0.0% |
GPT 5.4 miniOpenAIAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 0.0% |
GPT 5 miniOpenAIAgent · mini-SWE-agent | mini-SWE-agent | 0.0% | 0.0% |