Benchmarks

Coding

ProgramBench

从零开发能力:只运行参考程序、阅读文档,重建行为一致的软件

它测什么

ProgramBench 由 Meta Superintelligence Labs、斯坦福大学和哈佛大学的研究者提出,考察 Coding Agent 能否从零设计并实现一个完整程序。它包含 200 个任务,覆盖 jq、ripgrep 这样的命令行工具,也包括 SQLite、FFmpeg 和 PHP 等大型项目,总计使用超过 248,000 个行为测试。

你可以把它想成拿到一台没有设计图的机器:能按按钮、观察输出,也能看说明书,但不能拆开看内部;Agent 要自己摸清它的行为,再造出一个对外表现一致的版本。评测中,Agent 可以运行参考程序,却不能阅读源码、反编译或联网获取实现;编程语言、模块拆分和整体架构都要自己决定,并提交源码与构建脚本。

隐藏测试会给原程序和新实现输入相同的数据,比较它们的行为;只有某个任务的全部测试都通过,这个任务才算完全解决。它与在已有代码库中修 bug、加功能的 DeepSWE 不同,更侧重从空白起步、探索需求和持续验证的能力;目前官方榜单使用 mini-SWE-agent,成绩应理解为模型与这套 Agent 框架组合的表现。

怎么看分数

主指标 Resolved(完全解决率)是通过全部隐藏行为测试的任务占比,不是平均测试通过率。比如 200 个任务中有 9 个全部通过,完全解决率就是 4.5%;即使其他任务各自通过了很多测试,也不能计入这 9 个。Almost(接近解决率)是至少通过 95% 测试的任务占比,包含已完全解决的任务,两列不能相加;它只帮助观察部分进展,不能替代主指标。本页收录官网 2026 年 9 月 9 日更新的 21 条模型配置结果,保留官方推理档位;默认先按完全解决率排序,同分时依次比较接近解决率、平均测试通过率。得分很低反映的是完整复现程序的严格要求,0% 不等于完全不会编程;测试也不能覆盖所有输入,100% 通过不代表已经证明两个程序在所有情况下等价。本站精选阅读中 Factory 的实验只选择了 24 个任务、使用不同运行方式,不能与这里的完整 200 任务官方榜单直接混排。

来源ProgramBench · Meta / Stanford / Harvard

延伸阅读:Factory 如何让 Coding Agent 完成大型软件任务

模型表现

核对于 21 条成绩

ProgramBench — 模型表现。选择列标题可排序。
Claude Opus 5 (xhigh)AnthropicAgent · mini-SWE-agent
mini-SWE-agent4.5%37.0%
GPT-5.6 Sol (xhigh)OpenAIAgent · mini-SWE-agent
mini-SWE-agent1.0%15.5%
GPT-5.5 (xhigh)OpenAIAgent · mini-SWE-agent
mini-SWE-agent0.5%13.5%
GPT 5.5 (high)OpenAIAgent · mini-SWE-agent
mini-SWE-agent0.5%5.0%
Gemini 3.6 FlashGoogleAgent · mini-SWE-agent
mini-SWE-agent0.5%4.0%
GPT-5.6 SolOpenAIAgent · mini-SWE-agent
mini-SWE-agent0.5%2.5%
Claude Opus 4.8 (xhigh)AnthropicAgent · mini-SWE-agent
mini-SWE-agent0.0%16.5%
GLM-5.2Z AIAgent · mini-SWE-agent
mini-SWE-agent0.0%8.5%
Gemini 3.7 FlashGoogleAgent · mini-SWE-agent
mini-SWE-agent0.0%5.5%
Claude Opus 4.7 (xhigh)AnthropicAgent · mini-SWE-agent
mini-SWE-agent0.0%4.5%
Gemini 3.5 FlashGoogleAgent · mini-SWE-agent
mini-SWE-agent0.0%3.0%
Claude Opus 4.7AnthropicAgent · mini-SWE-agent
mini-SWE-agent0.0%3.0%
Claude Opus 4.6AnthropicAgent · mini-SWE-agent
mini-SWE-agent0.0%2.5%
GPT 5.5OpenAIAgent · mini-SWE-agent
mini-SWE-agent0.0%1.5%
Claude Sonnet 4.6AnthropicAgent · mini-SWE-agent
mini-SWE-agent0.0%1.0%
GPT 5.4OpenAIAgent · mini-SWE-agent
mini-SWE-agent0.0%0.0%
Gemini 3.1 ProGoogleAgent · mini-SWE-agent
mini-SWE-agent0.0%0.0%
Gemini 3 FlashGoogleAgent · mini-SWE-agent
mini-SWE-agent0.0%0.0%
Claude Haiku 4.5AnthropicAgent · mini-SWE-agent
mini-SWE-agent0.0%0.0%
GPT 5.4 miniOpenAIAgent · mini-SWE-agent
mini-SWE-agent0.0%0.0%
GPT 5 miniOpenAIAgent · mini-SWE-agent
mini-SWE-agent0.0%0.0%

⌘K搜索知识库

最近收录

正在载入知识索引…