DeepSWE v1.1
软件工程能力:在真实代码库中完成长流程、多文件的开发任务
它测什么
DeepSWE 是 Datacurve 发布的软件工程评测,考察编程 Agent 能否读懂已有项目、规划修改并完成可验收的开发工作。它包含 113 个原创任务,覆盖 91 个代码仓库,以及 TypeScript、JavaScript、Python、Go 和 Rust 五种语言。
任务不仅是修 bug,也包括添加功能、扩展 API 和处理复杂行为;例如为命令行工具增加配置文件支持,或为 XML 库实现差异比较与补丁操作。题目由作者从头设计,而非直接改编已有提交或 PR,目的是降低模型见过参考答案的可能性,但这不等于代码仓库本身从未出现在训练数据中。
官方榜单统一使用 mini-swe-agent,让模型在相同 Agent 框架下完成任务,并通过行为测试验收。v1.1 只提取 Agent 提交的代码补丁,在独立容器内运行验证;同时隐藏起点之后的 Git 历史,降低修改测试环境或寻找后续实现来绕过评测的风险。
它适合参考模型处理复杂工程需求的能力;真实使用中的成绩仍会受 Agent 框架、推理档位和任务领域影响。
怎么看分数
Pass@1 是单次尝试的任务通过率,越高越好;重复运行用来估计成绩波动,不表示允许多次尝试后取成功。本页收录官方 v1.1 默认 Best 视图中的 21 款模型,每款保留该视图下成绩最好的推理档位,档位写在模型名后。数值由官方数据换算为百分比并保留一位小数;± 为四轮整套评测之间波动估计的 95% 置信区间半宽,单位为百分点,并非任务抽样区间。部分配置的有效尝试数不足 452 次,成绩应按官方统计口径解读;小幅差距不代表稳定领先。此快照对应官方标注的 2026 年 9 月 3 日更新,不与 v1 分数混用。
模型表现
GPT-6 Astra (xhigh)OpenAIAgent · mini-swe-agent | mini-swe-agent | 74.1%± 2.9 |
|---|---|---|
Gemini 3.8 Flash (high)GoogleAgent · mini-swe-agent | mini-swe-agent | 73.8%± 1.4 |
Claude Opus 5 (max)AnthropicAgent · mini-swe-agent | mini-swe-agent | 73.6%± 3.9 |
GPT-5.6 Sol (max)OpenAIAgent · mini-swe-agent | mini-swe-agent | 72.7%± 2.8 |
Claude Fable 5 (xhigh)AnthropicAgent · mini-swe-agent | mini-swe-agent | 69.9%1± 3.2 |
GLM-5.3 (max)Z AIAgent · mini-swe-agent | mini-swe-agent | 69.0%± 3 |
Kimi K3 (max)Moonshot AIAgent · mini-swe-agent | mini-swe-agent | 68.5%± 4.5 |
Grok 4.6 (medium)xAIAgent · mini-swe-agent | mini-swe-agent | 67.5%± 2.3 |
GPT-5.6 Luna (max)OpenAIAgent · mini-swe-agent | mini-swe-agent | 67.2%± 4 |
GPT-5.5 (xhigh)OpenAIAgent · mini-swe-agent | mini-swe-agent | 67.0%± 6.5 |
Gemini 3.7 Flash (medium)GoogleAgent · mini-swe-agent | mini-swe-agent | 65.5%± 3.1 |
GLM-5.3 Flash (max)Z AIAgent · mini-swe-agent | mini-swe-agent | 63.4%± 4.4 |
DeepSeek V4 Pro (max)DeepSeekAgent · mini-swe-agent | mini-swe-agent | 62.8%± 6.3 |
Claude Opus 4.8 (max)AnthropicAgent · mini-swe-agent | mini-swe-agent | 59.0%± 1.8 |
Qwen3.8 Max (xhigh)AlibabaAgent · mini-swe-agent | mini-swe-agent | 57.5%± 2.7 |
Muse Spark 1.2 (xhigh)MetaAgent · mini-swe-agent | mini-swe-agent | 54.9%± 2.1 |
Claude Sonnet 5 (max)AnthropicAgent · mini-swe-agent | mini-swe-agent | 53.8%± 4.2 |
DeepSeek V4 Flash (max)DeepSeekAgent · mini-swe-agent | mini-swe-agent | 53.3%± 3.6 |
Gemini 3.6 Flash (high)GoogleAgent · mini-swe-agent | mini-swe-agent | 46.7%± 3.7 |
GLM-5.2 (max)Z AIAgent · mini-swe-agent | mini-swe-agent | 43.8%± 1.7 |
Gemini 3.5 Flash (high)GoogleAgent · mini-swe-agent | mini-swe-agent | 36.1%± 4 |