Benchmarks

DeepSWE v1.1

软件工程能力:在真实代码库中完成长流程、多文件的开发任务

它测什么

DeepSWE 是 Datacurve 发布的软件工程评测,考察编程 Agent 能否读懂已有项目、规划修改并完成可验收的开发工作。它包含 113 个原创任务,覆盖 91 个代码仓库,以及 TypeScript、JavaScript、Python、Go 和 Rust 五种语言。

任务不仅是修 bug,也包括添加功能、扩展 API 和处理复杂行为;例如为命令行工具增加配置文件支持,或为 XML 库实现差异比较与补丁操作。题目由作者从头设计,而非直接改编已有提交或 PR,目的是降低模型见过参考答案的可能性,但这不等于代码仓库本身从未出现在训练数据中。

官方榜单统一使用 mini-swe-agent,让模型在相同 Agent 框架下完成任务,并通过行为测试验收。v1.1 只提取 Agent 提交的代码补丁,在独立容器内运行验证;同时隐藏起点之后的 Git 历史,降低修改测试环境或寻找后续实现来绕过评测的风险。

它适合参考模型处理复杂工程需求的能力;真实使用中的成绩仍会受 Agent 框架、推理档位和任务领域影响。

怎么看分数

Pass@1 是单次尝试的任务通过率,越高越好;重复运行用来估计成绩波动,不表示允许多次尝试后取成功。本页收录官方 v1.1 默认 Best 视图中的 21 款模型,每款保留该视图下成绩最好的推理档位,档位写在模型名后。数值由官方数据换算为百分比并保留一位小数;± 为四轮整套评测之间波动估计的 95% 置信区间半宽,单位为百分点,并非任务抽样区间。部分配置的有效尝试数不足 452 次,成绩应按官方统计口径解读;小幅差距不代表稳定领先。此快照对应官方标注的 2026 年 9 月 3 日更新,不与 v1 分数混用。

来源Datacurve · DeepSWE

模型表现

核对于 21 条成绩

DeepSWE v1.1 — 模型表现。选择列标题可排序。
GPT-6 Astra (xhigh)OpenAIAgent · mini-swe-agent
mini-swe-agent74.1%± 2.9
Gemini 3.8 Flash (high)GoogleAgent · mini-swe-agent
mini-swe-agent73.8%± 1.4
Claude Opus 5 (max)AnthropicAgent · mini-swe-agent
mini-swe-agent73.6%± 3.9
GPT-5.6 Sol (max)OpenAIAgent · mini-swe-agent
mini-swe-agent72.7%± 2.8
Claude Fable 5 (xhigh)AnthropicAgent · mini-swe-agent
mini-swe-agent69.9%1± 3.2
GLM-5.3 (max)Z AIAgent · mini-swe-agent
mini-swe-agent69.0%± 3
Kimi K3 (max)Moonshot AIAgent · mini-swe-agent
mini-swe-agent68.5%± 4.5
Grok 4.6 (medium)xAIAgent · mini-swe-agent
mini-swe-agent67.5%± 2.3
GPT-5.6 Luna (max)OpenAIAgent · mini-swe-agent
mini-swe-agent67.2%± 4
GPT-5.5 (xhigh)OpenAIAgent · mini-swe-agent
mini-swe-agent67.0%± 6.5
Gemini 3.7 Flash (medium)GoogleAgent · mini-swe-agent
mini-swe-agent65.5%± 3.1
GLM-5.3 Flash (max)Z AIAgent · mini-swe-agent
mini-swe-agent63.4%± 4.4
DeepSeek V4 Pro (max)DeepSeekAgent · mini-swe-agent
mini-swe-agent62.8%± 6.3
Claude Opus 4.8 (max)AnthropicAgent · mini-swe-agent
mini-swe-agent59.0%± 1.8
Qwen3.8 Max (xhigh)AlibabaAgent · mini-swe-agent
mini-swe-agent57.5%± 2.7
Muse Spark 1.2 (xhigh)MetaAgent · mini-swe-agent
mini-swe-agent54.9%± 2.1
Claude Sonnet 5 (max)AnthropicAgent · mini-swe-agent
mini-swe-agent53.8%± 4.2
DeepSeek V4 Flash (max)DeepSeekAgent · mini-swe-agent
mini-swe-agent53.3%± 3.6
Gemini 3.6 Flash (high)GoogleAgent · mini-swe-agent
mini-swe-agent46.7%± 3.7
GLM-5.2 (max)Z AIAgent · mini-swe-agent
mini-swe-agent43.8%± 1.7
Gemini 3.5 Flash (high)GoogleAgent · mini-swe-agent
mini-swe-agent36.1%± 4
  1. 官方注明 Claude Fable 5 全部档位共 2,260 次试验中有 73 次因访问中断未完成,通过率按已完成试验计算。本页 xhigh 档位对应 452 次尝试;不要把全档位的缺失数当作此行的缺失数。来源

⌘K搜索知识库

最近收录

正在载入知识索引…