DeepSWE

基本信息

  • 是什么:长程软件工程(Long-Horizon SWE)基准,专测前沿编程 Agent 在原创工程任务上的真实能力
  • 榜单 v1.1:113 任务 / 91 仓库 / 5 种语言 / 28 个模型
  • 官方更新日期:2026-09-22(原笔记写 2026-09-03,已过时)
  • 名字来源:Agentica 2025-07 发布的 DeepSWE-Preview——32B、纯强化学习(RL)训练的软件工程智能体(SWE-Bench Verified 59%,开源权重第一),同名基准延续其名

核心特点(官方口径)

  • 无污染:任务从零编写,不改编自既有 commit/PR,模型预训练时没见过答案
  • 高多样性:任务横跨 91 个仓库、5 种语言
  • 真实复杂度:提示词只有 SWE-bench Pro 一半长(约 2 倍输出 token),但解法工作量约为其 5.5 倍
  • 程序化终态评分:手写验证器测软件行为而非实现细节

2026-10-02 当前榜单(重要更正)

模型分数
gpt-6-astra74% ±3%
gemini-3.8-flash74% ±1%
claude-opus-574% ±4%
gpt-6-luna67% ±4%
deepseek-v4-pro63%
glm-5.3-flash63% ±4%
deepseek-v4-flash53%

两条原日记引用的分数查无实据:

  • 「DeepSeek V4.1 Flash 74.2%」——当前 v1.1 榜无此条目,deepseek-v4-flash 实际为 53%
  • 「Step-5 67.7%」——当前榜无 Step-5

两家并列 74% 之后,[[Step-5]] 的分数需按官网 Step Code Bench 口径引用,不要与 DeepSWE 混用。

官方链接

相关笔记

相关日记