Specific Labs 9 月发布 Real-SWE,目标是把「编程智能体能不能干真实工程师的活」这个问题放到真实材料上回答:每个任务都来自该公司从真实企业授权获得的私有生产代码库,是这些公司的工程师实际要处理的问题,带有既有产品该有的全部上下文与复杂度。

为什么不用公开仓库出题

  • 私有代码库天然在分布之外:这些任务在互联网上不存在,几乎不可能被任何模型训练过。报告称企业真实场景里 99% 的 token 从未出现在前沿模型的训练数据中
  • 这些任务对应真实支出:每个任务都直接与花钱相关,原本是发给拿薪水的工程师做的,而不是为了造基准而造
  • 公司特有的工程规范才是门槛:模型经常理解不了企业的编码习惯与代码规范,漏需求、不核实假设

怎么评

Real-SWE 评的是「模型 + 原生工具链」的组合,而不是把模型从工具里拆出来单独看:Codex CLI、Claude Code、Gemini CLI、Grok Build、Muse Code、Kimi Code 各按自己的方式跑。题干描述要做成的变化,具体实现细节留给智能体去代码库和周边工具里发现,因此平均长度 1,742 字符,比 DeepSWE 与 Terminal Bench 略微欠指定,但也不省略必需信息;平均改动文件数 11 个,FrontierCode 与 DeepSWE 是 6 个。任务环境里还包含业务工具与基础设施服务,每个任务只暴露其工作流需要的那几项。

成绩与失败原因

榜单前八名依次是 Fable 5.1(Claude Code)38.8%、GPT-6 Astra(Codex CLI)33.8%、Gemini 3.8 Flash(Gemini CLI)31.2%、GLM 5.3(Claude Code)28.8%、Grok 4.6 与 Muse Spark 1.3(均 23.8%)、Kimi K3(18.8%)、GPT-5.6 Sol(16.2%)。10 个公开样例任务里有 6 个的解决率低于 15%。

失败按提交行为归类后,最常见的一类是「漏掉需求」:Grok 4.6 的失败中有 67.2% 属于此类,Kimi K3 为 53.8%,GLM 5.3 为 38.6%;其次是「基于对系统的猜测动手,而不去工作区检查」——GPT-5.6 Sol 在这类里占其失败的 43.3%;第三类是「思路对但接线接错」。

还有一个值得单独看的数字:10 分钟以内的短回合失败率 71.4%,更长的回合是 73.4%。也就是说,给智能体更多时间并没有换来更高的成功率。

在公开基准上跑分高,不代表能接手你仓库里那张积压的工单。