摘要
Specific Labs 推出 Real-SWE:任务「取材或直接摘自」真实公司授权的生产代码库,对前沿 coding agent 做原生分布外评测——用公开仓库训练的模型不可能预先见过这些代码。任务在隔离沙箱中运行,按需暴露所需服务(PostgreSQL、AWS 模拟器、Kubernetes、Slack、Linear MCP、Intercom),并用各代码库自身测试套件构造的 verifier(Harbor 格式)评分。每个模型搭配原生 harness(Claude Code、Codex CLI、Gemini CLI),分数是「模型+harness」组合而非孤立模型;解决率为每任务 8 次独立运行的 pass@1 均值,附 95% 置信区间。公开的 10 任务样本中,Fable 5.1 + Claude Code 以 38.8% 领先,其后是 GPT-6 Astra + Codex CLI(33.8%)、Gemini 3.8 Flash + Gemini CLI(31.2%)、GLM 5.3 + Claude Code(28.8%);10 个任务里 6 个解决率低于 15%,最常见失败模式是漏掉需求。样本需申请访问。
为什么重要
污染已经是公开 coding benchmark 的硬约束,Real-SWE 从结构上解决它:私有授权代码 + 公司内部约定 + 代码库自有测试套件,让刷榜式记忆失效。对做模型选型的团队,它也是少数按「实际会用的 harness」打分、并随解决率一起公布单次 rollout 成本($2.50-$6.96)的评测——这就是内部采购评测该有的样子。注意边界:公开样本仅 10 个任务、语料不开放、榜单由厂商运营,排序在更多任务开放前只能作方向参考。
技术细节
| 运营方 | Specific Labs(withspecific.com);页面标注 September 2026;2026-09-12 经 HN 首次进入视野(item 49676820,78 分) |
|---|---|
| 方法 | 任务取材或直接摘自授权生产代码库;每任务隔离沙箱按需暴露服务(PostgreSQL、AWS 模拟器、Kubernetes、Slack、Linear MCP、Intercom);评分时注入由代码库自身测试套件构造的 verifier(Harbor 格式);使用原生 harness(Claude Code、Codex CLI、Gemini CLI);解决率 = 每任务 8 次独立运行的 pass@1 均值,附 95% 置信区间 |
| 任务形态 | 指令中位长度 1,742 字符;参考解中位修改 11 个文件(FrontierCode 与 DeepSWE 为 6) |
| 样本结果 | 10 任务样本解决率:Fable 5.1 + Claude Code 38.8%;GPT-6 Astra + Codex CLI 33.8%;Gemini 3.8 Flash + Gemini CLI 31.2%;GLM 5.3 + Claude Code 28.8%;Grok 4.6 与 Muse Spark 1.3 各 23.8%;Kimi K3 18.8%;GPT-5.6 Sol 16.2%;10 个任务中 6 个低于 15%;最难任务(analytics stream reducer)0.0%,最易(multi-region sweep)67.2% |
| 失败模式 | 漏掉需求最常见;不同运行时长失败率接近(10 分钟内 71.4% vs 更长 73.4%) |
| 成本 | 单次 rollout 估算 $2.50(Gemini 3.8 Flash)至 $6.96(Fable 5.1) |
| 访问 | 不开放;10 任务样本需在站点申请;代码库为私有财产 |
标签
benchmarksweevaluationcontaminationenterprisecoding-agents