摘要

研究者用逐题判定结果审计 254 个 SWE-bench 提交,覆盖四个 split。在 Verified 上,前 30 名的 29 组相邻结果没有一组能被精确配对检验区分。前十名共同解出 285 题、共同失败 51 题,只剩 164 题提供区分信息。固定模型后,不同 scaffold 的观测差距最高达 29.8 分,大于前 30 名整体 8.8 分的跨度。

为什么重要
对选择 coding agent 的团队来说,排行榜上的小分差不足以支撑采购决策。应在自有工作负载上比较 model-scaffold 组合,报告配对不确定性,并用分层而不是严格名次表达结果。公开的审计流水线无需重跑模型即可复核这些判断。
技术细节
数据集 Verified、Lite、Test 与 Multimodal 共 254 个公开提交
Verified 前十 共同成功 285 题;共同失败 51 题;可区分题目 164 个
配对检验 前 30 名的 29 组相邻结果在 alpha 0.05 下均不可区分
Scaffold 影响 固定模型后的观测跨度最高 29.8 个百分点
产物 公开冻结输入、脚本、规范化设计和分层结果
局限 观察性审计;无法拒绝差异不等于证明等价
标签
coding-agentSWE-benchevaluationbenchmarkscaffold