摘要
研究者用逐题判定结果审计 254 个 SWE-bench 提交,覆盖四个 split。在 Verified 上,前 30 名的 29 组相邻结果没有一组能被精确配对检验区分。前十名共同解出 285 题、共同失败 51 题,只剩 164 题提供区分信息。固定模型后,不同 scaffold 的观测差距最高达 29.8 分,大于前 30 名整体 8.8 分的跨度。
为什么重要
对选择 coding agent 的团队来说,排行榜上的小分差不足以支撑采购决策。应在自有工作负载上比较 model-scaffold 组合,报告配对不确定性,并用分层而不是严格名次表达结果。公开的审计流水线无需重跑模型即可复核这些判断。
技术细节
| 数据集 | Verified、Lite、Test 与 Multimodal 共 254 个公开提交 |
|---|---|
| Verified 前十 | 共同成功 285 题;共同失败 51 题;可区分题目 164 个 |
| 配对检验 | 前 30 名的 29 组相邻结果在 alpha 0.05 下均不可区分 |
| Scaffold 影响 | 固定模型后的观测跨度最高 29.8 个百分点 |
| 产物 | 公开冻结输入、脚本、规范化设计和分层结果 |
| 局限 | 观察性审计;无法拒绝差异不等于证明等价 |
标签
coding-agentSWE-benchevaluationbenchmarkscaffold