摘要

SWE-Gate(arXiv 2609.04167,9 月 4 日周五 digest,cs.AI)是 303 个仓库级修复实例的基准,覆盖 75 个开源 Python 仓库,每个实例带从真实 PR 评审意见中提炼的评审约束,并把功能正确性与约束合规分开度量——独立的功能测试与约束测试,外加不合规补丁与黄金补丁。在统一脚手架、四个 LLM 底座下:644 个通过功能测试的修复中,221 个过不了评审约束。复现包已公开。

为什么重要
「测试通过」是当前 coding agent 的验收线,这个基准把这条线离「人类会接受这个补丁」有多远量化出来了——三分之一。让 agent 写代码的团队应该在自己的评测 harness 里加上约束式检查(从自己的评审惯例提炼);基准本身及其不合规 / 黄金补丁对可以直接用。
技术细节
ArXiv 2609.04167,2026 年 9 月 4 日周五 digest 宣告(cs.AI 池)
基准 303 个仓库级修复实例,75 个开源 Python 仓库;评审约束提炼自真实 PR 评审意见
设计 功能正确性与约束合规独立度量;附不合规补丁与黄金补丁
结果 统一脚手架、4 个 LLM 底座:644 个功能通过的修复中 221 个违反评审约束(约 34%)
代码 复现包公开于 github.com/DeepSoftwareAnalytics
标签
coding-agentevaluationbenchmarkcode-reviewswe