摘要
RealSWE(arXiv 2608.27831,2026-08-31 digest 宣告)把 SWE-chat 的真实用户提示与 SWE-bench Verified / Pro 的问题陈述做对比:只带一句问题描述的请求占真实提示的 88%,却只占基准题目的 7%;87% 的真实提示是随口写的,而 94% 的基准题目是正式行文。论文提出六类信息分类与四个语言风格维度,并用程序化组合任务构造了覆盖真实请求分布的 RealSWE 基准。
为什么重要
如果你用 SWE-bench 分数决定 agent 的上线节奏,这篇论文量化了你实际承受的分布偏移:真实用户提交的是短、随意、信息不足的请求,这时「会追问、会找信息」比「能消化长 issue」更重要。建议用它的信息分类自查内部评测集,别把 SWE-bench 的涨落直接当成线上表现的预测。
技术细节
| ArXiv | 2608.27831,2026-08-28 提交(8 月 31 日周一日刊) |
|---|---|
| 关键数字 | 只带问题描述的请求:真实提示 88% vs 基准题目 7%;随意行文:真实 87% vs 基准 94% 为正式行文 |
| 方法 | 六类信息分类 + 四个语言风格维度,应用于 SWE-chat 真实提示与 SWE-bench Verified/Pro 问题陈述;RealSWE 用程序化组合任务覆盖真实请求分布 |
| 代码 | 论文附基准发布(组合式任务生成) |
标签
evaluationcoding-agentbenchmarkswe-benchdistribution-shift