摘要
AutoSaddler(arXiv 2608.23041)把 agent harness 的改进当作离线学习问题:从执行轨迹的小批量失败信号中挖掘问题,生成把 harness——prompt、工具配置、控制逻辑——当代码来改的结构化补丁,再通过验证挑选更新。在 GAIA2、SWE-Bench Pro、Terminal-Bench 2.0 上分别比基础 harness 提升 9.0、9.6、10.0 个百分点。消融实验显示收益来自两点:深挖式调试优于浅层反思,泛化导向的筛选优于针对单条轨迹的修补。代码已随项目站开源。
为什么重要
对运营 coding agent 的团队来说,harness 正在成为与模型选型同量级的可测量优化对象——而你已经在积累的失败轨迹就是训练数据。方法论可以直接借鉴:诊断失败 run、把 harness 当代码打补丁、只保留在留出任务上验证通过的更新。
技术细节
| 方法 | 离线闭环:失败轨迹诊断 -> 结构化补丁生成(harness 即代码)-> 基于验证的更新筛选;按小批量执行轨迹迭代 |
|---|---|
| 结果 | GAIA2 +9.0pp、SWE-Bench Pro +9.6pp、Terminal-Bench 2.0 +10.0pp(相对基础 harness) |
| 消融 | 深挖式调试 > 浅层反思;泛化导向筛选 > 单轨迹修补 |
| 代码 | 已随项目网站开源(aka.ms 域名) |
| 隶属 | 项目站位于 aka.ms(Microsoft 域名);论文页未列机构隶属 |
| ArXiv | 2608.23041,2026-08-24 提交 |
标签
agent-harnesscoding-agentoptimizationexecution-tracesswe-benchresearch