摘要

AutoSaddler(arXiv 2608.23041)把 agent harness 的改进当作离线学习问题:从执行轨迹的小批量失败信号中挖掘问题,生成把 harness——prompt、工具配置、控制逻辑——当代码来改的结构化补丁,再通过验证挑选更新。在 GAIA2、SWE-Bench Pro、Terminal-Bench 2.0 上分别比基础 harness 提升 9.0、9.6、10.0 个百分点。消融实验显示收益来自两点:深挖式调试优于浅层反思,泛化导向的筛选优于针对单条轨迹的修补。代码已随项目站开源。

为什么重要
对运营 coding agent 的团队来说,harness 正在成为与模型选型同量级的可测量优化对象——而你已经在积累的失败轨迹就是训练数据。方法论可以直接借鉴:诊断失败 run、把 harness 当代码打补丁、只保留在留出任务上验证通过的更新。
技术细节
方法 离线闭环:失败轨迹诊断 -> 结构化补丁生成(harness 即代码)-> 基于验证的更新筛选;按小批量执行轨迹迭代
结果 GAIA2 +9.0pp、SWE-Bench Pro +9.6pp、Terminal-Bench 2.0 +10.0pp(相对基础 harness)
消融 深挖式调试 > 浅层反思;泛化导向筛选 > 单轨迹修补
代码 已随项目网站开源(aka.ms 域名)
隶属 项目站位于 aka.ms(Microsoft 域名);论文页未列机构隶属
ArXiv 2608.23041,2026-08-24 提交
标签
agent-harnesscoding-agentoptimizationexecution-tracesswe-benchresearch