摘要
自动 harness 演化通常把每个候选修改在固定任务集上全部打分,总分容易掩盖局部回归。HarnessLens 改为联合探索任务空间与用户可配置组件,从执行轨迹导出候选修改,再通过可归因证据门只在与行为相关的任务上验证候选。在 3 个 agent harness、4 个 benchmark 上,留出集平均性能提升 7.6-13.6%,评估预算显著低于 propose-and-verify 基线。代码已在 GitHub 开源。
为什么重要
这是一周内第二个独立结果(8/26 的 AutoSaddler 之后)证明 harness 是可测量的优化对象,新贡献在成本:评估很贵时,行为感知的验证让演化循环负担得起。可归因证据门值得直接搬进自己的「评估驱动 prompt / 工具调优」循环。
技术细节
| 方法 | 任务空间 + 用户可配置组件联合探索;轨迹导出候选;可归因证据门选出行为相关任务做选择性验证 |
|---|---|
| 结果 | 3 个 harness x 4 个 benchmark,留出集平均 +7.6-13.6%,评估预算显著低于 propose-and-verify 基线 |
| 关联 | 与 AutoSaddler(arXiv 2608.23041,8/26)在「harness 即优化对象」上收敛;差异在预算感知验证 |
| 代码 | https://github.com/jhxu5214/HarnessLens |
| ArXiv | 2608.27311,2026-08-27 提交 |
标签
agent-harnesscoding-agentoptimizationevaluationresearch