摘要

自动 harness 演化通常把每个候选修改在固定任务集上全部打分,总分容易掩盖局部回归。HarnessLens 改为联合探索任务空间与用户可配置组件,从执行轨迹导出候选修改,再通过可归因证据门只在与行为相关的任务上验证候选。在 3 个 agent harness、4 个 benchmark 上,留出集平均性能提升 7.6-13.6%,评估预算显著低于 propose-and-verify 基线。代码已在 GitHub 开源。

为什么重要
这是一周内第二个独立结果(8/26 的 AutoSaddler 之后)证明 harness 是可测量的优化对象,新贡献在成本:评估很贵时,行为感知的验证让演化循环负担得起。可归因证据门值得直接搬进自己的「评估驱动 prompt / 工具调优」循环。
技术细节
方法 任务空间 + 用户可配置组件联合探索;轨迹导出候选;可归因证据门选出行为相关任务做选择性验证
结果 3 个 harness x 4 个 benchmark,留出集平均 +7.6-13.6%,评估预算显著低于 propose-and-verify 基线
关联 与 AutoSaddler(arXiv 2608.23041,8/26)在「harness 即优化对象」上收敛;差异在预算感知验证
代码 https://github.com/jhxu5214/HarnessLens
ArXiv 2608.27311,2026-08-27 提交
标签
agent-harnesscoding-agentoptimizationevaluationresearch