摘要

EVOHARNESSBENCH(arXiv 2609.04280,9 月 7 日周一 digest)是评测受控 harness 演进下 agent 表现的基准——把非平稳性从任务流(持续学习类 agent 基准的惯例)移到外部供给的 harness 本身(工具、技能、agent 三轴)。它包含 17 条由可验证基准确定性地构建的多阶段 harness 流:802 个任务、520 个工具、42 个技能、62 个 agent。两个互补设定分离核心挑战:部署评测(harness 扩张时既有能力是否存活)与自演化适应评测(积累的经验能否迁移到未见过的 harness 配置)。

为什么重要
每个在发 agent 平台的团队都在每周加工具;这是针对由此产生的回归类别——harness 长大时悄悄丢掉的能力——的第一个受控测量工具,另一个方向也测:在一种 harness 配置上攒的经验,平台下次更新后还管不管用。确定性流构建(基于可验证器)意味着它可以作为 harness 变更的金丝雀跑进 CI——这正是 AutoSaddler/HarnessLens 类发现应该被落地的方式。
技术细节
构建 17 条由可验证基准确定性构建的多阶段 harness 流;三轴:工具、技能、agent
规模 802 任务、520 工具、42 技能、62 agent
设定 部署评测(harness 扩张时既有能力存活)+ 自演化适应评测(经验迁移到未见 harness 配置)
标签
agent-evaluationharnesscontinual-learningbenchmarkregression-testing