摘要

《Harbor Adapters and Harbor-Index》(arXiv 2609.04298,9 月 7 日周一 digest)是 agent 基准的统一评测基础设施:适配器把 80 多个基准移植到对任意 agent 可评测,并经代码评审与一致性实验验证。基于它,作者在 54 个基准上跑了 8 个跨能力档的模型,每个模型分别用 Terminus-2 和 3 个原生 harness 之一——由此得出比以往更宽的 agent 能力与失败模式分析。Harbor-Index 把适配套件蒸馏成 82 个跨 29 个基准的高难度、高多样性、高质量任务(难度过滤 + AI 与人工审计 + 审计-修复循环):保留大规模 agent 评测的挑战性与广度,同时跑得起——没有任何被测模型-harness 组合能 saturate 它。

为什么重要
agent 评测世界的碎片化税是真的:每个基准都自带环境和集成。80 多个带一致性验证的适配器是迄今最大的标准化工程,82 任务的 Harbor-Index 校准到在前沿水平仍有区分度、又便宜到可以日常跑——正是平台团队需要的常驻回归套件。值得注意的是,terminal-bench 的统一数据集已经放在 GitHub 的 harborframework 组织下(在 GLM-5.3 的评测元数据 PR 中可见),生态采用已经启动。
技术细节
适配器 80 多个基准移植到对任意 agent 可评测;经代码评审与一致性实验验证
评测 8 个跨能力档模型 x 54 个基准;每个模型用 Terminus-2 与 3 个原生 harness 之一
Harbor-Index 82 个任务、跨 29 个基准;难度过滤 + AI/人工审计 + 审计-修复循环;跑得起;无被测组合能饱和
生态 terminal-bench 统一数据集位于 GitHub harborframework 组织下(GLM-5.3 评测元数据 PR 中引用)
标签
agent-evaluationbenchmarkevaluation-infrastructureharnessharbor