摘要

EarlyEval(arXiv 2609.02783,9 月 3 日周四 digest;SMU)通过提前预测结果来降低 agent 评测成本:基于行为、文本与参考解特征的 LightGBM 成败分类器,在置信度越过校准阈值时终止 agent 运行。在 SWE-bench Verified、TerminalBench 与 Toolathlon 上,它省去 13-26% 的 agent 步骤、最多 44.1% 的输入 token 与 29.4% 的输出 token,准确率 89-97%,而每个 agent 的解决率只被扰动 1-2 个百分点。代码与数据已公开。

为什么重要
agent 评测是真实开支:一次前沿 agent 运行从几美元到几百美元,而其中大部分花在第三步就已注定失败的运行上。对大规模跑 agent 评测的团队,这是即插即省的方案——用 1-2 个百分点的解决率扰动,换 30-40% 的 token 削减。
技术细节
ArXiv 2609.02783,2026 年 9 月 3 日周四 digest 宣告
机构 新加坡管理大学(Yuling Shi、David Lo)
机制 基于行为 / 文本 / 参考解特征的 LightGBM 成败分类器;校准置信度阈值触发提前终止
结果 SWE-bench Verified / TerminalBench / Toolathlon:省去 13-26% agent 步骤;最多省 44.1% 输入 token、29.4% 输出 token;准确率 89-97%;单 agent 解决率扰动 1-2 个百分点
代码 已公开(见 arXiv 页注释)
标签
agent-evaluationcost-reductionearly-stoppingswe-benchtooling