摘要

DualViewEval 同时使用最终结果和六类轨迹过程信号,挑出固定大小的 benchmark 子集。只用 20 个任务,它在 APEX-Agents 和 BFCL 上报告了 24 至 40 倍压缩。相对最强基线,平均绝对误差下降 14.5% 至 28.2%,SWE-bench Verified 的排序相关性也有提升。研究覆盖五个 agent benchmark,并做了留出模型家族测试。

为什么重要
对无法为每次发布重跑完整 agent 评测的团队来说,引入过程信号的子集可把偶发审计变成日常 gate。仍应周期性轮换并运行全量套件,因为模型、scaffold 和任务分布变化后,学习得到的子集会老化。代码尚未公开,独立验证成本偏高。
技术细节
方法 联合建模最终结果与六类过程信号关系
子集大小 20
压缩倍数 APEX-Agents 与 BFCL 上 24 至 40 倍
误差下降 相对最强基线,MAE 下降 14.5% 至 28.2%
覆盖 五个 agent benchmark;包含留出 Qwen 家族泛化测试
标签
DualViewEvalagent-evaluationbenchmark-compressiontrajectorySWE-bench