摘要

《Calibration is the Bottleneck》(arXiv 2609.00949,9 月 2 日周三 digest)把多轮工具调用失效分解为两个正交模式(在 TOOL_CALL / ASK / REFUSE / CONFIRM 四类动作空间上):动作类型失准(miscalibration)与动作执行失败。论文引入自揭示上界 Acc <= GAR(Gold Action Recall),越界即暴露 state-grader 对失准的掩盖。背景是:在公开工具调用基准上,开源权重模型的总准确率已接近甚至超过闭源前沿模型,但总分会把截然不同的多轮情形平均掉。

为什么重要
对做工具型 agent 的团队,这给了一个可以直接套在自己轨迹上的分解:把「选错了动作类型」(调用 / 追问 / 拒绝 / 确认)与「选对了但执行得差」分开。总分完全掩盖第一种失效,而论文的上界提供了一种廉价审计——如果 grader 只看状态,失准的模型会被高估。这个区分直接对应投入方向:校准问题靠提示与选择策略,执行问题靠工具的人机工学。
技术细节
ArXiv 2609.00949,2026 年 9 月 2 日周三 digest 宣告
框架 四类动作空间(TOOL_CALL / ASK / REFUSE / CONFIRM);失效分解为动作类型失准与动作执行失败
诊断 自揭示上界 Acc <= GAR(Gold Action Recall);越界(Acc > GAR)即暴露 state-grader 对失准的掩盖
背景 开源权重模型在公开工具调用基准的总准确率已接近甚至超过闭源前沿模型,掩盖了各情形间的不均衡
标签
tool-callingevaluationagent-reliabilitycalibrationdiagnostics