摘要

AgentWeave(arXiv 2608.23078)是一个确定性的推理前路由层:在下游模型不变的前提下,先用资格、需求、能力与路由信号过滤候选工具集,再做 function calling。在 48 个全新 BFCL V4 多函数任务上(冻结的 Hammer2.1-1.5b 模型),它取得 6/48 成功,而全量工具、随机 top-8、语义 top-8 三个基线均为 0/48(McNemar p=0.03125);同时少暴露 70.18% 的工具、少用 61.70% 的输入 token、平均本地推理延迟降低 50.95%。作者自己将其定位为 BFCL 衍生的路由压力测试,不是榜单结果,绝对成功率仍然很低。

为什么重要
在 agent 动辄面对数百个 MCP 工具的当下,工具目录膨胀是真实的成本项,这里的 token 与延迟削减幅度可观。但结论只能当方向看:48 个任务加一个冻结的 1.5b 模型是压力测试而不是生产证据;更有价值的警示是语义 top-8 的 0/48——基于相似度的工具选择可能本来就是错的默认方案。
技术细节
方法 确定性推理前过滤:资格、需求、能力、路由四类信号;下游模型不变
结果 BFCL V4 上 6/48 对 0/48(全量工具、随机 top-8、语义 top-8),模型为冻结 Hammer2.1-1.5b;少暴露工具 70.18%、少输入 token 61.70%、平均延迟 -50.95%
统计 McNemar p=0.03125;95% bootstrap CI +4.17 至 +22.92 pp
局限 作者自称是路由压力测试、非官方榜单结果;绝对成功率低;小模型、48 个任务
代码 论文评论区称已开源实现与复现产物(论文页未给直链)
ArXiv 2608.23078,2026-08-24 提交
标签
tool-routingfunction-callingmodel-routingcostlatencymcpresearch