摘要

ParaRecover 不只看最终任务是否成功,而是评测 agent 能否定位并修复并行工具分支中的中间故障。10,626 个样本覆盖依赖规划、工具选择与参数匹配等 14 类错误。SDE rubric 分别衡量结构完整性、诊断推理与重新规划策略。对十多个模型的测试显示,多轮错误传播、隐式工具失败和精确重规划仍是普遍弱项;MIT 代码与数据已公开。

为什么重要
对运行并行或 multi-agent workflow 的团队,最终通过率会掩盖恢复是可靠能力还是偶然结果。ParaRecover 可作为定位与重规划的回归测试,再把这些路径带入生产。由于评分仍较依赖研究 rubric,仓库也没有可见采用,应把它作为环境内故障注入的补充,而不是替代。
技术细节
数据集 10,626 个样本,两个难度等级
错误分类 14 类,覆盖依赖规划、工具选择与参数匹配
Rubric SDE:结构完整性、诊断推理、演化/重规划策略
模型覆盖 十多个主流 LLM
可用性 MIT GitHub 仓库,含数据与评测代码
采用情况 扫描截止时 GitHub stars 为 0
标签
agent-evaluationparallel-tool-useerror-recoveryreplanningbenchmark