摘要
ParaRecover 不只看最终任务是否成功,而是评测 agent 能否定位并修复并行工具分支中的中间故障。10,626 个样本覆盖依赖规划、工具选择与参数匹配等 14 类错误。SDE rubric 分别衡量结构完整性、诊断推理与重新规划策略。对十多个模型的测试显示,多轮错误传播、隐式工具失败和精确重规划仍是普遍弱项;MIT 代码与数据已公开。
为什么重要
对运行并行或 multi-agent workflow 的团队,最终通过率会掩盖恢复是可靠能力还是偶然结果。ParaRecover 可作为定位与重规划的回归测试,再把这些路径带入生产。由于评分仍较依赖研究 rubric,仓库也没有可见采用,应把它作为环境内故障注入的补充,而不是替代。
技术细节
| 数据集 | 10,626 个样本,两个难度等级 |
|---|---|
| 错误分类 | 14 类,覆盖依赖规划、工具选择与参数匹配 |
| Rubric | SDE:结构完整性、诊断推理、演化/重规划策略 |
| 模型覆盖 | 十多个主流 LLM |
| 可用性 | MIT GitHub 仓库,含数据与评测代码 |
| 采用情况 | 扫描截止时 GitHub stars 为 0 |
标签
agent-evaluationparallel-tool-useerror-recoveryreplanningbenchmark