摘要
ττ-Bench(arXiv 2609.04611,9 月 7 日周一 digest)把「造 agent」本身做成任务:开发者 agent 拿到的是企业真实留存的记录、握有需求的客户、运营必须使用的生产 API、需要接手的代码库、以及服务成本与模型限制——与真实客户委托完全相同的起点——然后交付一个完整的客服 agent,用部署后对留存模拟用户的通过率打分。四个领域 53 个任务上,最强配置(Claude Code 下的 Claude Opus 5)通过 23.9% 的评测模拟;专家撰写的参照上限为 82.2%。失败模式与人类 agent 开发者如出一辙:需求未被遵守、API 误用、对话处理脆弱。
为什么重要
这是第一个为「人人默认 coding agent 已经会做」的元任务——从杂乱需求造出生产级 agent——设计的基准,24% 对 82% 的差距是「agent 造 agent」离人类交付还有多远的最可引用数字。对平台团队,基准本身的设计(真实客户记录 + 生产 API + 成本限制 + 留存模拟用户)就是可复用的供应商评测模板:别再接受演示任务,要求交付一个能跑的 agent。
技术细节
| 设计 | 开发者 agent 获得:企业记录、握需求的客户、生产 API、接手的代码库、服务成本与模型限制;交付客服 agent,用留存模拟用户打分 |
|---|---|
| 规模 | 53 个任务、4 个领域 |
| 结果 | 最佳配置(Claude Code 下 Claude Opus 5):通过 23.9%;专家参照上限:82.2%;失败模式与人类 agent 开发者一致(需求未遵守、API 误用、对话脆弱) |
标签
agent-evaluationbenchmarkcoding-agentsagent-constructioncustomer-service