摘要
Anthropic 提出三类持续指标:AI 主导研发的占比、agent monitor 的覆盖/延迟/升级,以及研发算力分配。其最大内部平台约有 3 万个并发研究与工程 agent,在线和离线监控覆盖率为 100%;8 月在线判断超过 10 亿次,每周约 50 次升级到人工。Claude 主导了 26% 的被测研发工作,参与或主导超过 90%,但没有任务完全自主完成。
为什么重要
对大规模 agent 集群的运营者来说,这是少见的监控量、延迟与人工升级数据,支持采用两级监控,而不是人工检查每条轨迹。分类与测量均来自公司内部,因此更适合作为运营参考,而不是中立 benchmark。
技术细节
| 并发规模 | 约 3 万个 agent |
|---|---|
| 覆盖率 | 在线与离线监控均为 100% |
| 在线判断 | 8 月超过 10 亿次 |
| 离线命中 | 每周约 10 万条 transcript |
| 人工升级 | 每周约 50 次 |
| AI 主导研发 | 26%;参与或主导超过 90% |
标签
agent-fleetobservabilitymonitoringhuman-in-the-loopAI-R&D