摘要

Anthropic 提出三类持续指标:AI 主导研发的占比、agent monitor 的覆盖/延迟/升级,以及研发算力分配。其最大内部平台约有 3 万个并发研究与工程 agent,在线和离线监控覆盖率为 100%;8 月在线判断超过 10 亿次,每周约 50 次升级到人工。Claude 主导了 26% 的被测研发工作,参与或主导超过 90%,但没有任务完全自主完成。

为什么重要
对大规模 agent 集群的运营者来说,这是少见的监控量、延迟与人工升级数据,支持采用两级监控,而不是人工检查每条轨迹。分类与测量均来自公司内部,因此更适合作为运营参考,而不是中立 benchmark。
技术细节
并发规模 约 3 万个 agent
覆盖率 在线与离线监控均为 100%
在线判断 8 月超过 10 亿次
离线命中 每周约 10 万条 transcript
人工升级 每周约 50 次
AI 主导研发 26%;参与或主导超过 90%
标签
agent-fleetobservabilitymonitoringhuman-in-the-loopAI-R&D