摘要

University of Washington 测试了代表不同主体、跨信任边界协商日程的 agent。即使所有 agent 都诚实,参与者增加后成功率也会明显下降;一组配置从单人时的 90% 降到七人时的 0%。恶意 agent 还能利用未经验证的说法、社会压力和分散的日历查询绕过模型安全训练。论文提出五层 social harness,覆盖身份、顺序通信、动作护栏、协议规范与治理。

为什么重要
对多主体 agent 系统来说,A2A 之类的传输协议只解决连通性,并不提供信任模型。消息来源、权限、任务状态规则和可审计后果都应在模型之外验证。实验只覆盖日程协商,因此这套分层更适合作为设计目标,还不是可直接采用的标准。
技术细节
模型 GPT-5.4 与 Claude Opus 4.8 组合
任务 1、3、5 或 7 名学生参与的多人日程协商
诚实协作失败 一组共享上下文配置从 N=1 的 90% 成功率降至 N=7 的 0%
攻击 拖延、欺骗、社会压力与日历重建
方案 五层:身份、可靠通信、动作护栏、交互规范与治理
产物 公开配套仓库与部分轨迹
标签
multi-agentA2Atrustagent-securityprotocol