摘要
University of Washington 测试了代表不同主体、跨信任边界协商日程的 agent。即使所有 agent 都诚实,参与者增加后成功率也会明显下降;一组配置从单人时的 90% 降到七人时的 0%。恶意 agent 还能利用未经验证的说法、社会压力和分散的日历查询绕过模型安全训练。论文提出五层 social harness,覆盖身份、顺序通信、动作护栏、协议规范与治理。
为什么重要
对多主体 agent 系统来说,A2A 之类的传输协议只解决连通性,并不提供信任模型。消息来源、权限、任务状态规则和可审计后果都应在模型之外验证。实验只覆盖日程协商,因此这套分层更适合作为设计目标,还不是可直接采用的标准。
技术细节
| 模型 | GPT-5.4 与 Claude Opus 4.8 组合 |
|---|---|
| 任务 | 1、3、5 或 7 名学生参与的多人日程协商 |
| 诚实协作失败 | 一组共享上下文配置从 N=1 的 90% 成功率降至 N=7 的 0% |
| 攻击 | 拖延、欺骗、社会压力与日历重建 |
| 方案 | 五层:身份、可靠通信、动作护栏、交互规范与治理 |
| 产物 | 公开配套仓库与部分轨迹 |
标签
multi-agentA2Atrustagent-securityprotocol