摘要

论文(arXiv 2608.27146)认为工具增强型 agent 的注入风险源于把两个运行时角色混在一起:从观察中诱导动作,与授权执行。SARA 把两者拆开:一个上下文隔离的 Action Probe 负责暴露工具输出中的动作诱导语义,并跨步骤持久记录动作来源;真正的工具调用只依据用户目标与已授权成功执行产生的审计证据放行,约束覆盖目标、执行链与参数三层。No-History-Promotion 机制防止历史重复把动作来源「洗」成执行授权。在 AgentDojo 与 AgentDyn 上,四个主设置的攻击成功率均不超过 0.63%,任务可用性保持竞争力,且跨 agent 骨干一致。

为什么重要
对重度使用 MCP 工具的团队,这是一套可以直接借鉴的架构拆分:把工具输出当不可信的动作建议、让授权只绑定用户目标与既往已授权证据、绝不让动作靠重复出现获得授权。不可信观察正是当下企业 MCP 网关要解决的核心问题。
技术细节
架构 对观察做上下文隔离的 Action Probe(暴露动作诱导语义、记录来源);按用户目标 + 审计证据授权,约束覆盖目标 / 执行链 / 参数三层;跨步骤的 No-History-Promotion
结果 AgentDojo + AgentDyn 四个主设置 ASR <= 0.63%;任务可用性保持竞争力;跨 agent 骨干一致
关联 不可信工具输出即命令——与企业 MCP 网关强制管控(趋势 #2)同属一个问题类
代码 论文页未给出
ArXiv 2608.27146,2026-08-27 提交
标签
agent-securityprompt-injectiontool-callingmcpauthorizationresearch