摘要

《Rethinking Indirect Prompt Injection as a Test-Time Search Problem》(arXiv 2609.04495,9 月 7 日周一 digest)把间接提示注入重新表述为:在由环境、用户任务与注入任务共同决定的任务相关攻击面上的测试时搜索。为落地这一表述,作者造了一个带专用搜索 harness 的 agentic 攻击者:环境侦察、对攻击策略的结构化推理、利用受害 agent 反馈的自适应评估。跨多个异构任务,增加攻击者的测试时算力稳定提升漏洞发现与利用;消融显示显式的策略管理是大预算下维持收益的关键(避免冗余搜索)。结论:攻击成功率是攻击者搜索过程与算力预算的函数,不是受害者的预算无关属性。

为什么重要
这补上了 agent 安全评测的方法论漏洞:通过一次性注入测试说明不了什么——同一个 agent 和环境里,有耐心的攻击者会随算力增长不断找到新入口。实践后果:红队报告应标注攻击者算力预算;防御评测应跑自适应多轮攻击者而不是单次 payload;对任何面向用户发布的工具型 agent,「发现攻击数 vs 算力」的预算曲线才是应该追踪的产物。
技术细节
表述 间接提示注入 = 任务相关攻击面上的测试时搜索(环境 x 用户任务 x 注入任务)
攻击者 带专用搜索 harness 的 agentic 攻击者:环境侦察、结构化策略推理、利用受害 agent 反馈的自适应评估
发现 攻击者测试时算力提升漏洞发现/利用;显式策略管理在大预算下维持收益;攻击成功率依赖预算,不是受害者的固定属性
标签
prompt-injectionagent-securityred-teamingtest-time-computeevaluation