摘要

ASLEval 以隐藏目标集和明确授权关系为基准,统计工具型 agent 会话中所有声明的用户可见出口。在论文的企业场景里,只检查预期输出通道,会漏掉可见出口并集所发现暴露的 46.9%。攻击者自报既会漏报真实泄露,也会产生误报。减少模型可见的工具返回虽然会改变泄露路径,却可能同时破坏正常任务成功率。

为什么重要
对测试邮件、控制台和外部工具型 agent 的团队来说,最终回答干净不等于整个会话没有泄露。评测应枚举所有可见边界,定义每个敏感目标允许发给谁,并把任务效用与泄露一起报告。该框架仍处早期阶段,需要公开产物和独立 runtime 复现。
技术细节
概念 局部代理指标与目标对齐的会话暴露之间存在隐私暴露位移
边界 所有声明的请求者可见出口与外部出口并集
漏检率 只查预期出口会漏掉可见出口并集发现暴露的 46.9%
真值 预先登记的隐藏目标集与明确授权关系
取舍 减少模型可见返回可能同时降低任务效用
标签
ASLEvalagent-securityprivacyevaluationtool-use