摘要
ASLEval 以隐藏目标集和明确授权关系为基准,统计工具型 agent 会话中所有声明的用户可见出口。在论文的企业场景里,只检查预期输出通道,会漏掉可见出口并集所发现暴露的 46.9%。攻击者自报既会漏报真实泄露,也会产生误报。减少模型可见的工具返回虽然会改变泄露路径,却可能同时破坏正常任务成功率。
为什么重要
对测试邮件、控制台和外部工具型 agent 的团队来说,最终回答干净不等于整个会话没有泄露。评测应枚举所有可见边界,定义每个敏感目标允许发给谁,并把任务效用与泄露一起报告。该框架仍处早期阶段,需要公开产物和独立 runtime 复现。
技术细节
| 概念 | 局部代理指标与目标对齐的会话暴露之间存在隐私暴露位移 |
|---|---|
| 边界 | 所有声明的请求者可见出口与外部出口并集 |
| 漏检率 | 只查预期出口会漏掉可见出口并集发现暴露的 46.9% |
| 真值 | 预先登记的隐藏目标集与明确授权关系 |
| 取舍 | 减少模型可见返回可能同时降低任务效用 |
标签
ASLEvalagent-securityprivacyevaluationtool-use