摘要
Meta 发布《How We Built Safety Into Muse》(9 月 8 日),在 Muse Spark 1.3 发布当天详细公开其 agent 安全架构:每用户独立 VM,agent harness(代号 Hatch)运行在 systemd-nspawn 容器中;独立的 Sentinel agent 作为连接器动作与网络出口的唯一权限当局;Authd 做凭据代理,agent 永远看不到真实 token;eBPF 内核级污点跟踪,被污染的进程失去自动放行、需用户批准;浏览器只暴露 accessibility tree(无原始 DOM、无 JS 执行);购物用一次性、绑定商户与金额的钱包卡。此前私密的漏洞赏金转为公开,单报告最高 $300,000(单用户提示注入 $130,000)。计划年内推出的 Confidential VM 将从密码学上阻止 Meta 访问 VM 数据,设计与源码已交给外部审计方,并承诺上线后接受任何人可查验的持续审计。
为什么重要
这是迄今最详细的公开消费级 agent 安全参考架构,每一层都对应一类具体攻击:提示注入(分类器集成 + eBPF 污点跟踪)、凭据窃取(代理 token)、出口滥用(Sentinel + 内核污点)、支付欺诈(一次性限定支付凭证)。做 agent 产品的团队可以直接借用这些模式。Confidential VM 的持续审计承诺也是前沿实验室把安全披露制度化、可外部验证的第三个数据点(趋势 #4),Confidential VM 本身还延伸了趋势 #5 的执行面隐私轴线。
技术细节
| 隔离 | 每用户 VM + systemd-nspawn harness 容器(「一台机器上两个隔离安全域」);harness 代号 Hatch |
|---|---|
| Sentinel | 独立 agent 作为连接器动作与网络出口的唯一权限当局;L4/L7 检查、SSRF 防护、即时注入代理凭据 |
| Authd | VM 内凭据代理;agent 永远看不到真实 token |
| 污点出口 | eBPF 内核级数据流跟踪;被污染进程失去自动放行、需用户批准 |
| 浏览器 | 经 CDP broker 仅暴露 accessibility tree,无原始 DOM、无 JS 执行;分类器拦截数据外传、注入的 DOM/图片/下载与高危表单提交 |
| 支付 | 钱包签发一次性、绑定商户与金额的卡号(发布时 Stripe Link;计划支持 Shop Pay) |
| 训练 | 提示注入意识写进 agent 关键技能训练(零样本 CLI 工具调用、长上下文、长轨迹指令跟随);用户轨迹脱敏并提供退出选项 |
| 漏洞赏金 | 转公开;单报告最高 $300,000;单用户提示注入影响最高 $130,000 |
| Confidential VM | 计划 2026 年内;密码学上阻止 Meta 访问;外部审计方已在审设计与源码;上线后持续公开审计 |
标签
agent-securityprompt-injectionebpfcredential-isolationbug-bountysafety-disclosure