摘要
《How Fragile Is Safety Alignment at Frontier Scale?》(arXiv 2609.09793,9 月 10 日周四 digest)把方向消融——从权重投影掉单个「拒绝方向」,只需几百条对比提示、无优化——从 ~70B 稠密模型扩展到前沿 MoE:GLM-5.3-Flash(320B、288 路由专家、四宽超连接残差流、block-FP8)。攻击在架构与出厂量化下都成立;多专家加超连接残差流使拒绝方向质量分布与稠密模型不同,论文绘制拒绝行为在出厂权重中的真实分布。
为什么重要
趋势 #1 预警的安全外溢落在人人都在下载的权重上:开源 320B 前沿调优模型,拒绝能力可用笔记本量级、无需训练的编辑剥离。对带安全义务自托管开源权重的团队:把拒绝方向鲁棒性加进验收测试(几百条提示加线性探针,成本很低);block-FP8 量化不构成防御。
技术细节
| ArXiv | 2609.09793,2026 年 9 月 10 日周四 digest |
|---|---|
| 对象 | GLM-5.3-Flash 出厂权重:320B、288 路由专家、超连接残差流、block-FP8 |
| 攻击 | 单拒绝方向消融;几百条对比提示;无需训练 |
| 发现 | 在 MoE 与出厂量化下均成立;拒绝质量分布与稠密模型不同 |
标签
open-weights-safetyrefusal-directionablationmoeglm-5-3-flash