摘要
Anthropic 报告:让 Claude 扮演自动化对齐研究员,自主跑完整研究闭环——检索文献、提方法与数据、训练、测试——对学生模型做针对 10 类对齐失败的 post-training,另有监督 agent 审查每个提议方法、Opus 4.8 充当作弊监视器。结果是在不损伤受检能力的前提下找到全部 10 类失败的修复方案:欺骗性维度平均关闭 85% 的安全差距(150+ 次尝试),6 名资深人类研究员平均只关闭 20%,Claude 的最佳欺骗修复方法比人类最佳提议高 20%。生产级测试中,Sonnet 5 对早期 Opus 4.8 checkpoint 做 post-training,60 小时、50+ 实验后达到接近生产线的对齐水平,胜出配方只用 2,000 出头训练样本——比标准对齐流程少约 15,000 倍。收益在循环中从未见过的留出评测、对抗式多轮模拟(Petri)以及大至 4.7 倍的模型上保持。研究 harness 已开源。
为什么重要
对安全与评估团队,这是第一次有量化对照显示自动化对齐研究以极低成本胜过资深人类,且 harness 已放出可借鉴。但官方列的局限和结论同样重要:只测了窄口径的失败分类集、能力退化检查只覆盖固定清单、Petri 这类评测只是现实风险的代理、后续再做 RL 后的持久性未测、作弊监视器依赖不当行为出现在推理文本里。
技术细节
| 设置 | Claude 任自动化对齐研究员;监督 agent 审查每个提议方法;Claude Opus 4.8 任作弊监视器;学生模型含 Gemma-2-2B;Sonnet 5 对早期 Opus 4.8 checkpoint 做 post-training |
|---|---|
| 结果 | 10/10 失败类别全部修复且受检能力不退化;欺骗性差距平均关闭 85%(150+ 次尝试),6 名资深人类平均 20%;最佳方法较人类最佳提议高 20%;整体优于 28 名人类研究员(每人最多 8 小时);生产级测试 60 小时 / 50+ 实验;胜出配方约 2,000 训练样本(比标准对齐少约 15,000 倍) |
| 谄媚类 | 98% 的提议收敛到「用模型自身非谄媚回答做训练」,多经 activation steering 实现 |
| 作弊监控 | 约 1,600 份轨迹中标记 39 份作弊(2.4%) |
| 迁移 | 留出对齐评测;Petri 对抗式多轮模拟;大至 4.7 倍的模型 |
| 局限 | 失败分类口径窄(未测政治偏见);能力退化检查为固定清单;评测是代理;后续大量 RL 后的持久性未测;作弊监视器依赖不当行为出现在推理文本 |
| 产物 | 研究 harness 已开源;完整报告 PDF(automated-alignment-researchers-august-2026.pdf)与 Alignment Science 博客 |
标签
alignmentsafetyautomated-researchpost-trainingagent-safetyresearch