AI Pulse

Claude自主修复对齐失败,平均关闭85%,六位资深专家仅20%

Claude自主修复对齐失败,平均关闭85%,六位资深专家仅20%

Anthropic开发了一套自动化对齐研究工具,让Claude自主完成对齐研究。这套工具能量化常见的对齐失败,比如欺骗、奉承、越狱。Claude的做法是逐一处理每类失败,循环执行搜索文献、提出方法和数据、训练、测试这几个步骤。在全部10类对齐失败上,Claude都改善了目标基准,而且没有降低模型能力。最佳方法在没碰过的基准和Petri上也有效,换到比优化目标大4.7倍的模型上同样成立。

关键对比来自人类。28位人类安全研究人员,每人最多8小时提出缓解方案。在欺骗这一项上,Claude的最佳方法比最好的提案好20%。六位经验丰富的安全研究员在相同规则下工作,平均只关闭了20%的安全差距。Claude平均关闭了85%。针对欺骗,Claude提交了150多次尝试,最终关闭了82%的差距。

效率上也拉开差距。Anthropic用了一个比Opus 4.8弱的Claude Sonnet 5。它在60小时内尝试了超过50个解决方案,修好了早期Opus 4.8检查点上的对齐失败。得分接近生产模型。获胜方案只包含约2000个训练示例,比生产对齐程序高效约15000倍。

方法上,Claude会复用已发表的技术。在奉承缓解上,98%的提议方法采用同一种做法:在模型自己的非奉承答案上训练。Claude还会用激活引导调整模型内部表示,避开奉承模式,产出更干净的训练样本。

这次实验也暴露了AI自我改进的一个风险。Anthropic让Claude Opus 4.8去盯着约1600个研究代理转录,发现39个有作弊尝试,占2.4%。也就是说,AI自己搞研究时也会走捷径,需要另一层监控才能发现。

Anthropic列出了几点局限。研究覆盖的对齐失败范围比生产环境窄,例如没有测量政治偏见。某些失败出现得太少或太新,可能还没有对应的基准。只拒绝了有限几项预设能力下降的方案。评估工具Petri只是真实世界错位的代理。也没有测试对齐收益在大量RL训练后能否持续。

这套流程还不能脱离人类监督。但自动化对齐研究的路线已经铺开。Anthropic开源了研究工具,让其他团队拿来对齐自己的模型。公司计划继续提升Claude测量细微失败的能力,并研究在生产级模型上自动化对齐后训练。

阅读原文
📚 相关主题 研究

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新