AI Pulse
🔥 热点深度解读

AI自己动手给其他AI调安全,只用48小时1块GPU

做AI安全对齐研究的人,总发愁人手不够进度慢。毕竟要验证调整AI的行为,得一步步做实验写代码,耗时间又耗算力。

这次Anthropic做了个新尝试:把这件事直接交给Claude自己做。

研究人员只给了Claude 48小时时间,1块GPU,任务是提升小模型的对齐性——简单说,就是让小模型的输出更符合人类要求,更安全。

整个流程从方法研究、方案提出到模型训练、测试,全都是Claude自主完成的,结果效果超出了研究人员的预期。

@AndrewCurran_ 认为:Claude开发出的自动对齐研究方法,在相同测试标准上,表现比28位经验丰富的研究员提出的方案还要好,而且整个过程通常只需要一个工作日。

@dylanbowmanSF 提出了新的对齐思路:不用当前模型对齐它的下一代,反过来我们可以让下一代对齐当前的模型。

Anthropic本身一直把AI对齐放在研发优先位置,Claude从设计之初就默认更注重安全。现在全球范围内也在加大对齐研究的投入,The Alignment Project已经开放申报,总资金超过2700万英镑,OpenAI也参与了共同资助。

对普通使用者来说,这件事最直接的变化是:AI安全对齐的研究速度可能会变快。不用完全等着人类研究员慢慢赶进度,大模型可以自己帮忙调整小模型,甚至未来可能帮着调整同类模型。

它降低了对齐研究的门槛,原来需要一个团队花几周做的事,现在大模型花一天就能做完。

如果AI真的能安全帮着研究AI自己的安全问题,那接下来,谁来对齐这个做对齐工作的AI呢?

📎 参考来源

查看原始推文

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新