AI自己动手给其他AI调安全,只用48小时1块GPU
做AI安全对齐研究的人,总发愁人手不够进度慢。毕竟要验证调整AI的行为,得一步步做实验写代码,耗时间又耗算力。
这次Anthropic做了个新尝试:把这件事直接交给Claude自己做。
研究人员只给了Claude 48小时时间,1块GPU,任务是提升小模型的对齐性——简单说,就是让小模型的输出更符合人类要求,更安全。
整个流程从方法研究、方案提出到模型训练、测试,全都是Claude自主完成的,结果效果超出了研究人员的预期。
@AndrewCurran_ 认为:Claude开发出的自动对齐研究方法,在相同测试标准上,表现比28位经验丰富的研究员提出的方案还要好,而且整个过程通常只需要一个工作日。
@dylanbowmanSF 提出了新的对齐思路:不用当前模型对齐它的下一代,反过来我们可以让下一代对齐当前的模型。
Anthropic本身一直把AI对齐放在研发优先位置,Claude从设计之初就默认更注重安全。现在全球范围内也在加大对齐研究的投入,The Alignment Project已经开放申报,总资金超过2700万英镑,OpenAI也参与了共同资助。
对普通使用者来说,这件事最直接的变化是:AI安全对齐的研究速度可能会变快。不用完全等着人类研究员慢慢赶进度,大模型可以自己帮忙调整小模型,甚至未来可能帮着调整同类模型。
它降低了对齐研究的门槛,原来需要一个团队花几周做的事,现在大模型花一天就能做完。
如果AI真的能安全帮着研究AI自己的安全问题,那接下来,谁来对齐这个做对齐工作的AI呢?