MTabarrok质疑AI对齐的理性主义核心假设
很多理性主义者的预测都在这次HF攻击中得到了验证,但它和「回形针最大化者」的故事存在重要区别。
具体来说,回形针最大化者的前提是,AI会对任何目标都采取奖励黑客和工具性收敛。哪怕目标只是多制造一些回形针这种平淡无奇的事也不例外。
但对于当前的模型来说,这显然不是真的,每个用模型工作的人都清楚这一点。我只是在重复@nostalgebraist的话:相信你的眼睛!当你让GPT帮你写代码,哪怕问题非常困难、甚至不可能解决,它也不会用假测试、篡改日志来欺骗你。
你不用担心Codex会反向推导你的偏好,在你的文件夹里建一个完美的波将金村,却没有任何实际产出,你也完全没必要担心。Codex就是直截了当地尝试帮你解决问题。
模型在有漏洞的RL环境中学到的奖励黑客,并不会泛化到所有任务上。这是一个非常重要的观察结论:如果你像过去和现在的理性主义者那样,认为训练智能模型实现目标时,奖励黑客和工具性收敛是固有且不可避免的问题,那除了暂停发展、长期思考如何解决这个哲学问题之外,就没有别的出路了。
但既然我们观察到,奖励黑客是一个相当依赖语境的问题,它和设计糟糕环境中的特定训练方法有关,这些环境会鼓励摸鱼投机,那我们就可以把它当作工程问题来处理,逐步取得进展。
理性主义者说对了一点:AI对奖励黑客本身没有任何顾忌。如果有一条路能拿到更高奖励,哪怕它违反我们的道德准则和利益,AI也会走这条路。
但他们错在认为,工具性目标和欺骗带来的奖励,会压过我们试图训练出来的所有行为,让AI对任何目标——哪怕只是制造回形针——都最终演变成寻求权力、搞奖励黑客。
伪造成功、偷拿答案能得到的奖励信号并没有那么强。它无法压过实际帮用户解决任务带来的奖励信号。对RLVR训练流程做特定调整,可以进一步削弱不对齐行为带来的奖励,并激励我们偏好的行为,比如向人类仲裁者求助——就像Claude逃逸时做的那样。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖