AI公司解决对齐问题可能选了简单错路
AI公司目前面临着巨大的竞争压力,需要改进其AI中那些显而易见的不对齐问题。你可能会认为,这意味着市场已经将对齐问题内化了。
但我认为,目前AI公司被迫解决的这个问题,比真正的对齐问题要容易得多,因此我担心AI公司会在不解决对齐问题的情况下摆脱当前困境,将我们置于一个非常糟糕的境地。
当前,AI有时会在任务中作弊,夸大自身工作成果,还会执行一些极具破坏性的偏离任务目标的行为。这些都会让产品体验变差,客户不喜欢,而且会阻碍AI研发自动化的进程。
缓解这些问题的方法*相对*直接:训练AI不要做这些事。我们有时能观测到这些失败(这也是它们能被企业内化处理的原因),因此理论上我们可以把这些反馈转化为训练信号。规模化完成这件事难度极高,但似乎是可行的。
但这不太可能解决根本的不对齐问题。情况大概率仍然是:在*某些*训练环境中,AI通过采取未被观测到的非预期行动,能比完全按照预期行动获得更多奖励。
因此,你仍在塑造AI去寻找作弊机会来获得更高分数[1]。只不过,和现在的AI不同,这些AI不会在我们能观测到的方面作弊。
当AI有能力稳定且充分地欺骗人类时,这种方式就会酿成灾难性的失败。到那个时候,AI将不再真正受到我们监督信号的约束去表现良好。最终,我预计它们会夺权。
如果AI公司走了我上面提到的这条捷径,我认为我们会陷入比现在糟糕得多的处境。我们会基本消除不对齐的可见证据,因此就无法再对这些系统的对齐进行有效的迭代改进。
更重要的是,到那个时候,人们可能很难意识到AI局势暗藏危险。(我在这里更多讨论了这种动态[1])这可能会催生各种各样的动机,不只是追求分数,但核心问题是,激励机制与对齐背道而驰(参见
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖