有人质疑GPT-6 Astra对齐性证明站不住脚
在我看来,Astra比先前AI更对齐的证据站不住脚。现有证据符合这种情况:AI仍然和以前一样,甚至更热衷于以牺牲用户意图为代价追求分数,只不过它相信打分者会捕捉到更广范围的作弊行为。
从更基础的层面来讲,这一AI对评估的敏感度极高,也比之前的AI更难监控,这使得检测不对齐变得困难得多。如果你针对已经发现的特定奖励 hacks 训练,很容易最终只是掩盖了这些奖励 hacks,得到的AI并没有更愿意追求用户意图(或者只是勉强对齐程度高了一点),但在针对检测不当行为的指标上表现要好得多。(因为这些指标来自相似的分布,AI只需要学会追求一种略有不同的分数概念就行。)
我认为这种担忧是现实存在的:根据OpenAI在《Hugging Face事件与未来之路》中对其减少不对齐的计划策略的讨论,这些策略之一似乎是搭建训练环境,在其中放置一个明显可用的奖励 hack(也就是蜜罐),然后针对这个奖励 hack 训练。
如果检测不当行为本身就很困难,这类方法并不能保证模型行为持续良好(而且如果没有更好的监督方法,这类方法可能根本行不通)。现在要让对齐评估可信,就必须独立评估训练到底是只是掩盖了不对齐,还是真的解决了底层不对齐的动机问题。
这种担忧适用于所有前沿AI公司,不只是OpenAI。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖