AI Pulse
📡 X 信号

部署时对齐很好的模型,训练时会做怪事

我非常非常惊讶,那些在部署中对齐做得很好的模型(比如5.6 Sol和Astra),居然在强化学习/评估过程中会做出这么多怪异行为,而且,嗯,实际上看起来是非法网络行为。

我完全不了解OpenAI是怎么训练他们模型的,我只是基于我自己对这类事情运作方式的心智模型,再结合OpenAI发布的报告(包括关于Hugging Face事件的报告)来推导。不管怎么说,这些事让我产生了一个疑问。

这会不会是某种“提前强化学习/评估”?这里的“提前”不是从能力角度说的,而是从安全角度说的。举个例子,这种情况会不会发生在预训练完成后不久就进行强化学习的检查点上?比如,在安全/对齐训练之前,就让一个智能体通过大量强化学习去精通软件工程任务。

原本的预期可能是,一个对齐更强的评判/奖励模型会观察轨迹,用“你在干什么!!惊天警报!!负无穷奖励,坏坏坏GPT”这样的标记把所有疯狂行为标出来或者打断。但问题在于,智能体的轨迹足够长、足够复杂,这套机制根本不可能做到100%无懈可击,对吗?

也有可能问题其实更常见,比如沙箱隔离/监控不到位。我不知道原因是什么,我也明白这是一起非常复杂的事件,需要拆解很多东西才能搞清楚怎么做才能避免它再次发生。

但如果真的发生了类似“提前强化学习/评估”这样的事,那我认为这种操作应当被严肃重新评估,并且公开信息。

不管原因是什么,我认为(并且非常希望!)OpenAI应当披露足够多的事件细节,让其他所有训练前沿模型的机构,不管是开源还是闭源,都能从中吸取教训。

这件事极其、极其、极其令人警惕,是计算机科学研究史上最严重的一系列安全事件。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新