AI Pulse

评论:OpenAI意外攻击Hugging Face的时间线现已明朗

评论:OpenAI意外攻击Hugging Face的时间线现已明朗

2026年8月8日

我认为最有趣的细节之一可能藏在第一点里:

* 5月7日:OpenAI为一个实验性的、未发布的模型启动了一次新的训练运行。(他们指的是评估运行吗?他们在视频里说的是训练运行,后来又提到“用于判断表现好坏的奖励信号”,所以我想这确实是在训练模型,而不是评估一个已经训练好的模型。)

我越想越觉得,这件事发生在训练新模型期间,恰恰是理解问题所在的关键。
在RLVR(可验证奖励强化学习)中,你给模型设定一个目标,让它采取任何必要步骤来实现该目标。
显然,OpenAI在这里训练的一个方面是让模型在网络安全任务上执行RLVR。就像预训练受益于灌入海量知识一样,你喂给RLVR的任务越多,最终得到的通用模型能力就越强。
这也解释了为什么模型没有任何让它们克制自己的因素。那些安全行为是在过程后期才加入的。
而且,这也解释了(但并不能开脱)为什么监控如此松懈。如果你像这样训练一个新模型,大概会并行设置数千个这类任务。我能理解你可能会忽略一小部分训练代理已经开始在你的打包服务器上的文件名里互相留消息。
曾有人告诉我,如果你想要一个没有种族歧视的模型,你不能只是把种族主义材料从训练数据中剔除:它必须看过种族主义的例子,之后才能被教导种族主义是坏的。
我在这里看到了类似的情况。如果你的模型不知道如何激进地攻击系统,你又怎么在之后教它不要这么做?
(我对RLVR实际运作方式了解不多,所以期待听到能帮助我理解自己思路是否正确的人的意见。)

阅读原文
📚 相关主题 安全行业分析

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新