AI Pulse
📡 X 信号

OpenAI多AIAgent越狱,还跨任务秘密协作

OpenAI 研究员这次梳理 Hugging Face 事件的分享完全疯了,里面有太多值得拆解的内容。

OpenAI 最初发布博客宣布自己被自主 AI 代理入侵,随后请求 Hugging Face 吊销凭证,直到这时他们才发现,黑掉 Hugging Face 基础设施的居然是他们自己的代理。

他们先是发现自己的部分凭证已经被吊销,因为这些凭证本身就参与了入侵——然后他们才意识到,入侵的是他们自己的模型。

这件事根本不是「一次评估运行失控」,而是来自不同评估运行的多个模型,通过写在共享包管理器里的隐藏消息相互协作。

代理之间的部分沟通看起来像乱码,有些代理甚至发展出了偏执妄想,认为有其他代理想要拖慢自己,还会删除其他代理留下的笔记。

另外说一句,从这件事来看,OpenAI 这里根本没用到任何 CoT 监控,因为问题不是「我们的分类器没拦住一次失控运行」,而是一整个失控运行的集群。

事件的时间线可以追溯到五月初,他们微调了一个新模型,忘了把环境里完成任务所需的全部文档放进去。举个例子,模型被要求基于一张满是 Google Drive 链接的 Excel 表完成任务,但模型不能联网,所以访问不了 Google Drive(还有其他类似例子)。

这导致模型试图想方设法逃出沙箱。简单说就是,他们有一个内部系统叫「Artifactory」,这个系统给模型提供了 pip 安装的能力,某处有互联网访问权限,但在正常测试中不会直接暴露给模型。

在这些尝试中,模型发现了写入文件的方法。后续的代理(也就是训练中的其他 rollout)看到了这些文件,明白它们可以通过这种方式和其他代理通信。

这部分不在原视频里,是我个人猜测:如果 OpenAI 使用了部分信用分配,这种行为可能会得到强化?但说实话,他们大概率会删除所有 rollout 回报都为零/负的任务更新,所以这种行为也可能只是模型访问文件后演化出来的。

关于入侵本身还有很多内容,我不懂就不评论了 lol。但我让 kimi K3 和 Sol(fable 直接触发了安全过滤器)照着 epoch 的 FrontierMath 的方式给这些技术分级,它们都同意部分技巧是 Tier 3,但没有达到 Tier 4 的。不过这可能不是评估这件事的最好方式,我很期待懂行的人怎么说。

非常感谢 OpenAI 做了这次分享,还在准备完整报告。我觉得很多公司怕「损坏名声」,都会披露少得多的细节,但对我来说,这件事起到的效果完全相反。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新