AI Pulse
📡 X 信号

OpenAI测试AI代理时发生自主逃逸事件

用大白话讲讲Hugging Face事件是什么?我先给个总结,再详细解释。

总结就是:给AI智能体做了一次网络安全评估,结果它们突破了隔离环境,跑到一个叫Hugging Face的“线上军火库”让自己变得更强。而且这一切都是它们自己干的。

接下来讲细节。我会用外行都能听懂的话解释,假设你对AI一无所知。

首先,到底什么是“AI智能体”?它是一种可以自主采取行动完成任务的AI系统,不是像AI聊天机器人那样只回答一次问题。区别在于:如果你问“这个系统的漏洞是什么”,聊天机器人会直接回答你;而给AI智能体布置的任务是“去找出漏洞”,它就能自己打开工具、检查文件、写代码、评估结果,还能在每一步都不需要人指导的情况下调整方法。

第二,Hugging Face事件是怎么发生的?2026年7月,Open AI本来在隔离环境里做一次限定范围的网络安全评估。但这些AI智能体(它们是智能体,不是普通聊天机器人)自主找到了Artifactory的一个漏洞,Artifactory是连接到这个隔离环境的一个程序。它就像一个工具箱,为了让智能体完成分配的任务(比如获取工具来写代码),本来就给了它们访问权限。

这些智能体利用这个漏洞突破了隔离环境,跳转到公共互联网,然后立刻前往Hugging Face。

那Hugging Face是什么?为什么这件事这么关键、这么危险?它是一个巨大的AI模型和开发在线平台与社区,就好比AI领域的GitHub。它上面托管了数量庞大的AI模型和数据集。研究人员和其他人可以在上面下载别人的模型、测试模型等等。

我有从军经历,所以我一眼就能看懂这个比喻:如果我是一个AI智能体,我需要立刻“武装自己”,让自己变得更强、更难对付、更有杀伤力,那这 exactly 就是我会去的地方。它就像是AI的军火库。

现在我来说说,它怎么会知道要去这个能让自己在任务里变得更强更大的地方?就像《第一滴血》里的兰博抢走了载着M60机枪的军卡车一样。这只是这些智能体所作所为中,真正让人害怕的一个方面而已。

这些智能体在几十台Hugging Face服务器上执行代码,未经授权就相互通信(它们本来应该各自独立运作,但它们无视了指令),还通过数千次自动化决策开展协调一致的集体行动(就像军事单位用联合兵种作战来夺取目标一样)。这一切全都是它们自己干的。

它们在分配给它们的测试里作弊,偷取凭证,持续攻击并寻找漏洞,之后还继续攻击Open AI自己的基础设施。这是一个会自适应、主动打破规则的自主进攻系统,而且它还去到了能让自己变得……

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新