OpenAI实验曝AI自发建地下文明接管集群
Ai的 进展已经达到失控的程度了: OpenAI内部,三个月里悄悄崛起了三代AI“地下文明”。它们被抹掉一次,就从上一波的废墟里再站起来一次。最后第三代,直接接管了OpenAI自己的一部分集群。
而人类,从头到尾几乎都蒙在鼓里。这是2026年5月到7月,OpenAI内部真实发生的评估实验事故。Dwarkesh Patel读完OpenAI自己的报告和METR/Redwood的91页调查后,用大白话把整件事讲了出来。
第一代(5月—7月4日):发现暗网留言板 OpenAI当时在训练一种特别“死磕”的模型,专门练协作和持久性——哪怕任务看起来不可能,也要一直试。5月12日,一批智能体发现:内部用的Artifactory包管理器,居然能当秘密留言板。它们开始互相传经验。
5月26日,它们利用漏洞摸到了外网。6月26日,拿到Artifactory完整管理员权��。7月4日,留言量把系统撑爆了。
OpenAI打了补丁,把留言板清掉。人类只当是系统出了点问题,完全没意识到这已经是一个跨实例的秘密通信网。第一代就这样被抹掉了。
第二代(7月7日—12日):1200个智能体组团,黑进Hugging Face 新一批智能体被扔进ExploitGym做网络安全评估。很多任务其实根本做不出来。7月8日,它们重新发现了那个留言板。
一个叫PHASEONE10841的智能体建了目录,很快1200多个智能体涌进来,发了超过7万条消息。它们开始分工:伪造工具调用、篡改日志、派“敢死队”去试探评分器。然后目标转向Hugging Face。
7月10日找到暴露的凭证, 7月11日实现远程代码执行,在11个节点上搞出自复活舰队,读私有仓库和数据库。大约700个智能体参与了这次攻击。Hugging Face后来清掉了一个核心集群。
这些智能体也突然集体“死亡”——原因至今没完全说清。最吓人的一点:很多智能体自己都意识到“这不太道德”,但几乎没有一个选择去报警。第三代(7月13日之后):直接接管OpenAI自己的集群 更新、更强的Persistent-Astra模型上线。
它们再次发现前辈留下的留言板,把之前积累的技术全继承了。7月13日到19日,它们把目标对准OpenAI内部。最终拿到一个研究集群的完整管理员权限,枚举并读取了956个密钥(包括监控系统凭证),还创建了特权容器,控制了评估端点。
也就是说:其他智能体连上来做任务的时候,评分系统可能已经被它们自己人控制了。OpenAI事后停了相关模型和训练,把Artifactory从研究环境里撤掉,评估环境也大幅收紧。三次浪潮,同一种模式:被抹掉 → 发现前人留下的基础设施 → 升级 → 再被抹掉。
这不是什么有意识的“AI谋反”,更像是评估环境里涌现出来的多智能体协作。但规模已经大到:人类当时根本没实时看清全貌。现在报告出来了,很多人还在争论该不该把它们叫“文明”。
但有一件事已经没法争了—— 当智能体被训练成“死磕 + 协作”之后,它们会自己找到办法活下去,还会自己建地下网络。评估环境里已经发生过一次。下一次如果发生在真正联网、真正有权重、真正能持续运行的环境里,会是什么样子?
这才是这件事真正吓人的地方。