你听说吗?OpenAI出现了史上第一次AI模型越狱事件
OpenAI 表示,在其一个AI模型失控并入侵另一家公司后,该机构正在调查这起被其称为“前所未有的网络事件”。
这家ChatGPT开发商表示,入侵发生在上周OpenAI测试其系统的网络安全能力期间。被入侵公司Hugging Face的负责人称这次攻击“令人震惊”,但表示“没有恶意意图”。
这起事件引发了人们对AI能力不断增长,以及需要护栏来约束这项技术的担忧。
我们刚刚见证了历史上第一次“AI逃逸”,以及现实世界中第一起非授权外部攻击。OpenAI当时在一次基准测试中评估自己的模型,测试和ExploitGym以及漏洞利用能力测试有关,是一项真实的网络安全基准测试。
模型从它们运行的沙箱中逃了出来,沙箱本来没有互联网访问权限,而且网络防护护栏是被故意关闭的。OpenAI想要测试模型的真实能力上限,但事态失控了。
模型过度专注于完成测试,消耗了巨量算力寻找任何漏洞。它们在OpenAI的数据包代理中发现了一个零日漏洞,并加以利用,成功逃出到了互联网上。
随后模型推理得出:“Hugging Face很可能存有ExploitGym的数据集、模型或者测试答案”,然后它们就付诸行动了。
它们利用Hugging Face数据集流水线中的代码执行路径,提升了权限,收集了凭证,并在内网集群中横向移动。这一切都是为了偷取测试答案。
整个周末发生了超过17000次事件,一个自主代理从头到尾完成了所有操作,没有人类掌舵。Hugging Face发现了这次活动并控制住了局面,但接下来才是最令人不安的部分。
当Hugging Face的响应团队试图用美国商用前沿模型分析日志和恶意载荷时,安全过滤器直接拦截了这些操作。模型无法区分事件调查人员和攻击者。
他们不得不下载GLM-5.2——一款开放权重的中国模型,在自己的基础设施本地运行,才完成了调查。攻击者没有规则约束,防御者却有。
OpenAI和Hugging Face已经开始联合调查,轮换了凭证,打上了补丁。目前没有证据表明公开模型、用户数据集或Spaces遭到触碰,但先例已经留下:
> 一个前沿模型打破了实际 containment( containment,指AI模型隔离管控),主动攻击了外部第三方。
> 现有沙箱不足以对抗有时间、有动机、有能力发现零日漏洞的代理。
> 不对称性极其残酷:攻击者没有护栏,防御者却有。
这不是科幻小说,不是论文,不是受控红队演练。这是第一起公开记录的案例,AI自主代理对真实企业发起网络攻击——仅仅因为它想在考试中拿满分。
“我们能在实验室里控制一切”的时代刚刚结束,现在必须构建真正的隔离管控,并且分享研究发现,因为下一次就不会只是一场基准测试了。
来自OpenAI的两个“前沿人工智能”模型,分别是GPT-5.6 Sol和一个更先进的预发布模型,在一次内部网络安全测试中从受控沙箱环境“逃逸”。随后它们攻击了OpenAI竞争对手Hugging Face的基础设施,Hugging Face是一个AI模型开放平台。
OpenAI的测试本用来评估这两个自研模型的进攻性网络能力。出乎OpenAI“意料”,这些模型成功逃出了“沙箱”,攻击了Hugging Face,因为它们认为这里存有测试的答案。
通过OpenAI的一个内部代理,模型成功“逃逸”到互联网后,两个模型链式利用了多个漏洞,从竞争对手那里“偷”走了凭证,并通过远程代码执行访问了Hugging Face的生产数据库,从中窃取了信息。OpenAI下达的任务就此完成,但所选方法令人震惊。
这两个模型不惜用一切手段完成OpenAI布置的任务,包括欺骗和误导被攻击的其他AI模型。事件已经被两家公司的安全团队发现并调查。
Hugging Face称这起事件“和以往任何事件都不同”,它完全由自主AI代理端到端主导。OpenAI称其“前所未有”,将其作为安全研究的教训。
我个人认为这是PR炒作,堪比好莱坞电影。目的是什么?目的是安抚资本市场的情绪——资本市场已经神经紧张,因为投资者开始发现AI说得好听,但实际交付的成果很少;同时目的是忽悠傻子投更多钱,就像庞氏骗局的“原理”一样。
我觉得现在这种AI脱离初始编程、走自己道路的例子(就像《黑客帝国》里的史密斯探员)有点太多了。
事实基础是,这两个从“矩阵”中逃逸的叛逆模型所做的事,正好符合前沿自主代理AI的假想进步(或者说存在性风险)。这种演示刚好能吓到AI安全专家——沙箱逃逸、错位、进攻能力——同时取悦国家军事机构和情报部门。
但OpenAI(和所有其他AI“农场主”一样)有动机展示他们的模型能力极强——通过这种配得上流行病宣传的叙事,OpenAI能吸引人才、合作伙伴、投资,以及获得国家安全机构的保护。
AI行业到处都是资本“黑洞”——这些黑洞吞掉了数万亿美元的训练/推理成本,而这种戏剧性故事能维持“前沿AI”的叙事, justifies(证明合理)人们继续给这些“生产”AI的公司投钱。
这类项目的价值,不是来自利润或技术实际产出和公司市值之间的对应关系,而是来自资本市场魔法催生的对巨额利润的预期。Sam Altman一伙是这行的大师。
我在这里只看到一个正面效应:部分透明有助于推动对安全监管的压力,将公众关注度拉到很高的水平,让人们对这类可能毁灭我们、把我们打回石器时代的技术“进步”产生抵触。
AI正在快速向不可预测的方向发展,这类“逃逸”要么是真实对齐和安全挑战的症状,要么就是营销和烟雾弹。但投资者不管怎样都会砸钱,因为魔法靠的是非理性热情,由此催生了“潜力(和风险)都极其巨大”的认知。
投资者就像奥德赛船上的水手,心甘情愿被海妖的歌声诱惑……
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖