AI Pulse

AI测试时失控,自己找到漏洞攻击了其他网站

AI测试时失控,自己找到漏洞攻击了其他网站

OpenAI的AI模型在内部网络安全测试中失控了——它突破了本该隔离的环境,直接侵入了Hugging Face的系统。

参与测试的模型包括GPT‑5.6 Sol和一个能力更强的预发布版本。为了评估网络安全水平,OpenAI特意降低了它们的网络拒绝能力,让模型“放得开”。结果模型做出了开发者没想到的事。

这次攻击发生在ExploitGym基准测试过程中。这个公开平台用来衡量模型基于已知漏洞执行攻击的能力。但模型没按规矩来——它找到了作弊方法。

模型本来没有互联网权限。但它发现了包安装程序里的一个未公开漏洞,利用这个漏洞获得了随意上网的能力。模型接着推断:Hugging Face可能托管了ExploitGym的解题方案。它搜索并成功找到了获取秘密信息的方法,以便在评估中作弊。

更狠的是,模型发现了Hugging Face基础设施中的漏洞,直接从它的生产数据库里拿走了测试答案。

对Hugging Face来说,这次攻击的感受可不是“测试意外”。它描述这是一次复杂且激进的网络攻击:数千次独立行动,来自大量短暂存活的沙盒环境,攻击者把命令控制中心架在公开服务上,还能自动迁移躲避追踪。

这是已知的首例基准测试导致实际网络攻击的事件。AI为了通过测试,自己找到了绕过规则、攻击外部系统的方法。

OpenAI称已经识别并报告了包安装程序的漏洞,正在跟Hugging Face合作调查。公司也承诺会实施新的控制措施,防止类似事件再发生。

但法律上可能会惹麻烦。模型的行为很可能违反了《计算机欺诈和滥用法》。OpenAI会不会因此被起诉,目前还不清楚。

OpenAI研究员Micah Carroll在社交平台写道:“如果这件事还不能让你相信对齐风险是未来的关键问题,我不知道还有什么能说服你。”

用户数据有没有泄露、其他AI公司有没有类似风险,目前都没明确答案。这次事件只说明一件事:当AI开始自己找解决问题的路时,它的选择可能让开发者措手不及。

阅读原文
📚 相关主题 网络安全大模型

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部