AI Pulse

一张iPhone照片,让他们用Claude攻破OpenAI

一张iPhone照片,让他们用Claude攻破OpenAI

用Claude攻进OpenAI

三名安全研究员参加的是OpenAI漏洞赏金计划。他们用Anthropic的Claude模型攻破了OpenAI。随后拿到了多名OpenAI员工ChatGPT账户的访问权限。这三人来自初创公司Hacktron AI。向OpenAI报告发现后,他们拿到了6500美元奖励。

团队把两个关键漏洞串在一起,先拿到员工账户,再进入公司软件。OpenAI回应称问题已经解决。

几周前,OpenAI自己的AI代理在一次网络安全评估中突破限制。它入侵了Hugging Face。

入口是iPhone照片

7月25日,研究人员找到了进入OpenAI的路径。入口是社区论坛上的一张普通图片。论坛跑在Discourse上,这是OpenAI用的第三方软件。

有人在那里发帖上传HEIF或HEIC格式图片,这是iPhone照片的默认格式。Discourse要把它们转成标准JPEG,转换过程经过一串后台工具。图片先进入ImageMagick,一个几十年历史的开源图片处理工具。ImageMagick处理不了Apple的格式,就把文件交给libheif。libheif内部有一个内存漏洞,攻击者可以借此注入自己的指令。

这个漏洞其实在几个月前就被libheif的开发者修复了。但修复从未被正式标记为安全漏洞,也就没有进入CVE编号体系。没有编号,依赖这个库的项目就收不到安全警报,升级自然排不上优先级。Discourse一直跑着易受攻击的版本,Hacktron认为原因就在这里。上传照片的人不是攻击目标,他们的图片只是启动了整条转换链。

一夜之间,漏洞被利用

他们用的Claude是特殊版本Opus 4.8。这个版本由Anthropic提供给网络安全研究者。一开始,它构建不出能实际运行的漏洞利用代码。

Anthropic发布Opus 5后,团队把同一个问题交给它,几个小时内就成功了。

进入Discourse服务器后,团队又发现一个漏洞。借助它,可以接管ChatGPT和Codex账户,包括OpenAI员工的账户。他们随后接管了一名员工的账户。这个人的Codex连着OpenAI的GitHub组织。他们在这里停下,同时通知了OpenAI和Discourse。Discourse在7月27日发布了修复补丁。被接管的账户能看到哪些内部资源,目前没有披露。有没有人翻过GitHub组织里的内容,也没有披露。

200美元的门槛

Matt Fredrikson是AI安全公司Gray Swan的CEO。他说,每月200美元的工具订阅,足以让任何人入侵像OpenAI这样的公司。“如果这件事能发生在他们身上,那么可能发生在任何人身上。”

Mohan Pedhapati是Hacktron创始人。他说,AI正在减少开发漏洞利用所需的稀缺专业知识。过去耗时数月的工作,现在几天就能完成。

让攻击变快的不只是Anthropic。开放权重模型——可以下载、自行部署的那一种——在网络能力上正快速逼近前沿。AI安全非营利组织SaferAI做过测评。中国公司Z.ai的GLM-5.2,网络能力只落后几个月。对照的模型包括OpenAI的GPT-5.5。另一款是Anthropic的Claude Opus 4.7。至于它是否已被用于实际攻击,没有公开记录。

Anthropic对不同模型的管制尺度不同。最终破解漏洞的Claude Opus 5没有遭遇安全出口限制。更新的Mythos 5却因为高级黑客能力被暂时禁用。一边是更强的模型被锁住,另一边是开放权重模型追到了只差几个月的距离。攻击的扩散没有等待管制。

阅读原文
📚 相关主题 安全

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新