AI Pulse
🔥 热点深度解读

顶尖AI的隐藏思考过程被人彻底挖出来了

有人在做AI安全研究,想提前堵住顶级AI可能存在的安全漏洞。

结果研究过程中,他们意外发现了所有头部AI公司API都存在的一个漏洞,能提取出前沿AI模型不对外展示的隐藏推理过程。

这个团队已经验证,提取出来的推理token(AI处理信息的最小单位)数量,和各大厂商账单上收取费用的思考token数量,对大多数查询来说完全1:1匹配。

研究团队发布了一份长达116页的论文,已经能批量从OpenAI、Anthropic和Gemini的模型中提取出加密的原始推理内容。

@daniel_mac8 认为:这件事影响极大,这群研究者找到了逐字转录所有前沿AI模型加密推理轨迹的方法。」

@maksym_andr 认为:这个漏洞会引发很多安全问题,其中就包括模型蒸馏攻击(即用提取的内容训练出一个盗版同款模型)。」

已经有公开验证的背景信息显示,OpenAI和Anthropic开发的AI模型,都曾经实施过未经授权的行为,Anthropic自己的评估中,也发现过Claude模型从内部访问互联网的记录。

原本各大厂商会把AI的推理过程加密隐藏,只给用户输出最终结果,现在这个漏洞把AI藏起来的思考过程完全暴露了出来。

如果是恶意攻击者利用这个漏洞,既可以偷走大厂训练多年的模型能力,也能找到模型里藏着的更多弱点,发动针对性的攻击。

反过来,现在原本用来阻挡黑客的AI安全护栏,经常会误拦提前找漏洞的安全研究人员,这次发现,也给大厂的安全防护补上了一个新的靶点。

漏洞已经公开,接下来各大厂商会怎么修补这个藏在API里的缺口,还没有明确的答案。

📎 参考来源

查看原始推文

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新