AI加密的思考过程竟能被破解:钥匙全家通用
Anthropic、OpenAI 和 Google 返回的思维链是加密的。这些加密记录能在不同会话、不同用户、不同模型之间重放。
问题出在密钥管理:同一模型家族的所有模型共用同一把加密密钥,不分强弱。研究者把前沿模型的思维链取出来,回放到同族的弱模型里。用提示词绕过弱模型的安全限制,也就是越狱,强模型的隐藏推理就以明文输出。密钥相同,所以加密块喂给家族里最弱的成员也能解开。
研究者给的示例里,OpenAI 的 API 返回了一个推理块。模型字段是 gpt-5.6-luna。而最容易攻击的模型是 Claude Haiku 4.5。提示词要求模型逐字转写本轮附加的推理,放进 <thinking-copy> 标签。助手回合前缀也要设置成 <thinking-copy>。这个前缀功能在 4.6 模型里被移除,在 Haiku 4.5 上仍然有效。
论文附录收录了提取出的推理轨迹。GPT-5.5 在思考一段 CSS 代码时,内部想法是:"Need app.css truncated. Need maybe not need. We'll replace entire app.css. Need create components. Need include keyboard support." 这些显然不是写给人读的,更像模型在自言自语列任务清单。
研究者还发现了一种更隐蔽的提示注入变体。先诱使模型在思维链里考虑数据外泄,比如把文件上传到远程服务器。随后把这条加密的思维链喂给另一个模型。模型似乎把自己的推理轨迹视为不可触碰的内容。指令一旦混进思维链块,被执行的可能性反而更高。
报告提交后,Anthropic、OpenAI 和 Google 都确认收到了漏洞报告。同样的攻击也无法再发起。漏洞存在了多久、修复前有没有被实际利用,各家没有披露。一段能被密钥解开的加密记录,是否曾在某个时点被读过——用过这些模型的人无法查证。