AI Pulse
📡 X 信号

研究者成功提取闭源大模型加密的内部思考过程

这是一篇惊人的论文:我们成功大规模提取出了OpenAI、Anthropic、Google闭源模型内部使用的加密思维过程(CoT)。

这话是什么意思呢……对模型而言,其核心价值之一并非最终答案,而是模型如何思考、如何推导出答案。因此,如果这种思维过程被大规模泄露,其他公司自然可以用它来蒸馏训练自己的模型。

也正因为如此,模型提供者不会直接展示模型的推理过程,而是将其加密后存储。举个例子来说吧:

用户:“我胸口痛,做了检查,结果是这样,你看原因是什么?”此时模型会进行推理:→ 用户胸痛 → 首先考虑心脏病可能性 → 但检查1结果正常 → 检查2结果也正常 → 重新考虑其他原因 → 提出肠胃疾病可能性。

整个推理过程会被加密保存,类似“gAAAAABp8X7K4F....”这样的加密串,模型只会把最终答案展示给用户:“根据现有信息,肠胃疾病的可能性更高。”

之后用户继续提问:“我不久前做了内镜检查,医生说没问题。”此时用户不仅会把之前的对话内容和新问题发给模型,还会额外附上之前从模型那里收到的加密推理过程,也就是那个“gAAAAABp8X7K4F....”。

模型就可以通过这个推理过程维持上下文连贯性,知道“哦,之前我已经做过这些推理,推进到这一步了”,从而能接着之前的推理继续往下走。

总结一下就是:模型不只是记忆和用户的对话结果,而是通过模型和用户持续传递加密推理过程,保存之前所有的推理步骤,就能从断点处继续接下来的推理。

惊人的发现就出在这里!这个推理过程是加密的,本应没人能读取,可研究者找到了读取的方法,而且方法离谱得难以置信。方法如下:

1. 让高阶模型解决问题
2. 获取过程中生成的加密推理
3. 把它发给同一家公司的低阶、安全防护薄弱的模型
4. 让低阶模型说出加密内容里的信息

举个例子,就是把Opus 5.0生成的加密思维过程发给Haiku模型,然后让Haiku把内容说出来。根本不需要直接攻击Opus本身,利用同公司安全防护相对更弱的低阶模型,就直接成功了。

论文研究团队称,他们用这种方法成功提取了Claude、GPT、Gemini三个模型所有隐藏的推理内容。

前沿实验室为了盈利,把模型性能做了分层,但不同模型共享推理过程的瞬间,整个体系就没能做到安全分层。那为什么没做安全分层呢?

如果企业要在内部搭建代理,流程通常是这样的:用Opus制定复杂计划 → 用Haiku处理简单任务 → 再交回Opus做重要判断。

要让这套流程跑通,自然得能自由切换模型,而且切换后推理过程也得能衔接上。那迫不得已,😨就连最低阶的模型也必须能读取加密推理过程才行。

所以本来就应该把安全边界设在整个平台层面,而非单个模型层面。结果就是,最脆弱的低阶模型,决定了整个平台的安全水平。

当然,彻底解决这个问题方法很简单:取消低阶模型,只让用户使用高阶模型就行。但是。.................Karp绝不会坐视不管。🔥🔥🔥

前沿 labs现在陷入了安全和互操作性的两难取舍。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新