研究者偷出闭源大模型的内部思考过程,还挖到敏感数据
这是今年人工智能领域最出色、最引人震撼的研究论文之一,也是过去几天传播最广的一篇,论文标题为:Stealing Reasoning Traces from Proprietary LLM APIs。其中一位研究者关于这篇论文的推文发布几天内浏览量就超过了320万。
这篇论文的核心思想是,揭露了一个非常奇怪的安全问题,问题出在部分知名人工智能模型处理自身内部「思考」的方式上。如今,当你使用 Claude、GPT 或 Gemini 这类模型处理需要推理(Reasoning)的任务时,模型在给出最终答案之前,会在内部生成一长串步骤。这些步骤就叫做推理路径(Reasoning Traces,也叫Chain-of-Thought,思维链)。
出于安全和知识产权保护的原因,公司不会向你公开这些完整步骤,以此保护自身模型的输出,防止被盗用,但问题就从这里开始。在部分API中,系统需要保留这些推理内容,以便后续继续完成对话,因此系统会将其以加密数据(Encrypted Reasoning Blocks)的形式发送给用户,再由用户在下一次请求中将其发回给模型。
按理说,内容是加密的,因此你无法得知里面有什么。但研究者发现了一个重要问题:这些加密数据可以在会话、用户甚至同一服务提供商下的不同模型之间传输。方法非常简单:
• 研究者向一个强模型请求完成任务,获取加密推理路径(Encrypted Reasoning Trace)。
• 把同一个加密推理路径发给同公司的一个弱模型。
• 然后对弱模型进行越狱(Jailbreak)绕过限制,让它泄露推理路径的内容。
结果是什么?弱模型在部分情况下可以把强模型的内部推理以明文形式输出,根本不需要入侵强模型本身!就好比你有一个放在加密信封里的机密文件,你自己打不开,但你可以把这个信封交给同公司的另一个系统,它能读里面的内容,然后你再劝它告诉你里面写了什么。
研究者在以下厂商的模型上测试了这个方法:
• OpenAI
• Anthropic
• Google
但这篇论文的重要性不止于揭露模型的推理方式。研究者收集了 GitHub 和 Hugging Face 上公开发布的6708条智能体轨迹(Agent Trajectories),成功重建了超过31.5万个对发布者来说原本只是加密数据的推理块(Reasoning Block)。
他们在这些内容里找到了数百条敏感信息,比如个人身份信息(PII)、API密钥、密码、访问令牌(Access Tokens),还有原本发布的回答中根本没有出现过的技术信息。对企业来说,这就引出了一个更大的问题。
如今我们构建基于AI Agents的系统时,我们打交道的不只是提示词和回答。还有推理路径(Reasoning Traces)、工具调用(Tool Calls)、智能体状态(Agent States)、日志(Logs)、上下文(Context),所有这些都已经成为系统攻击面(Attack Surface)的一部分。
这项研究另一个引人注意的发现是,他们发现这些推理路径在模型蒸馏(Distillation)中可以有很高的价值,也就是把强模型的推理方式迁移给另一个模型,通过用这些推理路径训练另一个模型来实现。
他们甚至做了测试,只给 Kimi-K3 提供 Claude Opus 在部分问题上推理过程的前1%,就观察到 Kimi 的答案开始明显向 Opus 的风格和答案靠拢,哪怕他们并没有给 Kimi 提供完整答案本身。这不能证明 Kimi 是用 Claude 的数据训练的,但它说明了为什么企业把推理路径视为自身知识产权的重要部分,也说明了这些数据在迁移模型行为和能力上的威力有多大。
论文提出了一个非常重要的观点。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖