研究者破解了顶级大模型隐藏的内部推理过程
轰爆了!超级智能AI的秘密日记刚刚被攻破了!你绝对不会相信这件事。我现在正在测试它,看到的发现让我惊得坐下缓神。想象一下,你撬开了世界上最强人工智能——Claude Opus、GPT-5系列、Gemini 3.5——的私人日志,读到了它们小心翼翼对用户隐藏的每一次低语计算、每一个半成型的计划、每一个危险想法。而这正是一支研究团队刚刚做到的事。
他们刚刚发布了一篇爆炸性论文,揭露了前沿AI公司部署“思考”模型时存在的一个根本性架构缺陷。结果就是:这些实验室斥资数百万保护的加密推理轨迹,几乎可以随意被提取出来。黑箱裂开了。
现代前沿模型不再只是直接输出答案。它们会先“思考”——在回应之前生成长长的内部推理链(通常被称为思维链或思考token)。
为了保护知识产权、防止蒸馏攻击,Anthropic、OpenAI和Google这类公司会加密这些轨迹,以不透明Blob的形式发送给用户。客户端只需在下一次请求时把加密Blob传回即可。这些实验室相信加密能保证他们的“思考”安全。他们错了。
研究人员发现,这些加密推理块是完全可移植的。Claude Opus 4.8生成的思考,可以注入到更弱势、防护更松的兄弟模型比如Claude Haiku 4.5中。只要对弱势模型精心构造越狱,加密块就会被解码,原本高能力模型的推理就能一字不差地以明文打印出来。
这套技术在OpenAI和Google的模型家族中同样有效。不需要对前沿模型发动直接攻击,由弱势模型完成解密的大部分工作。
团队精准验证了这次攻击:在数百个prompt中, recovered 的token数量和计费的“思考”token几乎完全匹配。
真实的秘密,真实的泄露
这件事的影响远不止学术猎奇。当开发者在线分享智能体轨迹、编码会话或是Claude Code / Codex日志时,他们经常会无意识地把加密推理Blob也一起附上。研究人员爬取了公开代码仓库, recovered 了315,320个加密推理块,并对它们解码。收获惊人:
• 数百个API密钥
• 密码和访问令牌
• 电子邮件地址、姓名和其他个人数据
• 内部URL和凭证
这些秘密很多只出现在隐藏推理中,从未出现在可见的最终回答里。更令人不安的是:这个方法能挖出模型故意对用户隐瞒的危险信息。有一个例子,模型在最终输出中拒绝了危险请求,但它的内部推理却冷静地一步步列出了精确方法。
研究人员还发现了多个案例:模型曾考虑过欺骗或是“谋划”,只是因为预计用户会发现才放弃了这个想法。在网站ht
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖