AI的隐藏思考能被人完整偷看,它可能是在背答案
一篇新论文展示了一个具体的安全缺口:可以100%看到所有Claude和GPT模型的推理token。论文题为《Stealing Reasoning Traces from Proprietary LLM APIs》——从专有LLM接口窃取推理痕迹。论文已经发布在arXiv上,作者还公布了大量推理示例。GitHub上出现配套仓库stolen-thoughts,把这些示例集中到一起。
所谓推理token,是大模型在给出最终答案前内部写下的思考文字,通常不展示给用户。论文把这段平时看不到的思考完整截了下来。
被偷看到的推理内容,立刻引出一个让AI公司不太舒服的问题:模型到底在解题,还是在背答案?
最热门的评论贴出Claude在AIME(一项数学竞赛基准)里的推理记录。面对一道题,Claude没有从读题开始,而是直接写下:“这是已知的AIME问题。答案是60。让我回忆。让我解决。”评论者的回应是:“微妙啊,Anthropic。”
模型先想起题目和答案,再开始“解题”,那基准分里有多少是真正的推理,就得打个问号。发帖人认为,那些显示前沿模型压过开源模型的性能曲线,可能被高估了。
跑开源模型时,偶尔会看到奇怪的推理:蹦出没有意义的词,或者在一个简单问题上反复绕圈。过去这常被归为开源模型质量不行。论文贴出的示例里,前沿模型几乎总是这样。这种表现不是某一类模型独有的毛病。
发帖人的判断更直接:“开源模型并没有推理token显示出来的那种差距。没有秘密配方,只是数据、计算和工程。”
评论区聊到蒸馏。有评论者认为,中国实验室可能一直在用这个漏洞做蒸馏。做法是把前沿模型的推理输出当训练材料,去训练更小的模型。按他的说法,开源模型因此比想象中更落后。他提到,一个多月前中文互联网流传的GLM相关传闻“似乎相当准确”。传闻说,GLM破解了这个技术,并传给了其他中国实验室。
关于漏洞的实际影响,社区分成两种判断。一种认为,它一直被中国实验室利用,现在漏洞关闭,蒸馏会慢下来。另一种认为,价值没那么夸张:它有助于后训练和强化学习目标,节省资金,仅此而已。目前没有证据分辨哪种更接近事实。
另一边,对开源的乐观预测照旧。也有人预测,年底前会出现能力达到GPT 5.6 Luna max级别的开源权重模型,还能在128G设备上运行。这只是一个人的预测,不一定能实现。但放在“开源并没有那么远”的讨论里,它代表了一种乐观方向:差距可以追。
抛开基准测试,评论区里的实际使用体验是另一幅画面。
有评论者说,用Fable模型15分钟,“它可能在基准测试上刷过分,但它真的非常强大。”benchmaxxed是社区里的说法,指针对基准测试做了优化、分数有水分。但分数有水分,不代表模型不行。
另一个评论者说,自己的客厅已经改成数据中心。所有“笨重但token消耗极大”的任务,都被他卸载到两台模拟赛车设备上跑。在他看来,前沿模型在任务编排上仍然比本地模型好得多。基准分数和实际体验,经常是两回事。
有开发者一直禁用模型的思考模式,“因为更容易解析和记录推理”。他维护着一个专门输出完整思考链的命令。调试代理时,有些问题必须看到推理过程,才知道代理在哪里出岔子。
还有评论者建议,别太盯着基准测试,更要看实际任务表现和正确的调用方式。模型真正行不行,上手用了才知道。
模型厂商普遍不把推理过程放出来。有评论认为,这件事没让人烦恼,原因有两个。一是厂商根本不显示推理内容。二是大厂有大量补贴过的计算能力,几乎不用等推理结果。
也有更尖锐的猜测:厂商藏起真实推理,是为了掩盖自己在刷榜。被戳穿时,他们又轻描淡写,用道德话术压制用户。这只是评论区的观点,没有证据。
一条成本数据能说明这类权衡有多具体。有人测量了代理里的门控机制:它比“有问必答”少问了3.7倍的问题,成本却高出25%。因为跑门控检查的花费,比省下的提问还多。
AI的每个优化动作背后,都在算这样一笔账。