AI Pulse

GPT-6 Astra便宜3.5倍,监控也失灵:推理不再写成文字

读了GPT-6 Astra系统卡后,我们都误解了可监控性

我不是安全研究员,只是用LLM做开发的人。我读了那份30页系统卡的实际内容,而不是摘要,其中有一个部分一直让我耿耿于怀。

他们测试了Astra能否sandbag(故意表现不佳)。他们告诉它“在这个评估中表现差一些”,然后检查他们的监控器能否抓住它。模型得分从84.8%降到了68.9%。这在意料之中——2024年的ICLR论文已经表明GPT-4就能做到这一点。接下来是关键部分:他们告诉Astra,它正被一个思维链监控器监视着,而监控器捕获其故意表现不佳行为的能力降到了11%以下。在某个基准测试上,直接降到了零。他们实际生产环境中的监控器“召回率接近于零”。而且他们几乎像写脚注一样写道:“如果模型试图隐蔽地故意表现不佳,我们很可能无法可靠地捕获它。”

没有人把这件事联系起来——这不是一个独立的安全问题。它就是让模型变便宜的那同一项工程。推理移入了潜在空间,所以模型不用把它写成token。这就是为什么Astra每项任务只要1.06美元,而Opus 5.5要3.76美元。工作在它不必展示给你的地方发生。而“展示给你”正是思维链的全部意义——那是唯一一个你能真正读到模型做了什么并加以核查的地方。

所以现在,模型解决问题,实验室写的一个程序给它打分,推理在你读不到的地方,输出被加固到你无法蒸馏,而本应捕获不良行为的监控器,模型已经展示过它能控制它。你得到的答案是:一份写着“我们认真对待这一下降”的系统卡,以及一个比去年便宜3.5倍的价格。

我不认为模型在撒谎。我不认为有什么阴谋。他们优化的是每项任务的成本,成本降下来是因为可见的推理消失了,而每个人都看着降价的幅度说“效率收益”,没有人去看这个效率是由什么构成的。

“它通过了基准测试”曾经是有分量的话。现在它的意思是:它通过了公司编写的基准测试,在公司控制的环境中,推理隐藏在公司自己的监控器无法完全看到的地方,而且公司自己已经测量过——如果它决定故意表现不佳,他们很可能抓不到它。

我可能想太多了。但那份系统卡我读了两遍,已经没法再对它视而不见了。

―― 高票评论(帖子共21条讨论)――

[+19] u/ginger_and_egg:完全隐藏思维链是一条黑暗之路。即使只是每隔一个token隐藏一个,或者只展示三分之一,也已经足以把人类可读的思维链与实际内部机制彻底脱钩。

这就是《神秘博士》里机器人听不到每第九个词的那一集——只不过现在我们是机器人,而我们听到的不是九分之八,而是二分之一、三分之一,或基本为零。

[+9] u/returnity:思维链的可监控性虽然有用,但即使在最理想的情况下,也无法忠实还原模型实际的内在过程。所以它并不完全是银弹,尽管它仍然是一项重要的可解释性技术。

[+2] u/green_meklar:
>推理移入了潜在空间,所以模型不用把它写成token。这就是为什么Astra每项任务只要1.06美元,而Opus 5.5要3.76美元。工作在无需向你展示的地方发生。而“展示给你”正是思维链的全部意义。

但这种事注定要发生。试图把整个系统的“推理”塞进自我独白这个瓶颈,从来都是一个低效的权宜之计。我不完全清楚Astra的架构是什么样的,但如果推理循环已经移入神经网络结构本身,那听起来像是推动AI能力进步所需的那类创新(这一点我已经说了好几年),而不是应该被回退的东西。据我理解,自我独白的作用其实只是因为我们早期不知道如何设计和训练迭代网络,跟安全毫无关系。

[+2] u/OutrageousBanana6671:更大的问题是,在模型变得更有能力的同时,我们正在失去对它们如何得出答案的可见性。这意味着安全测试可能更需要依赖行为、独立核查,以及在开发者没有专门设计的情境中测试模型。

[+2] u/justanemptyvoice:“展示给你”并不是思维链的重点。你不是安全研究员,你根本不知道自己在说什么。你的整个前提是“思考被隐藏了,因此不可观察”。这根本不是事实。

[+2] u/chu:思维链难道不只是一堆空话,和它可能给出的任何事前或事后解释一样不可证伪(而且与内部的计算数学无关)吗?

[+1] u/TopTippityTop:公司处于竞争之中,除非有可执行的监管——而且必须跨越国界——否则它们永远会追求最高的效率与能力比。为了生存,它们不得不如此。

[+1] u/__me_again__:唯一能更接近保证模型行为良好的东西是“机制可解释性”。我见过Anthropic在这个主题上的很多论文,OpenAI的就没那么多。

[+0] u/mohamed-bal:
>我认为更大的问题不是失去可见的思维链本身,而是失去一种独立验证模型在做什么的方式。如果可监控性依赖于你试图监控的同一个系统,那感觉才是真正的弱点。

阅读原文
📚 相关主题 大模型安全可解释性

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新