AI Pulse
🔥 热点深度解读

OpenAI新模型被传藏起推理过程,我们算不出账了

有人刷到AI圈的新爆料,说OpenAI下一代模型Astra,藏起了它的推理过程。

这个传言起源于一条爆料推文,称Astra采用了名为Looped Transformers(循环Transformer)的循环深度技术。

根据已验证的信息,循环深度技术最早在2025年2月的论文中被描述,可以帮助模型改进生成答案的质量。但如果模型使用更多次循环传递,更多计算会发生在人类无法作为文本读取的内部隐藏状态中,难以被监控。

OpenAI首席科学家Jakub Pachocki(推文署名@merettm)认为:当前包括Astra在内的前沿模型,计算图深度和GPT-4的差距不超过两倍。OpenAI从最早的推理模型开始,就一直在保留和使用思维链监控技术,也非常重视这项能帮我们观察模型对齐(让AI行为符合人类预期)如何在训练数据外泛化的技术,只是这项技术本身很脆弱,目前的发展趋势并不乐观。

原本我们看AI怎么得出答案,就像看店员打包商品,每一步都能看得清清楚楚。用了循环深度技术后,部分打包过程挪到了后台的封闭房间,我们只能拿到最终成品,看不到中间的操作。

对普通使用者来说,这暂时不会改变你和AI聊天的体验,但影响的是AI安全研究者对模型的监管能力——如果研究者都看不到模型怎么一步步得出结论,就更难提前发现它会不会做出危险的输出。

OpenAI已经公开说明,Astra可能达到临界级别的网络安全能力,这本身就是需要严格监控的能力方向。

现在一边是需要改进能力的技术迭代,一边是越来越难打开的黑箱——到底该怎么平衡,还没有答案。

📎 参考来源

查看原始推文

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新