GPT-6 Astra在AGI测试中取得突破性进展
GPT-6 Astra是ARC-AGI-3上新的SOTA。这是迈向AGI的质变式大跨越,进步速度坦率说令人惊讶。
话虽如此,我们目前还没有证据称它就是AGI。
虽然我们仍在研究人类能力的差距,但我们认为开放式发明仍是未解决的问题,这将成为ARC-AGI-4的新基础。
提醒一下,ARC v3测试模型是否能弄清楚如何高效理解陌生环境,并在其中自主朝着目标行动。
总结:配置得当的Astra现在可以做到这一点。
直接测试模型,每局游戏花费约500美元,得分66%。比之前Sol的8%有所提升。这与我们迄今为止验证的所有其他ARC v3得分是直接可比的。
这个得分能最好地展示基础版Astra的通用智能。使用OpenAI专属适配器(该适配器是开源的),我们验证了首个在每局花费300美元时达到100%得分的情况。
如果你通过API使用Astra,我建议优先迁移到启用压缩的/conversations端点。
直接模型测试对于AGI研究而言一直有重要的科学意义。但提供商适配器能更好地预估你在产品中使用这些模型时日常体验会是怎样的。
Astra的行动效率也相当惊人。使用提供商适配器时,Astra平均比我们的人类基准(两名人类基准都得100分)少用50%的行动。
令我们惊讶的是,所有模型在v3上的行动效率都呈现非常明显的双峰分布。模型要么理解了游戏,要么没有。较弱的智能体模型无法通过“蛮力”得到低效的理解。
从策略上讲,我们的结果支持在将智能体部署到环境中时始终使用Astra更高推理层级。这不仅能让Astra表现更好,而且更便宜(因为需要更少轮次)。
Astra似乎利用的关键技术是即时符号世界建模。它通过交互为环境开发自定义代数和符号,并利用这种理解进行规划(所有这一切都在token空间中完成)。这种方法类似于我们之前看到的,通过旁挂可执行程序创建符号模型来对环境建模并规划的研究。
基于Astra的结果,我现在看到了通过水平数据缩放和持续学习实现递归自我改进的清晰路径,其中学习到的状态是存储和管理在模型权重之外的信息(文本、程序、数据库等)。
我预计越来越多的“学习”会发生在模型权重之外,这对研究人员和AI产品构建者来说都会越来越受关注。
有一个重要能力领域我们还没有看到任何模型展示过,那就是开放式发明和发现。人类显然拥有这种能力,而到目前为止我们还没有看到任何证据表明前沿AI——哪怕强大如Astra——能够完成这一壮举。
对比10年前和今天的AI研究,人类已经发明了这么多东西:transformer、自监督LLM预训练、扩散模型、RLHF、测试时自适应……
社会需要的AI系统不仅仅是能够朝着既定目标自主行动。我们需要AI系统帮助构建原本没有明确定义的美好未来。
我认为我们现在处于一个非常脆弱的境地。我们现在已经拥有了极其强大的自动化系统,能够造成大量颠覆。如果没有AI已展示出发明能力这种制衡力量,我担心社会会越来越反对前沿开放AI研发——将我们困在一个非常糟糕的中间地带。
我们必须迅速行动,集中精力朝着这项重要AI能力前进。这已经成为我们ARC-AGI工作的首要重点。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖