AI Pulse
📡 X 信号

GPT-6 Astra七天使用总结:不符合AGI标准

KinasRemek进行了七天的GPT-6 Astra使用体验,覆盖编程、科研、娱乐多个场景。他在Pro x20订阅下,一周内用完了两次token额度。按照他的标准,GPT-6 Astra并不是通用人工智能(AGI)。

一周前KinasRemek曾提到Astra是目前最好用的AI工具,使用七天后他仍然认为Astra大概率是目前最好的AI工具,但结论并不明确,尤其是和Fable对比时。他没有发现Astra相比Sol有明显的质量提升,只发现它比已经不再实用的当前版本Sol更好。

在2026虚拟细胞挑战赛中,Astra没有找到新的解决路径,五天没有取得0.001的进步,经常困在已有方案里循环,还会过早放弃。在Heesch多变形拼图数学竞赛中,没有提示的话,Astra无法开展更开阔、更有创造性的思考。

针对OpenAI解决千禧年问题纳维-斯托克斯方程的报道,KinasRemek提出一个假设:没有人类的大量贡献,Astra无法自主解决这个问题。他认为,解决问题的关键是一群专业领域的人类专家。

整体来看,Astra是非常有用的工具,但它并不够优化。它完成任务时会消耗大量token,需要人类监督和引导方向,引导后能很好工作,但会在思考路径中迷失,尝试同时推进多个方向最后找不到方向。

在大代码库修改中,Astra处理工具调用、仓库操作和长时间任务表现很好,但会把小修改过度放大,还会做不必要的搜索和验证。任务描述不精确时,会大幅增加token成本。

Pro x20订阅的token额度,KinasRemek两天就用完了。部分任务能得到很好效果,但另一部分任务需要长时间坐在屏幕前引导模型方向。比如在Blender中制作3D模型,Asta多次出错,丢失细节、添加无关元素、弄错元素方向。KinasRemek认为Astra在图形主题生成上进步很大,但空间正确性仍然不行。

制作高质量、更复杂的游戏,哪怕是带完整剧情的高清2D游戏,当前Astra的水平只能做到复古风格,大概相当于Amiga计算机的水平。如果是AGI,哪怕KinasRemek不熟悉Blender、Unity等工具,也应该能得到满意结果,但实际并非如此,要得到满意结果仍然需要人类投入大量工作监督。

Astra的推理水平不稳定,相同任务下,medium质量模式有时比xhigh模式效果更好。KinasRemek经常切换到Fable 5.1或Opus获得更好的编程效果。

Astra在应用程序操作方面进步很大,在已有应用工作、流程自动化中特别有用,连接Unity、Blender后,控制水平很棒。

很多人在𝕏上讨论Astra的质量下滑,KinasRemek重新测试了Chain Reaction Machine标准测试,Astra完美完成了目标,虽然得到了和之前不同的机器,但仍然是顶级水平。

KinasRemek对AGI的实际检验标准是在新任务中具备自主性、可靠性和有效性。七天体验下来,Astra没有达到这个标准。能力提升并没有按比例减少获得正确结果需要的人类工作量,仍然需要经常监督它是否做对了事情、有没有改变初始假设、有没有完成任务,而用户是为结果付费,不是为模型运行几小时付费。

不可否认,相比去年的模型,Astra有巨大的质量飞跃,这种提升不仅来自模型本身,也来自应用适配和工具。作为智能体系统测试,KinasRemek用虚拟细胞挑战赛测试Astra,目前无人参与时得分0.18,和顶级成绩还有很大差距,观察Astra能否完全自主解决问题。虽然相比2025年已经有进步,那时人类表现比AI好得多,但现在Astra仍然离不开人类。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新