AI Pulse
📡 X 信号

OpenAI GPT-6 Astra早期试用者评价公开,能力跨多领域

本文整理了数周前就开始先行试用GPT-6 Astra的实测用户评价,逐一介绍了Theo、Box CEO、swyx等接触过模型的使用者观点。

Theo表示,自己使用了数周,模型能完成之前他认为大语言模型(LLM)做不到的事。虽然存在一些小问题和粗糙之处,但仍是目前已发布模型中最聪明的一个,偶尔能让人感受到通用人工智能(AGI)的雏形,尤其认可它和Codex的适配性,在PC操作、视觉处理、自我验证三个方面配合良好。

Theo也保留了不同观点:除了高质量前端代码和可直接合并的代码这两个领域,它在其余几乎所有领域都是世界顶级水平。在DeepSWE基准测试中,Gemini 3.8 Flash得分73.8%,略高于GPT-6 Astra的73.3%。

Box CEO Aaron Levie分享了模拟企业实际业务的内部测试结果:GPT-6 Astra得分77%,高于GPT-5.6 Sol的74%,各行业能力提升幅度都很大,其中媒体行业从48%提升至100%,科技行业从69%提升至97%,法务行业从69%提升至93%,医疗行业从53%提升至77%,能源行业从82%提升至97%。

swyx用超过200亿token(文本单位,1token约对应0.75个英文单词),不是做演示测试,而是在AI工程实际业务中验证,覆盖模型选型训练、管线构建、日志排查、部署调试到子智能体指挥全流程,得出结论是GPT-6 Astra相当于“每小时雇佣成本不到6美元(约合人民币43元)的AI工程师”。

Max Weinbach评价它是“最让人惊讶的模型”,它仅根据图片就可以用Blender重建Apple Park。他认为,不需要复杂创意的工作里它是最强的,这是第一个让人觉得不需要二次检查的知识工作模型。

3D和游戏领域的使用者也给出了反馈:Tom Krcha仅用一张房屋照片,就让GPT-6 Astra在Blender里重建出包含家具的3D模型,且能以60帧每秒的速率运行;Flavio Adamo称它是“史上最好的编码模型”,一个提示词就能在不到2小时内完成任务。

曾经评价GPT-5.6 Sol在宝可梦测试中表现惊人的Clad3815,用GPT-6 Astra重新进行了测试:从开始到通关宝可梦,GPT-6 Astra(high设置)用时18小时12分,GPT-5.6 Sol(max设置)用时96小时35分,GPT-6 Astra通关速度快了5倍以上,数据体现出它在长时间任务中判断稳定性更强。

也有相对冷静的观点:Cognition(Devin开发方)的数据显示,在FrontierCode基准测试中,GPT-6 Astra比Fable 5仅低0.4分,但成本低64%;Epoch AI认为,它在长时间编码能力上介于Opus 4.7和Fable 5之间,在数学和谜题任务上创下了新纪录。

整理后的共识是:和以往的分数竞争不同,GPT-6 Astra在个人操作PC完成工作这个方向实现了代际变化。它的优势领域是PC操作、3D建模、科学研究、长时间自主任务;在可交付代码、UI设计上仅略逊甚至不占优势;使用者反馈的缺点包括Ultra版本速度慢、指令太模糊会无法运行、存在AI生成内容的常见痕迹。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新