AI Pulse

GPT-6发布:复杂推理测试提升8倍,日常使用被指更贵没变强

OpenAI 总裁 Greg Brockman 在 GPT-6 发布前丢了一句话:“认为我们现在处于 AGI 时代,并非不合理。”紧接着 GPT-6 就上线了,官方页面在 openai.com/index/gpt-6-astra/。

这句话很快撞上了具体的分数。ARC-AGI-3 上,评论提到 GPT-6 借 harness 拿到约 60%,这个成绩被形容成异常值,比前代高出 8 倍。不挂 harness 的结果也被认为不错,有人预判新一轮炒作周期又要开始。

另一项基准的讨论就冷静得多。DeepSWE 上的提升,评论用的词是“不大”。有评论者干脆说:“这个模型只在基准测试里好。”

日常使用的评价也不兴奋。独立基准没有显示 GPT-6 比 5.6 sol 更好,还更贵。另一条是:它在某些方面更好,在其他方面更差,价格贵,但没达到预期。对个人和小企业来说,为一个没怎么变强的模型花更多钱,值不值已经是个现实问题。

“AGI”的说法也被拉了回来。一条评论给出具体定义:“33% AGI”指能替代 33% 的远程工作者,同时每名工人每小时花 20 美元计算成本。按这个标准,GPT-6 够不够格,没人给出答案。Brockman 那句更像立场,不是拿得出证据的事实。

竞争格局的讨论更直接。有评论说 LLM 的地盘已经不是 OpenAI 的,是 Kimi 的。也有人说没有身体的 LLM 天然受限,下一步得看能做真实世界研发和制造的机器人。还有评论补了一刀:中国在这条路上领先,西方跟不上。这些说法未必准,但至少能看出,OpenAI 不再是唯一焦点。

舆论场里最轻松的一句是:“我们在 GTA 6 之前等到了 GPT-6。”也有人直说:“说实话,我已经不再关心了。”几轮讨论下来,GPT-6 到底站不站得住,得等独立评测和真实使用跑过一阵才有答案。

阅读原文
📚 相关主题 OpenAIGPT-6

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新