实测对比后,称 Anthropic 方向比 OpenAI 领先
GPT-6 Astra 用下来,我真的开始怀疑 OpenAI 的方向走错了。
它很擅长目标明确、有固定正确答案的任务。但碰到开放、发散、没有标准答案的事情,就特别别扭。自由探索一个想法、写点有意思的东西,或者面对模糊的问题自己判断值得往哪走,这些才是我觉得它明显欠缺的能力。从 GPT-5 开始,我就有这种感觉。
很多任务开始时,连最终想要什么都没确定,需要在探索过程中逐渐发现。GPT 却总像在等你把题目出完整,把验收标准列清楚。可如果这些都得我先想好,最需要智能的那部分工作,我已经自己做完了。
我怀疑这也解释了它为什么那么爱堆防御性代码、写一大堆测试。测试能给出明确的通过或失败,它很容易一直围着这些可验证的结果打转。至于方向有没有价值、有没有更好的可能,就需要另一种判断力了。
Claude Fable 在这类任务上给我的感觉就好得多。它会从理解你想做的事情出发,顺着不完整的想法继续展开,给你一些原本没想到的可能性。即使没有固定答案,也能把事情往前推进。
这让我怀疑 OpenAI 是不是太执着于能判对错、能计分的能力了。真实世界有太多任务根本没有标准答案。在这种自由探索和开放任务上,我觉得 Anthropic 才是真正领先的,光看表面跑分看不出来。