X用户kunchenguid复盘大模型最新竞争格局
随着上一波大模型发布热潮尘埃落定,kunchenguid已经有足够时间实际体验这些模型,现将他的完整观点整理如下。
Grok 4.5大概是近两周业界最值得关注的事件。和大量重度各类模型用户交流后,大家形成了共识:Grok 4.5是日常使用体验最舒服的前沿大模型。
开发团队精准找到了性能、速度和效率之间的平衡点,SpaceX AI也因此证明自己已经成为继Anthropic和OpenAI之后的第三家真正的行业玩家。X拥有全球最大公共线上讨论广场,可以获取实时人类数据,还收购了热门的智能代理框架,现在又证明了自己能打造顶级大模型。此外,该团队还在自研芯片、自建数据中心,甚至有能力将GPU送入太空、利用太阳能生成Token。
通过智能代理框架收集的人类使用数据,对训练优质大模型极为重要。Grok 4.5是首个接入了Cursor数据的模型,相比前几代Grok性能提升非常明显。
这也解释了多个行业现象:亚马逊要求员工强制使用Kiro、Meta在员工设备上全面部署数据收集、Anthropic禁止第三方代理框架、Google的Gemini发展不顺,核心原因都和是否拥有大规模普及的代理框架来收集数据有关。
受补贴的大模型订阅服务短期内不会终结,因为广泛的用户使用是最好的数据来源,用户其实是通过使用模型,教会模型如何完成工作,来补贴低廉的Token价格。
Claude Opus 5市场反馈不佳,几乎没有用户喜欢它。仅有的喜欢它的用户,大多用它一次性生成看起来效果出众的3D游戏内容,但不会有人为这类内容付费。
任何可以通过简短提示词一键生成的内容都没有价值,因为既然你能做到,数十亿其他人也同样能做到,无法通过这类内容创造有价值的产出。Opus 5暴露了大模型训练的一个根本性问题:当前训练方向正滑向误区,机器可验证的产出结果优先级已经超过了人类反馈。
最新的训练过程只奖励智能代理长时间运行、完成复杂项目,不再关心智能代理和人类交互的体验,充满专业术语、大段无关文本、各种无心之失。Opus 5提醒行业,我们需要更贴近人类使用习惯的AI,不该打造一个整天和冷漠机械的AI共事的世界。
Claude 3.5 Opus(文中称Fable 5)在“智慧”维度依然是目前的上限,没有其他模型能超越。之前kunchenguid曾讨论过智慧和勤勉的差异,基准测试会同时混合两个维度的表现,因此很难直观体现,但只要实际使用过就能感受到,Fable 5在智慧维度是业界最佳,哪怕它没有在所有基准测试中登顶。
Anthropic对包括开源模型在内的其他竞争者非常警惕,担心对手达到同等智能水平,这说明Fable 5的竞争壁垒并不牢固,智谱Kimi K3已经预示了同水平竞品的出现。
同时,Fable 5首次让Token成本成为非常现实的问题,它是目前唯一一个用户无法负担全天持续使用的大模型。这种情况可能会维持一段时间,未来我们只能选择性地将特定任务交给Fable级别的模型,不能把它当作日常工具。
OpenAI目前处在一个值得关注的位置。GPT系列一直以来在效率上表现出色,但现在Grok 4.5已经在这个领域具备很强的竞争力,同时GPT也还没达到Fable 5的智慧上限,GPT-6可能会改变这一局面。
OpenAI有两个可选发展方向:一是继续押注效率,在Claude价格过高、Grok品牌认可度不足的企业市场推进落地,这是一个非常可行的策略。二是和Fable在智慧领域正面竞争,在贴近人类使用体验这个维度击败对手,但传统上这并不是OpenAI模型的优势,因此这个策略投入产出比可能较低。
现在大模型行业格局正变得越来越复杂,希望这些实际使用后的观点,能帮大家理清当下行业发生的变化。