连续三款前沿大模型遭用户回退到旧版本使用
一件非常有意思的事情正在发生:我一直在监测用户对新模型发布的情绪,现在已经发现连续有3个最新前沿模型都有大量用户选择回退到旧版本使用。
1. opus 5:整体评价非常负面,无法沟通,总是在信息不足的情况下急于下结论,不断犯错。它甚至现在都有了专门吐槽它的网站(真的很好笑)。很多人(包括我自己)都放弃了 opus 5,回退到了 4.6 和 4.8。
2. gpt 6 astra:越来越多人报告说回退到了 5.6,不管是 sol 还是 luna 版本。主要原因是:作为日常主力模型使用成本太高;性能不稳定——有时非常聪明,有时非常愚蠢;在理解用户意图、判断该停止还是继续生成方面表现不佳。
3. grok 4.6:我总体上喜欢 grok 模型系列,但现在越来越多证据表明 4.6 并不比 4.5 强多少。它更慢,更贵,而且在智能上没有带来明显提升。
如果只是单个模型发生这种情况,那可能只是一个坏 checkpoint,我也不会觉得这有什么有意思,但这些来自不同公司的最新模型发布,似乎全都撞上了墙?这是一件值得研究的事情。
似乎共有几个主题:
- 对大多数人来说,成本和质量的权衡已经不再合理。也许对于大多数任务来说,模型已经足够聪明了,用户不认为额外增加的智能带来的好处足以证明额外成本的合理性。也许模型公司应该更多地把精力放在让 fable 层级的模型变得极其便宜,而不是研发更好但也更贵的东西。
- 训练已经偏离了方向。opus 5 的基准测试成绩比 fable 更好就是最明显的例子——我没见过任何一个人说实际用起来 opus 5 比 fable 更好。很明显,基准测试和训练后的优化方向已经错了,人们根本不关心那些优化点。
- fable 5.1 是唯一一个我没听到多少抱怨的发布,如果说有什么不满,人们只是希望移除 50% 的使用上限,这样他们就能多用 fable。
现在有证据表明,大多数高性能开源模型都只是 Claude 的蒸馏版,这似乎说明 Anthropic 仍然拥有壁垒。你怎么看?你对下一次模型发布最期望的是什么?
我已经用 4.8 很长时间了。我并没有为了 fable 专门更改我的整体配置,所以也没什么需要改回去的 :) 我使用 fable 的方式是把最困难、最模糊的任务交给它,让它想出一个好计划,然后我再用更便宜的模型去执行这个计划。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖