AI Pulse
🔥 热点深度解读

开源AI干翻了闭源顶级模型,成本还低11倍

想买AI模型做编码任务的开发者,大多在闭源付费模型和免费开源模型之间纠结过。

闭源模型性能强,但调用一次就要花不少钱;开源模型成本低,往往性能跟不上。现在这个平衡被打破了。

最新实验显示,开源模型DeepSeek V4 Flash用上「自我验证缩放」方法后,在编程基准测试Terminal-Bench 2.1上,性能超过了闭源模型Claude Fable 5,API调用成本还低11倍。

这套方法不需要给模型做额外训练,只在测试阶段优化了算力分配:先让模型生成5个候选答案,再让同一个模型给自己出的答案排序挑最好的。就是这样简单的调整,就能把模型准确率从79%提升到88%。

@jackyk02 认为:随着开源模型能力变强,它们现在已经能低成本生成大量高质量候选解,还能自己验证输出结果。

@MaxForAI 指出,这套叫「LLM-as-a-Verifier」的方法,核心就是让模型完成「自己生成、自己验证答案」的流程,最终就能实现性能反超。

做个人开发的开发者,不用再为了拿到准确的编码结果,付更高的价格调用闭源顶级模型了。

只要调整测试阶段的工作方式,开源模型就能达到甚至超过闭源模型的效果,还能把成本压到原来的十分之一不到。如果只算完整任务的整体成本,有观点称单任务花费仅需30美分。

现在已经有开发者开始用这套思路改自己现有的AI工作流,替换原来依赖闭源模型的环节。

当开源模型靠方法创新就能追上闭源模型的性能,接下来要付溢价买闭源服务的人,还会多吗?

📎 参考来源

查看原始推文

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新