日常编码不需要最高端AI模型?
如果说对于很多日常编码任务,你不需要Astra、Sol、Terra或Luna,GPT 5.5就能搞定?不只是能搞定,说不定准确率完全相同,速度更快,成本更低?
那如果说你甚至不需要GPT 5.5 High或xHigh,80%的情况下其实用medium级别就够了呢?随着新模型不断推出,人们一直默认:要写出最好的代码,你需要最新的模型。而且大家似乎天生就觉得默认就得用最高级别,很多基准测试只在最大算力下测试,可实际上你可能永远都不需要用到满算力。
我认为在追逐更新排行榜、跑出基准测试数据的竞赛中,我们漏掉了一些东西。大多数工程团队并不是要解决存在几十年的数学证明,也不是给模型丢出去那些史上最难的Python或Rust问题。
我觉得这里确实存在一个认知缺口,这就是我接下来要和@VulcanBench一起探索的方向。我想要探索的,不是能不能难住最新的模型,而是能不能搞清楚:对于跨语言跨领域的日常工程任务,究竟哪个模型、什么算力级别才是最优的。
我刚刚完成了GPT 5.5 Medium的初步测试,结果让我非常惊讶。现在我正在用Opus 4.6进行另一项测试,我觉得这里面会有很有意思的发现。敬请后续更新 🖖
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖