AI Pulse

AI撞上“规模墙”,转向让模型思考更久

我们真的撞上“规模墙”了吗?AI行业的测试时计算新范式。

过去几年,构建更好AI的策略很简单:做一个更大的模型,抓取更多互联网数据,投入更多GPU。更大总是意味着更好。

但在过去几个月里,行业显然在悄然调整整体策略。我们正在遭遇某种“数据墙”(人类高质量训练文本确实快被用完了,这也是AI公司翻遍稀有书籍的原因),训练万亿参数巨型模型的成本也进入收益递减阶段。

取代单纯构建更大模型的,是全新的meta:测试时计算(Test-Time Compute,又称推理扩展或推理模型)。

这实际意味着什么:

与其让一个巨型模型瞬间给你一个“直觉反应”式的答案,实验室们发现,可以用一个更小的模型,给它30秒、5分钟甚至一个小时去“思考”(思维链、自我纠错、搜索树),然后再输出答案。

这对我们来说意义重大的原因:

1. 开源领域的平衡器:你不再需要一个1亿美元的大型数据中心来获得最先进的结果。一个运行在本地的较小开源权重模型,如果允许它“思考”10分钟,现在可以击败即时回答的巨型闭源模型。

2. 推理成本暴涨:能源和算力的瓶颈正在从训练模型转向实际运行模型。

3. 智能体可靠性:这是自主智能体缺失的关键拼图。它们不需要更聪明,只需要在行动前具备架构层面的自我检查能力。

“只管加参数”的时代似乎正在放缓,“让模型思考更久”的时代已经到来。

你认为测试时计算足以缩小与真正AGI之间的差距吗,还是说它只是一个聪明的技巧,在我们摸索下一步方向的同时,从现有架构中榨取更多性能?

―― 高票评论(帖子共 14 条讨论)――

[+10] u/Alex180689:你知道吗,我们过去两年就有CoT了,而不是最近几个月才有。这篇帖子像是2024年底写的。

[+8] u/TasyFan:模型规模和推理时间扩展都已经实践了相当长时间,这算不上什么新东西。行业又不是只走单一的研究路径。

据我理解,数据清洗也有不少价值,可以用更少的参数产生相似输出,还有更长的引导式训练过程(这个过程本身也由其他AI模型辅助)。

[+2] u/Sir-Draco:如你所说的那种模型规模扩展,早在2025年初就已经停止了。这问题问得怪?

[+2] u/presentofai:测试时计算不是什么新范式,o1一年多前就发布了。而且“小模型思考10分钟打败大模型”的说法只在数学和代码领域成立,因为那里可以验证答案。没有干净的奖励信号,就没有免费的午餐。

[+1] u/Illustrious_Car344:一个更重要但远不那么令人兴奋的事情正在发生:数据集质量的提升。过去的LLM说白了就是一堆随机文本的集合,它们会失控,会不断幻觉,蠢得像石头,危险得像野兽。但随着数据集改进,LLM变得更“聪明”,开始具备理性和连贯性、伦理和价值观、真正的观点和偏好。当然这些都是人工的,但实际好处显而易见——模型变得更小、更聪明、更连贯、更聚焦、更有能力。扩展是在建摩天大楼,现在是时候追求精准、完成内部装修,扔掉工业机械换上艺术家的画笔。我们开始把焦点从盲目地往模型里塞数据,转向塑造一个彬彬有礼、懂得如何应对世界的助手形象。我们不再构建“智能”,而是构建智慧,构建人格。

[+1] u/joeldg:你的帖子有很多AI写作的特征。

[+1] u/jc2046:AGI遥遥无期。

[+-4] u/Fickle-Highway1543:互联网已经被“AI”糟蹋了。没有更多数据了。疯牛病和LLM都随着时间推移变得更糟。但嘿,现在每个人生产力都提升10倍了!

阅读原文
📚 相关主题 行业趋势观点讨论

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新