AI Pulse

本地模型不会赢:推理终将集中在数据中心

本地模型不会赢:推理终将集中在数据中心

每次有新的开放权重AI模型发布,就会有人说本地模型才是未来。既然每个人都能在笔记本电脑或手机上运行AI模型,何必花数十亿美元建设数据中心?我认为这种想法注定失败。无论开放权重模型变得多强大,绝大多数推理永远会发生在AI数据中心里。

本地模型太弱,无法广泛使用

本地模型永远不会那么强大。我觉得这一点应该是显而易见的:目前所有前沿模型(无论是封闭还是开放权重)都太大了,除了数据中心里的完整GPU集群,根本跑不动。当然,较小的模型会随着时间推移变得更智能。一年后,你也许能在笔记本电脑上运行一个与GPT-5.6-Sol差不多强的模型。但到那时,你会觉得GPT-5.6-Sol弱到没用了。

很多人否认最后一点,但事实如此:几乎每个人的显性偏好都是使用自己价格范围内最强可用的模型。如果AI进步在GPT-4时就停滞了,我想我们本可以围绕它构建一些非常强大的工具,但今天谁还会用GPT-4?随着LLM能力的增强,我们对它们的期望也在增长:我们现在期望智能体系统能够越来越独立地解决更多问题。当它们感到困惑或卡住时,会让人极度沮丧。当面临选择时,人们会挑选那个让自己少受挫折的模型,而那个模型永远会是更大、更强大的那个。

本地模型更贵,效率更低

除此之外,数据中心模型总是更便宜。我不明白为什么人们一直说本地模型便宜:在我看来,这跟人们说开Uber是“免费赚钱”(忽略了油费和车辆磨损成本)是同一个错误。仅仅一套低端家用实验室[1]的搭建成本,就能购买好几年的AI服务商付费订阅。电力成本每月大约在50到300美元之间,取决于你跑了多少推理:这又相当于几份付费订阅的价格。

为什么数据中心模型更便宜?不是因为有补贴:推理其实相当便宜。如果你在本地和数据中心运行同一个模型,数据中心的模型本质上会更高效。

主要原因是批处理。一块GPU可以像执行一次数学运算一样快地执行数十万次数学运算。然而,对于单个用户的推理,每个新token都依赖于前一个token的结果,因此无法批处理[2]。可以批处理的是数百个用户一起推理。这消耗的时间、电力和热量基本上和一次只为一个用户推理一样。

当你在家运行自己的推理时,你没有什么可以批处理的——至多同时跑几个AI智能体——所以利用率非常糟糕。你付了很多潜在推理的钱却用不上:它们就这样被浪费了。唯一的解决办法是找一些朋友,把你的本地推理端点暴露给他们(到了那一步,你基本上就是在运行自己糟糕的小型数据中心了)。

另一个原因是数据中心拥有更大、更高效的GPU。你用来运行本地模型的那种消费级GPU,是像RTX 4090这样的游戏GPU。而专为批处理AI推理设计的数据中心B200,在同等功耗下能提供大约三倍的浮点运算能力和接近四倍的内存带宽[3]。所以,把批处理和GPU效率加起来,你在本地运行模型要消耗大约30倍的资源。

顺便说一句,这也是为什么我对那些说“本地模型好,因为它们不像那些大型可恶的数据中心那样消耗资源”的人持怀疑态度。如果你想高效地运行LLM,你应该尽可能多地把你的使用量推给AI数据中心!善意地理解,他们的意思是我们都应该运行更小的模型——但即便如此,你也应该通过GPT-5.6 Luna API之类的方式使用小模型,而不是自己托管。

本地模型怎么可能赢?

是否存在本地模型获胜的可能世界?我想是有的。一种情况是,政府干脆禁止使用AI数据中心:无论是出于对AI危险性的担忧,还是只是迫于公众压力。在那个世界里,本地模型就是唯一的选择。

另一种可能是,大型模型的AI进步以某种方式停滞,而小型模型继续进步。我很难想象这怎么会发生(除非上述政府干预),但一个30B参数模型能成为前沿模型的世界,就是本地模型可能具有竞争力的世界。

又或者,模型变得如此之好,以至于一个30B模型真的足够聪明,能做所有事情,那么除非需要解决黎曼猜想,否则没人真正需要Opus或Sol这样的模型。我不太相信这一点。今天的模型已经能做前沿数学工作,但仍不够聪明,不能像我一样重构大型代码库,所以很难想象一个我不想使用最聪明模型的世界。

本地模型并非无用

我确实认为本地模型永远会有自己的小众市场。这让我想到Thinking Machines“交互模型”背后那个出奇简单的想法(OpenAI也这么做,因为这很明显):对于语音聊天这类对延迟敏感的应用,由一个小而快的模型负责对话,它把需要认真思考的任务委托给一个更大、更慢的模型。如果五年后大多数AI使用都通过手机或笔记本电脑上的本地模型来做中介,我不会感到惊讶(尽管在那个世界里,几乎所有实际工作仍由AI数据中心完成)。

有些用户即使知道本地模型更弱、更贵,也还是会偏好使用它们。例如,能在本地操控模型,对这类用户来说可能就是一个杀手级功能。另一些人可能只是看重对自己基础设施的完全掌控,或者网络不可靠[4]。如果你是这类人——尤其是你只跟模型聊天,而不是用于研究或编程——本地模型对你来说是个好选择。不过,我认为这永远只会是一个小众群体。大多数用户将继续通过数据中心来做推理。

---

[1] 这个链接是一年前的——现在的东西要贵得多了。
[2] 具体来说,瓶颈在于把模型权重移入GPU,这必须做,而且无论你是为一个用户的token还是为一百个用户的token做,所花的时间都一样。
[3] 这是我用LLM辅助估算的,但你可以自己去NVIDIA核对数据。
[4] 同时还得有可靠的电源和足够的钱来配置一个家用推理集群。

阅读原文
📚 相关主题 行业观点

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新