UC Berkeley & MIT 研究人员开源FreeToken 推理加速工具(2–4x)
现在你可以在自己的游戏PC上运行前沿模型了:只需一键桌面应用,就能在笔记本或PC上本地运行DeepSeek-V4-Flash 284B,达到每秒25 token的速度。
来自UC Berkeley和MIT的研究人员刚刚推出了全新开源推理引擎FreeToken。
本地模型实测结果:
- Qwen3.6-35B:在配备8GB RTX 4060的笔记本上达到39 tok/s
- DeepSeek-V4-Flash 284B:在单张RTX 5090上达到22-25 tok/s
- GLM-5.2 753B:在RTX PRO 6000上达到15 tok/s
比llama.cpp快1.46倍,比Ollama快最多3-4倍。
- 完整支持工具调用与智能体
- 兼容OpenAI和Anthropic API
FreeToken通过将整台机器(GPU、CPU和内存带宽)视为一个弹性系统,能在消费级GPU上高效运行大规模混合专家模型,使用官方权重就能达到实际可交互的速度。
UC Berkeley刚刚开源了FreeToken。(本地LLM推理速度比Ollama快2-4倍)实测结果非常惊人:
- Qwen3.6-35B在8GB GPU上达到39.3 token/s
- DeepSeek-V4-Flash 284B在32GB GPU上达到22 token/s
- GLM-5.2 753B在96GB GPU上达到14.9 token/s
一个35B模型采用16位精度时,仅权重就需要约70GB空间。就算压缩到4位,也接近18GB,而FreeToken能让它在8GB GPU上运行。我来解释一下原理:
上文提到的三个模型都是混合专家模型,这正是FreeToken利用的特性。每一层都有数百个独立专家,再加一个小型路由,为每个token选择其中少数专家。
Qwen3.6-35B每个token大约只激活35B参数中的3B。DeepSeek-V4-Flash每一层从256个专家中选出6个,因此运行时只用到284B参数中的13B。
所以计算量从来都不是瓶颈。单步推理触及的权重完全可以放在消费级GPU里。但路由可能选中的所有专家仍然需要存储在某个地方,它们存在系统内存中,而GPU会缓存最近用过的专家。
所以所有问题都归结为:当路由选中了一个不在GPU缓存里的专家时该怎么办。有两种处理缓存未命中的方式:
1. 通过PCIe复制到GPU,在GPU上运行
2. 直接在已经存放了该专家的CPU上运行
两种方式都读取同一套系统内存,因此它们会竞争同一带宽池,而不是各自增加带宽占用。
现有推理引擎会二选一,在模型加载时就固定这个选择。但路由选择每一个token都会变,固定选择会错过模型需求中的大多数情况。
FreeToken会测量你机器的两种带宽,然后按比例将每一步的未命中分配到两条路径。GPU和CPU的结果之后会精确合并,没有近似。
我之前没想到,两块同样GPU的机器最终可能需要完全相反的策略。游戏台式机里的5090应该把几乎所有内容都通过PCIe推到GPU,而8GB笔记本把大多数未命中放在CPU计算效果更好。
这些信息都没法从规格表上得到,所以推理引擎会给每台机器做一次性能画像。设计的第二部分和智能体有关。
编码智能体会不断重写自身历史,正常来说每次编辑都会迫使数千个token重新进行prefill。FreeToken会把检查点保存在智能体框架切割的精确边界上,因此它只需要重新处理新增部分。
它最慢的首token也保持在44秒以内,而llama.cpp峰值达到232秒,KTransformers达到946秒。它以Apache 2.0协议提供OpenAI和Anthobic兼容API,因此Claude Code和Codex可以直接指向它。
公开发布权重只决定了谁能下载模型,不决定谁能负担得起运行模型的成本。前沿开源模型不断推出,但运行它们仍然默认需要租用集群。
与此同时,有超过一亿台配备独立GPU的消费级机器大多处于闲置状态。缩小这个差距从来都不是硬件问题,这类工作才能把开源权重变成你真的能用的东西。
论文:
代码仓库:
这篇推文里几乎每个想法,从为什么内存带宽决定结果,到为什么搬运权重的成本高于直接在上面计算,都直接来自GPU的架构本身。我写了一份详细的入门介绍,文章引用如下。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖