AI Pulse
📡 X 信号

多校研究者开源FreeToken 4060能跑35B大模型

多校研究者开源FreeToken 4060能跑35B大模型

卧槽,这个项目可以让你的4060跑大模型????

来自 UC Berkeley、 MIT、UT Austin 的研究者,刚刚开源了 FreeToken:专门解决超大 MoE 模型在个人电脑上的推理框架。

根据官方的论文,目前已经跑出了几组很夸张的数据:
✅Qwen3.6 35B → 8GB RTX 4060 笔记本 → 39.3 tok/s
✅DeepSeek-V4-Flash 284B → RTX 5090 台式机 → 22~25 tok/s
✅GLM-5.2 753B → RTX PRO 6000 工作站 → 约 15 tok/s

一台只有 8GB 显存的 4060 游戏本,35B 模型已经能跑到接近 40 tok/s。这个速度甚至超过论文统计的 Codex 线上中位解码速度 33 tok/s。

FreeToken 的思路是把 GPU、CPU、系统内存、PCIe 全部拉进来一起干活。因为 MoE 每个 token 实际只会激活少量 Expert,所以没必要把几百 B 参数全塞进显存。

FreeToken 会动态判断:哪些常驻显存,哪些临时从内存搬到 GPU,哪些直接扔给 CPU 计算。Prefill 时提前搬下一层 Expert,Decode 时再根据 CPU、GPU 和 PCIe 的实际速度动态分工。

甚至FreeToken还专门做了 Agent State Cache。Agent 调工具、修改 Context、继续执行任务时,可以少做很多重复 Prefill。

所以 FreeToken 展示的 Demo 也非常明确:写代码、读邮件、调用工具,甚至直接打游戏。你完全可以在自己游戏电脑上挂一个开源大模型,再让 Claude Code、Codex 这类 Agent Harness 去调用。

以前大家折腾本地模型,还在研究「我的显卡到底能不能把这个模型加载起来」。现在一张 4060,已经开始研究怎么养一个全天候本地 Agent 了。

消费级显卡跑前沿模型这件事,正在变得越来越实用了。

这个项目真牛逼啊,等我明天用办公室的电脑试一下🔥

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新