FreeToken让16GB显存跑20GB大模型 速度百tok每秒
🤯 一个20GB的模型塞不进这张RTX 5080的16GB显存。它仍然能以约100 tok/s的速度运行。🆕 全新推理引擎!
FreeToken是全新开源推理引擎,专门设计用来在显存不足以容纳大模型的硬件上运行超大MoE模型。目前已经有新的社区测试验证了它的性能数据。
🎮 RTX 5080(16GB显存)
🧠 Ryzen 9 9950X3D
💾 64GB系统内存
🤖 Qwen3.6-35B-A3B NVFP4(约20GB)
模型体积大于GPU的显存容量。结果:🔥 约100 tok/s。一个用1028 token的prompt的测试案例达到了约 🚀 110 tok/s。
怎么做到的?FreeToken不把你的PC看作只是GPU显存加系统内存分开来看,它把整台机器当作一个推理平台。
⚡ GPU驻留专家
🧠 CPU执行
💾 系统内存
🔄 动态专家缓存
🚦 带宽感知的CPU/GPU调度
📚 动态KV缓存分配
因为Qwen3.6-35B-A3B是MoE模型,每个token只会激活总参数中的一小部分。FreeToken利用了这种稀疏性,而不是强制把整个模型放进显存。
论文中还给出了更多案例:
💻 8GB笔记本GPU → 35B MoE
🎮 RTX 5090 → DeepSeek-V4-Flash 284B
🖥️ 96GB工作站GPU → GLM-5.2 753B
全都可以在单台个人设备上运行。
FreeToken的特点:
🔓 Apache 2.0协议
🪟 Windows应用
🐧 支持Linux
🖥️ 带图形界面
🔌 兼容OpenAI的API
🤖 支持Claude Code / Codex / Hermes / OpenCode
⚠️ 约100 tok/s的数据是社区测试结果,不是FreeToken论文中报告的基准测试结果。
🔗 GitHub /FlashML-org/FreeToken
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖