AI Pulse
📡 X 信号

FreeToken让16GB显存跑20GB大模型 速度百tok每秒

FreeToken让16GB显存跑20GB大模型 速度百tok每秒

🤯 一个20GB的模型塞不进这张RTX 5080的16GB显存。它仍然能以约100 tok/s的速度运行。🆕 全新推理引擎!

FreeToken是全新开源推理引擎,专门设计用来在显存不足以容纳大模型的硬件上运行超大MoE模型。目前已经有新的社区测试验证了它的性能数据。

🎮 RTX 5080(16GB显存)
🧠 Ryzen 9 9950X3D
💾 64GB系统内存
🤖 Qwen3.6-35B-A3B NVFP4(约20GB)

模型体积大于GPU的显存容量。结果:🔥 约100 tok/s。一个用1028 token的prompt的测试案例达到了约 🚀 110 tok/s。

怎么做到的?FreeToken不把你的PC看作只是GPU显存加系统内存分开来看,它把整台机器当作一个推理平台。

⚡ GPU驻留专家
🧠 CPU执行
💾 系统内存
🔄 动态专家缓存
🚦 带宽感知的CPU/GPU调度
📚 动态KV缓存分配

因为Qwen3.6-35B-A3B是MoE模型,每个token只会激活总参数中的一小部分。FreeToken利用了这种稀疏性,而不是强制把整个模型放进显存。

论文中还给出了更多案例:
💻 8GB笔记本GPU → 35B MoE
🎮 RTX 5090 → DeepSeek-V4-Flash 284B
🖥️ 96GB工作站GPU → GLM-5.2 753B
全都可以在单台个人设备上运行。

FreeToken的特点:
🔓 Apache 2.0协议
🪟 Windows应用
🐧 支持Linux
🖥️ 带图形界面
🔌 兼容OpenAI的API
🤖 支持Claude Code / Codex / Hermes / OpenCode

⚠️ 约100 tok/s的数据是社区测试结果,不是FreeToken论文中报告的基准测试结果。

🔗 GitHub /FlashML-org/FreeToken

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新