AI Pulse

16GB显存跑1769亿参数模型,99GiB在SSD

Qwen3.8-Flash-Next 是一个 1769 亿参数的混合专家(MoE)模型。NVFP4 量化后,大小 119 GiB。机器是 16GB 显存的 RTX 5060 Ti 加 32GB 内存,新的推理引擎跑出了每秒 9-10 个 token 的解码速度。

做法是让 SSD 扛下大部分参数。MoE 模型每个 token 只调用一小部分专家,不必把全部参数常驻显存。119 GiB 里只有 20 GiB 放进显存和内存,其余 99 GiB 留在 SSD 上。这 99 GiB 里,48.5 GiB 是路由专家,按需流式读取。剩下 50.7 GiB 是 n-gram 表,每个 token 只读 16 行。具体到每个 token,要调用 48 层共 480 个专家。其中约 377 个已经在内存里,另约 103 个从 SSD 读取,约 270 MiB。

同一台机器上,llama.cpp 平均解码速度是 4.9 tok/s。这套引擎接近翻倍。短板在预填充:5.5k token 的提示词只跑出 49.2 tok/s。评论区高票意见是“太慢,宁愿用 API”。

v1 的限制不少。只支持 RTX 50 系列(Blackwell 架构),测试环境是 Windows 11 和 WSL2。解码只有贪婪模式,没有采样。批量解码是否支持、3-4 张 5060 Ti 能否改善预填充,目前都没有明确说明。v2 何时发布、支持哪些硬件,也不清楚。

长时间跑下来,SSD 温度到过 70°C。好在几乎没有写入,磨损有限。引擎默认只在 RAM 里缓存 6GB 专家参数。有用户质疑这个设置,建议提到 12GB 以上,认为能大幅提升性能。

也有人拿 RTX 3060 试过。atomic chat 的 q4km 量化,直接从 NVMe 读取。生成 12 tok/s,预填充 160 tok/s。旧硬件上也有可行路径。

作者预期 v2 靠更好的 SSD 流式读取,解码速度能达到 14-15 tok/s。同一引擎跑小一号的 Qwen3.6-35B-A3B,解码 47.3 tok/s,预填充 591 tok/s(测试上下文约 4k)。小模型在本地已经很流畅。

引擎附带一个 OpenAI 兼容的 API 服务器,支持工具调用(还有 bug,用 Cline 测过)。对话模板用的是模型自己的。推理过程和最终答案分开返回,内置聊天页面。

用 SSD 换显存,用速度换回隐私和成本上的自主权。v1 只支持 RTX 50 系列,3060 上却有人跑出 12 tok/s。把大模型放到 SSD 上的思路,不限于新显卡。

阅读原文
📚 相关主题 大语言模型开源

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新