AI Pulse

超出显存的MoE模型,一张NVIDIA显卡加内存就能跑

Flyweight 是一个 C++/CUDA 引擎,专门处理 MoE 模型超出显存的情况。它只需要一张 NVIDIA 显卡加系统内存,就能把模型跑起来。

MoE 模型按专家模块组织。启动时,Flyweight 自动算出哪些专家放显存、哪些放内存,省掉手动设置 offload 层数的步骤。

接口兼容 OpenAI 和 Anthropic 的 API,自带聊天界面。支持的模型有 Qwen 3.x 的 dense 和 MoE 版本(含 Qwen3.8-Flash-Next),以及 DeepSeek-V4-Flash、Ling 3.0、K2-Horizon。另外还支持 Gemma 4、Laguna、Muse Glimmer。

项目开源。

阅读原文
📚 相关主题 开源大模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新