超出显存的MoE模型,一张NVIDIA显卡加内存就能跑
Flyweight 是一个 C++/CUDA 引擎,专门处理 MoE 模型超出显存的情况。它只需要一张 NVIDIA 显卡加系统内存,就能把模型跑起来。
MoE 模型按专家模块组织。启动时,Flyweight 自动算出哪些专家放显存、哪些放内存,省掉手动设置 offload 层数的步骤。
接口兼容 OpenAI 和 Anthropic 的 API,自带聊天界面。支持的模型有 Qwen 3.x 的 dense 和 MoE 版本(含 Qwen3.8-Flash-Next),以及 DeepSeek-V4-Flash、Ling 3.0、K2-Horizon。另外还支持 Gemma 4、Laguna、Muse Glimmer。
项目开源。