AI Pulse
📡 X 信号

单DGX Spark跑288GB大模型 开发者自制推理引擎

开发者@0xBakeer最初只是在单台DGX Spark上测试DeepSeek V4.1,最终开发出了专属的推理引擎,没有使用vLLM、SGLang这类现有推理框架。

DeepSeek V4.1仅路由专家部分就达到288GB容量,而单台DGX Spark的显存只有128GB。其他开发者通常使用4台DGX Spark以张量并行方式运行该模型。

从固态硬盘流式读取专家参数可以运行,但生成速度最高仅为每秒3.5个token。只保留占比31%的顶层专家在显存中,生成速度可达到每秒约17个token。

在相同显存预算下,3比特量化专家的表现优于4比特量化。4比特可容纳4813个专家,3比特可容纳6260个专家,增加专家数量带来的收益超过了精度损失带来的负面影响,在代码和文本生成上表现都更好。

原本3比特内核的带宽一整天都维持在每秒20GB,之后发现问题出在数据块排布而非计算本身。重新打包为更宽的数据块后,带宽提升到了每秒182GB,和4比特内核的每秒184GB带宽接近。

当前解码过程已经能利用设备87%的显存带宽,在内核优化上已经没有太多提升空间,接下来的优化方向应该是存储层面。

这位开发者认为,在质量和速度上都能媲美Fable尺寸模型,很快就能在个人桌面运行。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新