单DGX Spark本地全加载运行284B DeepSeek大模型
284B 参数的 DeepSeek V4 Flash 0731,此刻正在我另一个房间以 16.5 token/秒的速度运行,从 DGX Spark 向我这台工作机器流式输出 tokens。
一台 DGX Spark,128GB 统一显存,CUDA 上跑 llama.cpp,使用 IQ3_XXS 3bit 量化,开启 -ngl 999 -fa,所有层都放在 GPU 上。16.5 token/秒解码,模型完全驻留显存,零卸载,确实可以正常使用。
我通过我的 tailnet 把它接入 Hermes Agent Desktop,tokens 就能传到屋子另一端我的工作站上。一个 284B 模型在另一个房间回答我的问题,全程本地,没有数据流出我的网络,是我自己拥有的硬件。
附图是完整拆解:128GB 能放下什么,速度从哪来,284B 模型和我在这台设备上跑过的所有 100B+ 参数模型相比表现如何。
如果你也想自己跑,这里是完整配置:模型是 unsloth/DeepSeek-V4-Flash-0731-GGUF 的 UD-IQ3_XXS 量化版本,大小 104GB,比特密度 3.06 bpw。这个版本刚好能完全放进 128GB 显存,还能留出空间放 KV 缓存。
更大的 3bit 量化版本 Q3_K_M 和 Q3_K_XL 大小都差不多 128GB,全层放GPU会触发 OOM,所以 IQ3_XXS 是甜点区。
用 llama.cpp 的 llama.cpp 来服务,128k 上下文启动命令是:llama-server -m DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004.gguf -ngl 999 -fa on -c 131072 --jinja --alias deepseek-v4-flash --host 0.0.0.0 --port 8000
-ngl 999 会把所有层放在 GPU,-fa on 开启 flash attention,-c 131072 对应 128k 上下文窗口,--jinja 提供聊天模板。把端口通过 tailnet 暴露,把 Hermes Agent Desktop 指向它,就完成了。
下一步我要测试它的 Agent 能力:看它能不能真的在工具链里完成一次构建,跑通质量测试,再和同一台设备上的 Qwen 122B、StepFun 以及 Laguna 直接对测。后续会给结果。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖