AI Pulse

不到140美元,Radeon MI50让27B模型生成速度提升近9倍

背景与硬件配置

Nvidia GTX-1080Ti 有 11GB 显存,能跑 8B 到 14B 的本地模型。我加了一块 AMD Radeon MI50(规格链接),带 16GB 显存。现在总共有 27GB 显存,可以直接在显存里跑大多数 30B 到 35B 的本地模型。MI50 入手价不到 $140,固件刷成了 Radeon VII,所以 mini DisplayPort 能用,但功耗档位被降低了。

得益于 Kubuntu 和 Vulkan,没有任何驱动麻烦或冲突。

基准测试方法与命令

基准测试用的是 Llama.cpp 的 Ubuntu Vulkan 预编译二进制,build 版本:851cb34f2 (11055)。

我先单独跑 GTX-1080Ti(设置 GGML_VK_VISIBLE_DEVICES=1,让系统只看到这一张卡),然后再用双 GPU 配置跑同一批 LLM 模型。

为了让系统在下一轮开始前有时间准备好,我在命令里加了 sleep 10。我使用的命令如下:

GGML_VK_VISIBLE_DEVICES=1 time ~/llama-b11055/llama-bench -fa on -ngl 99 -m /gemma-4-26B-A4B-it-UD-Q6_K_XL.gguf && sleep 10 && time ~/llama-b11055/llama-bench -fa on -ngl 99 -m /gemma-4-26B-A4B-it-UD-Q6_K_XL.gguf

这条命令先用单卡跑一次 gemma-4-26B,sleep 10 后再用双 GPU 配置跑一次,方便对比。-fa on 开启 flash attention,-ngl 99 表示把尽可能多的层卸载到 GPU。

测试的 GGUF 模型与大小

- Qwen3.6-35B-A3B-MXFP4_MOE.gguf (20.65 GiB)
- NVIDIA-Nemotron-3.5-Lightning-30B-A3B-Q5_K_M.gguf (25.10 GiB)
- Qwen3.8-27B-Q6_K.gguf (21.30 GiB)
- medgemma-27b-it-UD-Q6_K_XL.gguf (22.09 GiB)
- gemma-4-26B-A4B-it-UD-Q6_K_XL.gguf (21.68 GiB)

单 GPU 基准结果(仅 GTX-1080Ti)

表中 pp512 表示处理 512 个 token 的 prompt 速度,tg128 表示生成 128 个 token 的文本生成速度(单位都是 t/s)。

modelsizeparamspp512tg128
qwen35moe 35B.A3B MXFP4 MoE20.65 GiB35.51 B248.1012.60
nemotron_h_moe 31B.A3.5B Q5_K - Medium25.10 GiB32.91 B230.6410.78
qwen35 27B Q6_K21.30 GiB27.32 B56.102.12
gemma3 27B Q6_K22.09 GiB27.01 B62.731.51
gemma4 26B.A4B Q6_K21.68 GiB25.23 B162.1211.76

双 GPU 基准结果(GTX-1080Ti + Radeon MI50)

modelsizeparamspp512tg128
qwen35moe 35B.A3B MXFP4 MoE20.65 GiB35.51 B333.7931.78
nemotron_h_moe 31B.A3.5B Q5_K - Medium25.10 GiB32.91 B298.6965.02
qwen35 27B Q6_K21.30 GiB27.32 B124.8515.60
gemma3 27B Q6_K22.09 GiB27.01 B127.5814.96
gemma4 26B.A4B Q6_K21.68 GiB25.23 B340.8652.03

性能提升分析

收益最大的是 Dense(稠密)模型:

- Gemma3 27B:生成速度从 1.5 t/s 提升到 14.96 t/s,大约提升了 896%。
- Qwen35 27B:从 2.1 t/s 提升到 15.6 t/s,大约提升了 642%。
- Nemotron 31B:大约提升了 504%。

考虑到加一块 16GB 显存的 GPU 还不到 $140,这个结果相当不错。现在跑 30B 级别的 Dense 模型是真的可行了。

高票评论

u/Atretador:你其实用 GTX1080 就可以跑 35B 级别的 MoE 模型了(YouTube 链接)。MoE 模型不一定要全部放进显存。另外,单张 MI50 加 expert cache——甚至单张 1080ti 加 expert cache——可能都比你的双卡配置更快(Reddit 讨论)。你的完整参数是什么?

u/Nota_ReAlperson:为什么要用 Qwen 3.5?3.8 是完全相同的架构,而且聪明得多。

u/Zito_Kadaken:我用 RX 6800M 12GB 和 Ollama on Vulkan,也没有驱动问题。这周我还测试了 u/PhysicsDisastrous462 的 Vulkan trainer,也就是 Hierarchos-Native(github.com/necat101/Hierarchos-Native)。一开始在我的卡上第一步就崩了,后来他修复了在 Linux 上提交任务的方式,然后就能用默认设置正常训练,loss 与 CPU 训练一致到小数点后 5 位。你在 MI50 上试过训练吗,还是只做推理?

阅读原文
📚 相关主题 大语言模型本地部署

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新