不到140美元,Radeon MI50让27B模型生成速度提升近9倍
背景与硬件配置
Nvidia GTX-1080Ti 有 11GB 显存,能跑 8B 到 14B 的本地模型。我加了一块 AMD Radeon MI50(规格链接),带 16GB 显存。现在总共有 27GB 显存,可以直接在显存里跑大多数 30B 到 35B 的本地模型。MI50 入手价不到 $140,固件刷成了 Radeon VII,所以 mini DisplayPort 能用,但功耗档位被降低了。
得益于 Kubuntu 和 Vulkan,没有任何驱动麻烦或冲突。
基准测试方法与命令
基准测试用的是 Llama.cpp 的 Ubuntu Vulkan 预编译二进制,build 版本:851cb34f2 (11055)。
我先单独跑 GTX-1080Ti(设置 GGML_VK_VISIBLE_DEVICES=1,让系统只看到这一张卡),然后再用双 GPU 配置跑同一批 LLM 模型。
为了让系统在下一轮开始前有时间准备好,我在命令里加了 sleep 10。我使用的命令如下:
GGML_VK_VISIBLE_DEVICES=1 time ~/llama-b11055/llama-bench -fa on -ngl 99 -m /gemma-4-26B-A4B-it-UD-Q6_K_XL.gguf && sleep 10 && time ~/llama-b11055/llama-bench -fa on -ngl 99 -m /gemma-4-26B-A4B-it-UD-Q6_K_XL.gguf
这条命令先用单卡跑一次 gemma-4-26B,sleep 10 后再用双 GPU 配置跑一次,方便对比。-fa on 开启 flash attention,-ngl 99 表示把尽可能多的层卸载到 GPU。
测试的 GGUF 模型与大小
- Qwen3.6-35B-A3B-MXFP4_MOE.gguf (20.65 GiB)
- NVIDIA-Nemotron-3.5-Lightning-30B-A3B-Q5_K_M.gguf (25.10 GiB)
- Qwen3.8-27B-Q6_K.gguf (21.30 GiB)
- medgemma-27b-it-UD-Q6_K_XL.gguf (22.09 GiB)
- gemma-4-26B-A4B-it-UD-Q6_K_XL.gguf (21.68 GiB)
单 GPU 基准结果(仅 GTX-1080Ti)
表中 pp512 表示处理 512 个 token 的 prompt 速度,tg128 表示生成 128 个 token 的文本生成速度(单位都是 t/s)。
| model | size | params | pp512 | tg128 |
|---|---|---|---|---|
| qwen35moe 35B.A3B MXFP4 MoE | 20.65 GiB | 35.51 B | 248.10 | 12.60 |
| nemotron_h_moe 31B.A3.5B Q5_K - Medium | 25.10 GiB | 32.91 B | 230.64 | 10.78 |
| qwen35 27B Q6_K | 21.30 GiB | 27.32 B | 56.10 | 2.12 |
| gemma3 27B Q6_K | 22.09 GiB | 27.01 B | 62.73 | 1.51 |
| gemma4 26B.A4B Q6_K | 21.68 GiB | 25.23 B | 162.12 | 11.76 |
双 GPU 基准结果(GTX-1080Ti + Radeon MI50)
| model | size | params | pp512 | tg128 |
|---|---|---|---|---|
| qwen35moe 35B.A3B MXFP4 MoE | 20.65 GiB | 35.51 B | 333.79 | 31.78 |
| nemotron_h_moe 31B.A3.5B Q5_K - Medium | 25.10 GiB | 32.91 B | 298.69 | 65.02 |
| qwen35 27B Q6_K | 21.30 GiB | 27.32 B | 124.85 | 15.60 |
| gemma3 27B Q6_K | 22.09 GiB | 27.01 B | 127.58 | 14.96 |
| gemma4 26B.A4B Q6_K | 21.68 GiB | 25.23 B | 340.86 | 52.03 |
性能提升分析
收益最大的是 Dense(稠密)模型:
- Gemma3 27B:生成速度从 1.5 t/s 提升到 14.96 t/s,大约提升了 896%。
- Qwen35 27B:从 2.1 t/s 提升到 15.6 t/s,大约提升了 642%。
- Nemotron 31B:大约提升了 504%。
考虑到加一块 16GB 显存的 GPU 还不到 $140,这个结果相当不错。现在跑 30B 级别的 Dense 模型是真的可行了。
高票评论
u/Atretador:你其实用 GTX1080 就可以跑 35B 级别的 MoE 模型了(YouTube 链接)。MoE 模型不一定要全部放进显存。另外,单张 MI50 加 expert cache——甚至单张 1080ti 加 expert cache——可能都比你的双卡配置更快(Reddit 讨论)。你的完整参数是什么?
u/Nota_ReAlperson:为什么要用 Qwen 3.5?3.8 是完全相同的架构,而且聪明得多。
u/Zito_Kadaken:我用 RX 6800M 12GB 和 Ollama on Vulkan,也没有驱动问题。这周我还测试了 u/PhysicsDisastrous462 的 Vulkan trainer,也就是 Hierarchos-Native(github.com/necat101/Hierarchos-Native)。一开始在我的卡上第一步就崩了,后来他修复了在 Linux 上提交任务的方式,然后就能用默认设置正常训练,loss 与 CPU 训练一致到小数点后 5 位。你在 MI50 上试过训练吗,还是只做推理?