AI Pulse

16GB游戏显卡跑27B模型,每秒生成75个token

Reddit 上有人分享了一套配置,让自己的 RTX 5080(16GB 显存)跑起了 Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller,平均每秒生成 75 个 token,偶尔突破 100。这个模型基于社区口碑很好的 Qwen 3.8 27b。发帖人说,大家都夸它,所以他想在本地部署试试。

参数怎么配的

他用的是 llama.cpp 自带的 llama-server.exe。参数拉得挺满:上下文 85000 token,批处理 512,CPU 和 GPU 各 8 线程,几乎把所有层都卸到显卡上(-ngl 99)。KV 缓存也用 q4_0 量化成 4 位精度,缓存占用的显存被压下去不少。还开了 flash attention,计算更快,显存占用更低。

提速的关键是 MTP(多 token 预测)。普通模型一次只吐一个 token,MTP 先当草稿,一次性猜出一串后续 token,再交给主模型验证。猜对了就能跳过生成步骤,把好几步并成一步。最高草稿数设成了 3。

采样参数给得比较自由:温度 1、top-p 0.95、top-k 20。推理模式开着,努力程度中等。

日志怎么说

帖子里的运行日志显示,从第 239 个 token 到第 10291 个 token,生成速度稳定在每秒 70 到 77 个 token,3 秒平均速度偶尔冲到 100 以上。

AMD 也有路

评论区的高票回复指向另一篇帖子,讲的是在 ROCm 和 llama.cpp 的组合下,怎么在低显存里跑 MTP。这套思路不全被 NVIDIA 绑住。

边界

不过这套配置能撑多久,发帖人自己也没测过。85000 的上下文只是个参数,不等于真能稳定用那么长,他也没拿其他量化版本对比。而且这套只针对 Qwen 3.8 27B,发帖人没提自己显卡以外的硬件配置。

确定的是:这个社区公认的好模型,在消费级显卡上跑到了接近实时的速度,数据全程留在本地。

阅读原文
📚 相关主题 本地大模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新