AI Pulse

通义千问Qwen 3.8 27B可在16GB显存显卡本地运行

我只是分享一下我的Qwen 3.8 27b配置,它能装进5060TI,酷的是你甚至还能获得视觉功能!以及85K上下文(我还有1.5GB余量,可以增加更多上下文或使用更好的量化版本)

模型:来自https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF的IQ3_XXS-mtp

使用beellama https://github.com/Anbeeld/beellama.cpp

使用的配置:

[*]
model = ..\llm-models\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf
mmproj = ..\llm-models\mmproj-Qwen3.8-27B-BF16.gguf
image-min-tokens = 256
gpu-layers = 99
ctx-size = 85000
no-host = true
direct-io = true
threads = 8
batch-size = 2048
ubatch-size = 512
fit = off
ctx-checkpoints = 0
spec-type = draft-mtp
spec-draft-n-max = 2
cache-type-k = kvarn4
cache-type-v = kvarn4
kv-tail-tokens = 256

我成功在解码时达到45tks,预填充时约300

是的,它使用了kvarn4,但没那么糟糕,看看:
https://anbeeld.com/articles/kvarn-kv-cache-implementation-and-benchmarks

我也知道你可以把mmproj移到CPU上以释放更多显存。

很想听听其他配置,为16GB显存显卡找到最佳方案!

―― 高票评论(帖子共22条讨论)――

[+5] u/NihmarRevhet:如果你把mmproj卸载到RAM,也许增加b/ub,你应该能获得更多预填充。我加载80k+ token时得到300。

[+2] u/inexorable_stratagem:300的预填充似乎太低了。我有2块5060ti,预填充能达到1300。

也许你应该调整一些配置

[+2] u/Sitkin_Marrel:45 tks解码,同时85K上下文和视觉模型保持加载,而整个讨论都在关注预填充。预填充是每个提示的一次性成本,解码才是你整个会话中感受到的,所以我宁愿要这个解码数字,而不是两倍大小的预填充数字。

[+2] u/AbleShower2801:kvarn4 + 视觉Qwen适配16GB才是beellama的卖点,而不是分支名称。85K上下文在5060 Ti上还有余量,这是真正的本地服务胜利。如果你整理本地推理/编码工具,https://github.com/hashgraph-online/awesome-ai-pluginshttps://hol.org/plugins接受提交。

[+1] u/_wortkarg_:Qwen3.8-27b UD-Q3_K_XL 5060Ti 16Gb,llama.cpp,无视觉,MTP,96k上下文(使用28k),45-55 t/s生成,400-800 t/s预填充(从800降到400)。

llama-server \`

\-m ./unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q3_K_XL.gguf \`

\--spec-type draft-mtp \`

\--spec-draft-n-max 3 \`

\--device-draft CUDA0 \`

\--n-gpu-layers-draft all \`

\--ctx-size 98304 \`

\--chat-template-kwargs '{\\"enable_thinking\\":true,\\"preserve_thinking\\":true}' \`

\--jinja \`

\--reasoning-format deepseek \`

\--reasoning-preserve \`

\--flash-attn on \`

\--cache-type-k q4_0 \`

\--cache-type-v q4_0 \`

\--fit off \`

\--n-gpu-layers all \`

\--threads 8 \`

\--threads-batch 8 \`

\--batch-size 512 \`

\--ubatch-size 256 \`

\--parallel 1 \`

\--temp 1.0 \`

\--top-p 0.8 \`

\--top-k 20 \`

\--min-p 0.0 \`

\--presence-penalty 0.0 \`

\--repeat-penalty 1.0

阅读原文
📚 相关主题 开源工程

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新