ggerganov发布不同硬件环境通义千问3 27B部署命令
简易版:llama serve -hf ggml-org/Qwen3.8-27B-GGUF --spec-type draft-mtp
进阶版:
llama serve \
-hf ggml-org/Qwen3.8-27B-GGUF \
--spec-default \
--spec-type draft-mtp \
--reasoning-preserve --agent
32GB VRAM(例如 RTX 5090):
llama serve \
-hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \
-hfd ggml-org/Qwen3.8-27B-GGUF:Q4_0 \
--spec-default \
--spec-type draft-mtp \
--ctx-size 196608 \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--reasoning-preserve --fit off --agent
请享用!
DGX Spark 平台上:
llama serve \
-hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \
-hfd ggml-org/Qwen3.8-27B-GGUF:Q4_0 \
--spec-default \
--spec-type draft-mtp \
--reasoning-preserve --agent
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖