AI Pulse

27B三元模型在L4上提速2.2倍,靠微调一个草稿模型

背景

PrismML 的 Ternary Bonsai 2 27B 可以装入 24 GB 显卡或 Mac,但在 L4 上解码速度仅为约 30 tok/s,在 M4 Pro 上约 21 tok/s。z-lab 的 DFlash 2 草稿模型是在 bf16 精度的 Qwen3.8-27B 上训练的,因此用在纯三元模型上猜测准确率不高。我在 Bonsai 2 自己的贪婪输出上微调了 1.5M token。

下载资源

- Drafter 模型(safetensors + Q4_K_M GGUF):https://huggingface.co/naklitechie/Qwen3.8-27B-DFlash2-ternary-bonsai2
- 三种运行时的配置文档:https://github.com/NakliTechie/dflash-mlx-bonsai2/blob/main/docs/USAGE.md

NVIDIA 环境

使用 PrismML 的 llama.cpp fork(prism 分支):

llama-server -m Ternary-Bonsai-2-27B-PQ2_0.gguf -md Qwen3.8-27B-DFlash2-r3-Q4_K_M.gguf \
  --spec-type draft-dflash --spec-draft-n-max 7 --spec-type ngram-mod \
  -ngl 999 -ngld 999 -fa on --jinja

单块 L4,贪婪解码:GSM8K 2.17x,MBPP 2.17x,MATH-500 2.20x,MT-Bench 1.39x。代码编辑:叠加 ngram-mod 后 3.15x(仅 drafter 为 2.46x)。准确率与原始模型相差每套 1-2 题以内。

Mac 环境

基于 bstnxbt/dflash-mlx 的 fork,为验证步骤实现了 8 行 2-bit Metal GEMM。M4 Pro 上:直接代码补全 1.5x,聊天代码 1.3x,数学 1.2x。一个脚本即可提供 OpenAI 兼容服务器。

浏览器环境

在 LocalMind(https://localmind.naklitechie.com)中实现了 WGSL 移植,对 Bonsai 2 27B 默认开启。代码任务加速 1.18x,输出完全一致。

其他说明

聊天和散文大致持平。请将温度设为 0。

感谢 z-lab(DFlash 2)、PrismML(Bonsai 2、llama.cpp fork)和 bstnxbt(dflash-mlx)。以上数据来自一台 L4 和一台 M4 Pro;欢迎提供 3090、4090 或其他 Apple 芯片上的结果。

阅读原文
📚 相关主题 大语言模型工程优化

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新