DFlash 2让27B大模型在苹果MacBook跑出70tok/s零损失加速
Damn,27B模型在MacBook上跑到70 tok/s,比Fable和Sol还快, 还完全不降质,感觉本地AI的可用性拐点,可能就是今天了🤔 DFlash 2让Qwen3.8-27B在一台M5 Max MacBook Pro上跑到了70 tok/s,最高达到自回归解码的4.6倍,而且输出完全一致,lossless,一个token都不差, 70 tok/s什么概念,之前27B级别的模型在Mac上跑20到30 tok/s,能用但不爽,现在进入真正的交互流畅区间,之前因为太慢不敢开的xhigh高推理强度,现在变得实用了, 原理用大白话讲,传统大模型生成是严格串行的,第n个token必须等第n-1个出来,GPU利用率极低, 投机解码的思路是用一个小草稿模型先快速猜一串未来token,大模型一次前向把整串一起验证,猜对的收下猜错的重来, 但以前的方法草稿模型本身还是一个一个猜,加速上限卡在2到3倍, DFlash 2的突破是把草稿模型改成Block Diffusion,整个block比如8个token在一次前向里并行预测出来, 还加了两招,Candidate Selector每个位置保留top-16候选,用一个只有2M参数的轻量打分器找最连贯的路径,因为正确token绝大多数时候就在top-16里,接受率显著提升, Dynamic Depthwise Convolution用极小的两-tap卷积解决block后半段质量衰减,几乎不加延迟,后面几个位置的预测质量大幅回升, 结果是每次验证平均多收约20%的token,额外延迟只有约1%,整体吞吐提升16%到25%,Qwen3.8-27B上达到2.7到3.4倍,某些场景4.6倍, 最狠的是严格lossless,最终输出分布和原模型完全一样,这相当于白捡的加速,输出质量零损失, 而且生态闭环极快,DFlash系列在Hugging Face累计下载超350万次,DFlash 2发布当天就支持了SGLang、vLLM、llama.cpp、oMLX,Ollama的PR也在合并中, Apple Silicon用户直接用oMLX或者pip install dflash local,模型用mlx-community的Qwen3.8-27B-4bit,草稿用z-lab的DFlash2版本,量化草稿也用4bit,block size建议不超过5, NVIDIA用户用SGLang或vLLM,llama.cpp的PR也已经合了, Jun Song说得准,接下来真正难啃的骨头是prefill长上下文首次填充和weight compression权重量化, 模型权重再大,解码慢本地体验照样拉胯,2026年本地AI真正变好用的关键一跳,就是把草稿彻底并行化, 你的M系列Mac,现在已经能跑出接近服务器级的解码速度了。
补个实用信息,Apple Silicon用户直接用oMLX的预编译版,N卡用户SGLang和vLLM都已经支持,llama.cpp也合并了PR,普通人现在就能上手