AI Pulse

超长文本AI模型本地免费跑,速度最高上万token每秒

Ling-3.0(BailingMoE3)正式进入 llama.cpp。PR #26608 合并进了主分支,从 build b10472 开始,这个模型可以不用云端,直接在本地跑。

模型有两个尺寸:Ling-3.0-tiny(8B)和 Ling-3.0-flash(127B)。bartowski 已经把两个尺寸的 GGUF imatrix 量化文件都放了出来。

Intel Arc B580 上,Ling-3.0-tiny 的 Q8_0 量化版在 16384 上下文下,prompt 处理速度 120.76 token/秒,生成约 114 token/秒。把上下文拉到 32768,prompt 处理降到 62.53 token/秒,生成仍有 110.49 token/秒。

这张 12GB 显存的中端卡,配合 --cache-type-k q8_0 --cache-type-v q8_0 把 KV 缓存压到 8 位,完整 128K 上下文跑得动。

RTX 3090 上,MXFP4 量化版的 prompt 处理冲到 10901.53 token/秒,生成速度 225.72 token/秒。

社区里已经有人拿它和 Laguna 对比:Laguna 自己的基准跑分更高,Ling 可能快得多。也有人把它当实用模型,在统一内存机器上解码接近 100 token/秒,跟 Qwen 3.8 27b 一起跑。

这些跑分都来自 tiny 版;flash 在 B580 上的表现,表格里还没有。速度之外,MXFP4 相对 Q8_0 的质量差异,表格里也看不出来。

阅读原文
📚 相关主题 大语言模型本地部署

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新