AI Pulse

两个约300B参数的模型,一台128GB迷你PC就能跑

两个约 300B 参数的 MoE 模型,各自都能在一台 AMD Strix Halo 迷你 PC 上跑。这台机器配了 128GB 内存。做这件事的是 Hugging Face 上的 yamz-labs,不是模型官方。两个模型分别是 GLM-5.3-Flash 和 MiMo-V2.6-Flash-MOPD。所有测速都在 Ryzen AI Max+ 395 上完成。

先把两个词说清楚:预填充是模型读提示词的阶段,解码是它生成回答的阶段。tok/s 是每秒生成的 token 数。

GLM-5.3-Flash 预填充:3.5K 上下文约 580 tok/s,64K 上下文 546 tok/s。解码 26 到 30 tok/s,要开 MTP(多 token 预测)。

MiMo-V2.6-Flash-MOPD 预填充:4K 上下文约 650 tok/s。解码看场景:散文 32 tok/s,聊天 35 tok/s,代码 44 tok/s(推测解码),普通模式 29 tok/s。

每秒 26 到 44 个 token 的生成速度,配上 500 以上的预填充,日常聊天和写代码不会明显卡顿。

量化会有损失,关键是多大。作者用两个指标衡量:KLD 看输出分布偏离官方 FP8 的幅度,Top-1 看首选词和官方 FP8 一致的比例。

GLM-5.3-Flash:KLD 0.151,Top-1 89.3%。MiMo-V2.6-Flash-MOPD:KLD 0.0713,Top-1 92.0%。

MiMo 是作者自己的量化。GLM 的包把 turboderp 公开的 2.05 和 3.05 bpw EXL3 张量混在一起,再加自己的层混合和一小段调优。

bpw 是每个权重占用的比特数。3.05 bpw 压得比较狠,一个叫 Zyj 的用户看到这个数字后回了句 "Uh oh"。

同一份 129 行测试里,turboderp 的 2.05 bpw 包(85 GB)KLD 0.275,解码快约 10%。作者的混合包(100 GB)KLD 0.190。turboderp 的包更小更快,作者的包更接近 FP8。两套方案取舍不同。

用户 PcChip 问:为什么拿 FP8 比 Top-1,而不是精度更高的 FP16?

快速启动的步骤很简单:克隆仓库,运行 build.sh,下载权重,运行 serve.py。得到的接口是 OpenAI 风格。权重都在 Hugging Face 的 yamz-labs 组织下。

引擎叫 Kyojin,基于 turboderp 的 ExLlamaV3,ROCm 部分来自 sdougbrown 和 vcruz305。转换流程保持私有。任何人都能下载并运行最终产物,但复现不了打包过程。

Uncensored 版本单独发布:权重相同,外加一个小文件。引擎在加载时应用这个文件,一个开关就能关掉。用不用它,自己决定。

一个叫 ionizing 的用户在 Strix Halo 上试了 MiMo-V2.6-Flash-MOPD。技术对话和讨论里跑得挺顺,工具调用看着不错,速度比预期快,也比 GLM-5.3-Flash 更容易跑起来。他的机器是 40GB 显存加 128GB 内存,179 个专家分给了 CPU。模型没有完全装进显存。

另一个用户 killerstreak976 说,从没想过能把 GLM 5.3 Flash 装进 Strix Halo。

作者自己列了还没测的项:MiMo 的任务套件分数、GLM 在 128K 上下文的表现,以及除 gfx1151 之外的任何 GPU。目前结论都只来自 Ryzen AI Max+ 395 这一台配置。

作者邀请 Strix Halo 用户来报各自的 tok/s,问题和 PR 也都欢迎。验证才刚开始。

阅读原文
📚 相关主题 开源本地大模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新