125B大模型跑进迷你电脑,开源引擎Kyojin每秒解码44至59个token
Yamz Labs 这次放了两样东西。一样是 Qwen3.8-Flash-Next 的 EXL3 权重,95 GB。另一样是开源推理引擎 Kyojin,基于 ExLlamaV3 构建。目标硬件是一台 AMD Strix Halo 迷你电脑。CPU 是 Ryzen AI Max+ 395,内存 128 GB。模型是 MoE,125B 总参数。处理单个任务时,只激活 60 亿参数。权重放在 Hugging Face,引擎代码放在 GitHub。
解码速度直接报数。开投机解码,每秒 44 到 59 个 token。聊天约 47,代码约 58,复制密集型编辑约 60。关掉投机解码是 32.7。预填充速度也稳。4K 上下文每秒 1,412 个 token,32K 是 1,486,128K 是 1,367。它几乎不随长度下降。长上下文 64K 和 128K 的针测试都是 10/10。128K 下解码仍有 32 token/s。
投机解码有个常被忽略的问题:提速后的输出和普通解码是否一致。Kyojin 给了明确承诺。投机解码返回的 token 与普通解码完全一致,每次发布都检查。评论区提到,很少见引擎公开说这件事。
保真度方面,Kyojin 的量化权重在 844 个位置上和原始 FP8 模型的 top-1 一致性为 94.1%。有评论者认为,EXL3 是把质量保持在可用水平的路子。Halogen 和 gufo 的量化质量,不够做实际工作。
同类引擎的对比数据也出现了。llama.cpp 在同款迷你电脑上报告约 30 token/s 投机解码。预填充约 500 token/s(Vulkan,UD-IQ4_XS)。Halogen 0.16.2(v2 checkpoint)更快。普通解码 39.8 对 32.7。聊天投机解码 52 对 47。预填充快 10 到 20%。代码任务上,Kyojin 中位数通过率 58.5 对 51.2。Halogen 热身后领先。
Kyojin 赢在保真度。top-1 一致性 94.1% 对 92.3%。KL 散度低 41%,输出分布更贴近原模型。速度和保真度在这里分成两个方向。Halogen 更快,Kyojin 更忠实。
速度差距是公开承认的。Yamz Labs 下一步是重写引擎核心。这会惠及引擎跑的所有模型,不只是 Qwen3.8-Flash-Next。现在选这个引擎,后面可能不用换硬件就能等到速度升级。
引擎还带一个可选的 uncensor 预设,默认关。打开后,面对有害提示的拒绝率从 99/100 降到 4/100。常规基准测试在噪声范围内。默认保持安全,开关留给需要的人。
评论区的 Strix Halo 引擎还有 gufo、strixite、ciru、strix-llama。有人说这个社区庞大、愿意优化。有人认为这是在家拿到接近 Opus 4.6/4.8 水平模型的最简单方式,功耗还低。该芯片用 sea of wires 技术,比 AMD 其他芯片更省电。也有人建议 Mac 用户卖掉高价设备,换一台这种机器。
评测和讨论留下几个没回答的问题。是否支持视觉,没说。和 gufo 的 KL 散度对比,没有。量化配方会不会公开,不知道。ngram 表是否未量化放在 SSD 上,没解释。不同上下文长度和并发请求下的速度曲线,也还没放出来。量化质量目前只有纸面判断,可能匹配 unsloth 的 q6 k xl 在 top-1 和平均 KL 散度上的表现。还没实测确认。社区还想知道 KL 散度差异在多大程度上影响真实基准表现。
发布的对比数字里,对手更快的部分也直接列了出来。保真度是目前最清晰的差异,速度是接下来要补的。