35B大模型压缩至7GB,普通电脑本地跑每秒120 token
SyzygyResearch 今天发布 Mach-1-Additive-35B 的 GGUF 格式文件,同时放出配套的定制版 llama.cpp 推理引擎分支。代码挂在 GitHub 上。
这是 35B 参数的 MoE(混合专家)模型。MoE 在推理时不激活全部参数,只让部分专家参与计算。再配合量化压缩,模型文件压到约 7GB。移动设备、边缘设备和低内存电脑都能装。官方称在消费级笔记本上,生成速度最高每秒 120 token,足够流畅对话。
SyzygyResearch 提供两个 GGUF 版本:标准版和多模态版。多模态版具体能做什么,官方没细说。两个版本都跑在本地,数据不用上传。
定制版 llama.cpp 分支针对这个模型做了推理优化,降低低配置机器的运行门槛。Reddit 上有人想看它在轻量级工具调用上的表现。也有人问有没有第三方测试,或者有没有人拿它跑过真实任务。目前公开渠道还没看到第三方验证数据。
两周前,SyzygyResearch 在推特上确认 Laguna S2.1 和 Qwen 3.8 正在开发。Reddit 已有帖子持续跟踪 1-bit、2-bit、Ternary 和 Bitnet 这类超低比特模型。把大模型做小做快的路子还在往前推,应该还会有更多类似发布。