Meta超级智能实验室开源了300亿参数模型,能本地跑
@Meta 重回开源阵营。我们很荣幸地宣布,Meta Superintelligence Labs 推出的首个开源权重模型 Muse Glimmer 30B 已在发布当日获得 vLLM 支持——而且它采用 Apache 2.0 许可发布!
这款 30B 参数的密集模型,支持 128K+ 上下文窗口,属于多模态模型,专为本地智能体打造。它的能力足以处理长周期任务,体积又小到能在你自己的硬件上运行。现在就可以在你的设备上试用:vllm serve meta-models/Muse-Glimmer-30B
感谢 @inferact、@AIatMeta 和 @NVIDIAAI,让这个模型成功在 vLLM 中落地!
META 重新回到开源赛场——而且他们志在必得。美国开源回来了!我现在已经在 79 个 AI 智能体上运行它了。它和以往的模型非常不一样。
今天 Meta Superintelligence Labs 发布了 Muse Glimmer,这是一个 300 亿参数、采用完全 Apache 2.0 许可的开源权重智能体模型,整个本地 AI 社区都已经炸锅了。这是真正可下载、能在你自己的 GPU 上运行的算力,终于让常开的个人智能体对所有人来说都变得实用。Meta 刚刚再次向世界提醒了为什么开放权重依然重要。
以下是 Muse Glimmer 立刻改变行业格局的五大原因:
1. 真正开放权重,零限制——Apache 2.0 意味着你可以随意使用、修改、商业化、按任何方式发布它。没有特殊许可,没有「仅供研究」的小字条款。Meta 再次全面投入开源。
2. 可以单块消费级 GPU 运行——全精度需要 55 GB 显存。经过智能的 ~4 位量化后,体积可以控制在 20 GB 以内,在 24 GB 或 32 GB 显存的显卡(如 RTX 5090、苹果 M 系列 Mac 等)中,还能留出空间给 KV 缓存、视觉编码器和投机解码。不需要云端就能获得可靠的智能体体验。
3. 真正适配智能体场景,不只是会聊天——具备规划能力、可靠的工具调用、结果自检,以及自动故障恢复。它能从头到尾处理多步工作流,表现和大得多的闭源模型相当。
4. 原生多模态+长上下文——专用感知编码器让它能在同一个推理流程中处理文本和图像。128k 上下文窗口,在 100 多种语言上完成训练,已经 ready 供现实场景本地使用。
5. 在关键基准测试中胜过同规模模型——在智能体测试集(MCP-Atlas、DeepSearch QA、SWE-Bench、τ-Bench 等)上性能超过 Gemma-4 31B 和 Qwen3.6 27B 这类模型。它由更大的 Muse Spark 老师模型蒸馏而来,使用专门针对智能体性能优化的定制方案。
而我们现在已经开始用它了。权重今早已经上传到 Hugging Face。Ollama(MLX)已经支持 Apple Silicon,SGLang 已经在发布当日提供高性能推理,llama.cpp / LM Studio / vLLM 的集成也会在本周陆续推出。
人们已经可以搭建完全离线的个人智能体,在自己的设备上管理文件、调用工具、调试代码,完全私密——不需要 API 密钥,数据不会离开设备。包括我在内的早期测试者已经反馈,它的实时交互流畅,真的像一个合格的常开助手,而不是迟钝的本地演示。
Meta 不只是又发布了一个模型。他们给开源社区交出了一个实用、高性能的智能体引擎,真的能适配大多数人已经拥有的硬件。美国开源复兴刚刚迎来了一次重大升级。谢谢 Meta。
链接:
很高兴今天发布 Muse Glimmer 的开放权重,这是一个 30B 模型,可以在单块消费级 GPU 运行,Muse Spark 1.2 的开放权重版本很快就会推出。两款截然不同的模型,都会送到用户手中,未来还会有更多。
META 已经将 Muse Glimmer 开放权重,未来几周还会很快发布 Muse Spark 1.2 的开放权重版本。Mark Zuckerberg 发布了一篇文章,重申 META 对开源的承诺,呼吁无限制蒸馏,并宣布了一系列政策调整。
$META 发布了 Muse Glimmer,这是一个 30B 开放权重智能体模型,可以本地运行在 24GB GPU 上,使用集成的 DFlash drafting 模型降低延迟,打造更快的端侧智能体。
Alexandr Wang 也表示「我们很快会发布 Muse Spark 1.2 的开放权重版本」,让开发者可以本地访问,不需要云端计量或依赖网络。这么快开放 Muse Spark 1.2 也可能预示着 Meta 更大的前沿模型「Watermelon」离发布越来越近了。
Meta AI 火力全开🔥🔥
Meta 刚刚推出了 Muse Glimmer,这是一个 300 亿参数的开放权重智能体模型(Apache 2.0),专门为在消费级 GPU、Mac 和 PC 上本地运行打造:
- 支持常开本地智能体工作流,不需要依赖云端,也没有网络延迟
- 使用 4 位量化后可以适配 24GB 到 32GB VRAM 空间(K-Quant 约 17GB),同时还能预留运行内存给 KV 缓存
- 训练流程为:从 Muse Spark 做 logit 蒸馏,在长上下文智能体轨迹上做中期训练,最后用强化学习做后训练
- 原生支持故障恢复,可以在工具执行过程中诊断 schema 或运行时错误,自动重试步骤
- 搭配配套的 DFlash 投机解码 drafting 模型,在 M 系列芯片和 RTX GPU 上实现 1.5 倍到 3.1 倍更快的生词速度
- 通过专用感知编码器支持交错文本和视觉输入,可以解读图表、UI 截图和文档
权重和开发者文档已经上线 Hugging Face。视频来源:Meta 博客
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖