AI Pulse
📡 X 信号

AI研究者梳理近期发布的多款新颖开源大权重模型

没错,开源/开放权重模型对健康的AI生态系统非常重要。只有这样我们才能验证内容、核查声明、在封闭实验室之外保持发展。

另外,如果你还没准备好在使用闭源实验室的模型时,向他们共享个人数据和知识产权,开放权重模型能让我们自由在自有硬件上运行AI。(倒不是说专有模型不好,实际上我也经常用它们,但如果没有任何替代选项,生态就不会健康。)

不管怎样,现在几乎所有人都在等Kimi K3和Ling 3.0的权重近日登陆模型hub,但过去一周其实发布了不少其他有意思的新开放权重模型。对,就是这种惊喜不断的一周!所以,我整理了它们的架构图,加上我觉得最值得关注的要点:

1) Nanbeige 4.2 3B使用循环深度共享。这本质上意味着它会把同一个22层(即transformer块)栈运行两次。所以它把22层架构扩展到了44层,但不会复制权重。(transformer块计算量翻一倍,但内存占用不变。)

为什么这么做?公开信息比较少,但Nanbeige 4.2技术报告的2.1节指出,两次传递能得到最好的权衡,保留了标准架构约75%的token效率。更多传递几乎不会带来性能提升,反而会让训练慢很多,成本也高很多。

2) Laguna S 2.1是poolside的Laguna模型,尺寸做得非常合适:118B稀疏MoE,激活参数为8B,上下文窗口支持1M token。除此之外,架构相当标准。它使用36个滑动窗口层和12个全局(门控)GQA层。

但考虑到这个尺寸,加上它刚好能在我的DGX Spark上运行(占用不到80GB内存),它目前是我个人最感兴趣的模型。它比Qwen3.6-35B大3倍,所以稍微慢一点,但或许很适合代替Qwen3.6-35B当日常主力模型。(不过我还在等更多独立性能测试结果。)

3) Motif-3-Beta是一个新的314B-A13B稀疏MoE,在mHC和潜在注意力方面一定程度上基于DeepSeek V2开发。但它用了一个新组件:分组差分潜在注意力(Grouped Differential Latent Attention),灵感来自多头潜在注意力(Multi-head Latent Attention)。

我之后大概应该专门写篇文章讲这个,不过现在先给你总结一下。常规MLA会把键和值压缩成更小的潜在表示,主要目的是减小KV缓存大小。GDLA做类似的低秩压缩,但会把注意力头分组,还给每个组学习一个噪声头,通过减去噪声来做过滤……不管怎样,这个话题留到以后再说!

4) Solar Open 2是Upstage推出的新250B-A15B混合MoE,每一个GQA层就穿插三个Kimi Delta注意力层。

5) Antares 1B是Cisco推出的小模型(还有更小的0.3B变体),它以IBM Granite 4.0 1B为骨干,用SFT加GRPO做微调,面向基于终端的网络安全任务。它是在真·小模型上做任务专属后训练的很好范例。

6) BTL-3是给Qwen3.6-27B做的rank-32 LoRA适配器,面向编码代理和结构化工具调用。它非常出色的基准测试性能表明,在2026年,LoRA适配器依然是有用的工具/技术。

我已经把这六个模型都加到了LLM Architecture Gallery里,你可以去看更多细节:

说得对,跑性能基准测试还有更多内容要考虑。至于恶意性问题,这更多取决于测试工具。(就像我之前在这里写的,使用前做审计不是个坏主意:你确实可以在一定程度上测试开放权重模型对特定查询的行为,但你说得对,触发词很难处理。)

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部