AI Pulse
📡 X 信号

Kimi K3模型现在已经上线Perplexity了

我们已经为 Pro 和 Max 订阅者在 Perplexity 和 Perplexity Computer 中添加了 Kimi K3。Perplexity 中的 Kimi K3 完全托管在位于美国的服务器上。

昨天开源权重大模型发布,以下是 Kimi K3 的架构图,以及我的一些观察和思考。

1. 没错,它看起来相对复杂,但本质上是他们去年发布的 Kimi Linear 模型放大后的生产版本(参数从 48B 扩大到了 2.8T;K3 是目前为止最大的开源权重模型)。

2. 和 Kimi Linear 相比,唯一新增的组件是 LatentMoE。我下图里省略了它,因为图已经太挤了,但它本质上就是 Nemotron 3 Ultra 里用的那个 LatentMoE——如果你好奇,可以在我的 LLM 架构图库找到它。这个设计的思路是类似多头潜在注意力,对大型线性层做压缩(下投影)。

3. Kimi K3 的整体趋势(和 Nemotron 3、DeepSeek V4 等模型类似)也是朝向更高推理效率发展。也就是说,它用很多经过效率优化的组件替换了原有组件:MoE 换成 LatentMoE,常规注意力换成多头潜在注意力和 Kimi Delta Attention。如果你想了解更多细节,我的图库也有对应的短教程和介绍文章。

4. 唯一一个不是为了效率优化的组件改动是注意力残差。就像 DeepSeek V4 用 mHC(流形约束超连接,manifold-constrained Hyper-Connections)改进了残差路径,注意力残差也是改进残差路径的一种方法,但工作方式略有不同。

具体来说,mHC 加宽了残差路径;注意力残差(它已经是 Kimi Linear 的组成部分)跨层连接残差,连接本身会用注意力分数作为重要性/贡献权重。根据技术报告,它始终能提升验证损失和下游性能(幅度不大),仅会增加约 4% 的训练成本和 2% 的推理成本。

5. 有意思的是,Kimi K3 移除了所有 RoPE 层,改为全位置使用 NoPE(无位置嵌入)。这一点同样继承自 Kimi Linear。

在其他架构中,近期的趋势是局部注意力层(比如滑动窗口注意力)用 RoPE,全局层用 NoPE。之前也有少数架构全位置只用 NoPE,但据我所知,这是第一个达到前沿水平的案例。

6. Kimi K3 现在还原生支持多模态,这很棒!技术报告里还有不少其他有意思的训练细节,但从架构层面来看我就说这么多。总的来说这是一次非常出色的发布。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部