AI Pulse
📡 X 信号

Baseten工程师拆解Kimi K3 梳理大模型七年技术脉络

Kimi K3开源后,一位来自Baseten的工程师花48小时完成了对Kimi K3建模代码的完整拆解,过程中喝了40罐气泡水。

Kimi K3的总参数规模,相当于22580个2019年发布的GPT-2,七年间参数增长了两万两千多倍,但这次拆解显示,性能提升并非单纯依靠堆叠参数实现。

从GPT-2到线性注意力,再到DeltaNet、门控DeltaNet,最终到Kimi自研的KDA,每一步技术迭代都在针对性解决上一代技术的具体问题。

代码开源第一天,就有开发者梳理清楚了大模型七年的技术发展脉络,这是闭源模型永远无法获得的优势。

核心技术演进路径十分清晰:GPT-2采用经典的仅解码器结构加KV缓存,内存带宽很快成为性能瓶颈;线性注意力采用固定D×D状态,摆脱了复杂度随序列长度O(N)增长的限制,但存在信息互相干扰的问题。

DeltaNet引入Delta规则,精准覆盖旧信息,解决了信息干扰问题。

门控DeltaNet新增门控机制,终于实现了真正的“选择性遗忘”。

Kimi KDA则加入了细粒度逐通道门控,搭配穿插完整Softmax MLA的混合架构,以及MoE(混合专家模型)。

模型规模固然重要,容量提升需要添加在正确的位置。

大模型真正的技术壁垒,在于如何优雅地完成有限记忆的存储、更新、检索与遗忘。

建议所有做大语言模型的开发者阅读原拆解帖子。

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部