Baseten工程师拆解Kimi K3 梳理大模型七年技术脉络
Kimi K3开源后,一位来自Baseten的工程师花48小时完成了对Kimi K3建模代码的完整拆解,过程中喝了40罐气泡水。
Kimi K3的总参数规模,相当于22580个2019年发布的GPT-2,七年间参数增长了两万两千多倍,但这次拆解显示,性能提升并非单纯依靠堆叠参数实现。
从GPT-2到线性注意力,再到DeltaNet、门控DeltaNet,最终到Kimi自研的KDA,每一步技术迭代都在针对性解决上一代技术的具体问题。
代码开源第一天,就有开发者梳理清楚了大模型七年的技术发展脉络,这是闭源模型永远无法获得的优势。
核心技术演进路径十分清晰:GPT-2采用经典的仅解码器结构加KV缓存,内存带宽很快成为性能瓶颈;线性注意力采用固定D×D状态,摆脱了复杂度随序列长度O(N)增长的限制,但存在信息互相干扰的问题。
DeltaNet引入Delta规则,精准覆盖旧信息,解决了信息干扰问题。
门控DeltaNet新增门控机制,终于实现了真正的“选择性遗忘”。
Kimi KDA则加入了细粒度逐通道门控,搭配穿插完整Softmax MLA的混合架构,以及MoE(混合专家模型)。
模型规模固然重要,容量提升需要添加在正确的位置。
大模型真正的技术壁垒,在于如何优雅地完成有限记忆的存储、更新、检索与遗忘。
建议所有做大语言模型的开发者阅读原拆解帖子。