博主整理了Transformer块知识手册,从原理讲清核心组件
Transformer 块是一个非常有趣的主题,因为现代大语言模型中的众多重要思想都交汇在这一块相当小的架构中。
我制作了一份手册,从第一性原理出发讲解 Transformer 块,从残差流开始,然后依次讲解归一化、注意力、输出投影、MLP 以及推动表征前进的残差更新。
手册内容涵盖 LayerNorm 和 RMSNorm、Pre-Norm 与 Post-LN、自注意力、RoPE、SwiGLU 和门控 MLP、并行块、QK-Norm、GQA/MQA/MLA、MoE、参数量统计、训练 vs 推理,以及 KV 缓存。
我想要特别明确区分的一点是,两个主要分支承担着不同的工作。注意力在不同词元位置之间混合信息。MLP 是按位置处理的,在投影回模型宽度之前,独立变换每个词元的表征。残差流将整个块连接在一起。
一个典型的解码器块接收形状为 (B, T, d) 的张量,返回另一个形状相同的张量,但会大幅改变这些向量表征的内容。
大家熟悉的 Transformer 块框图也只是该设计的一种版本。归一化的位置可以改变,注意力头可以分组或压缩,Q/K 可以在内部归一化,MLP 可以变成 MoE 层,还有一些模型并行运行注意力和 MLP 分支。
我制作这份手册,就是为了提供我当初尝试理解 Transformer 层内部到底发生了什么的时候,希望能得到的解释。
在此分享手册:
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖