AI Pulse
📡 X 信号

Wafer AI 发布AI性能工程GitHub仓库资源

Wafer AI 发布AI性能工程GitHub仓库资源

我们正在全球收录最全面的 AI 性能工程 GitHub 仓库中上传每一份资料。这里是 Wafer 的 AI 性能工程系列资料链接,分线程发布 🧵

第二部分:Vaswani 等人撰写的《注意力就是你所需的全部》,这可以说是现代 AI 领域影响最深远的论文。

- 作者阐述了原始 Transformer 的计算和信息流。
- 缩放点积注意力:softmax(QKᵀ/√d_k)V,其中 d_k 是查询/键的维度。作者对对数it进行缩放,来抵消点积过大导致 softmax 梯度过小的问题。
- 每个注意力头都有独立的可学习 Q/K/V 投影,之后进行每个头的加权聚合、拼接,再加上一个可学习的输出投影。
- 交叉注意力使用解码器查询对编码器的键/值,让预测以编码后的源表示为条件。
- 在 softmax 之前对未来位置的对数it进行掩码,并将目标嵌入偏移一个位置。训练时可以在已知的目标位置上并行计算;生成仍然依赖之前的输出。
- 按位置的前馈网络(FFN)在不混合 token 的情况下转换表示。原始的后层归一化架构(post-norm)是在层归一化之前先做残差相加。
- 正弦位置编码提供位置信息。对于任何固定偏移,偏移后的编码是原编码的线性函数。
- 全序列自注意力混合(不包含投影)的时间复杂度是 O(n²d),而密集循环的复杂度是 O(nd²),其中 n 是序列长度,d 是表示维度。直接连接缩短了依赖路径,但全对注意力带来了序列长度的二次缩放。
- 在作者做的英德开发实验中,尽管困惑度更差,但标签平滑提升了 BLEU 分数;固定总注意力宽度不变改变头数量,并没有带来 BLEU 分数的单调提升。大模型把相同的编码器-解码器架构扩展到 16 个注意力头,模型宽度 1024,前馈网络宽度 4096。

作者报告,在 8 块 NVIDIA P100 GPU 上训练 3.5 天后,在 WMT 2014 英德 newstest2014 测试集上取得了 28.4 BLEU。评估时他们对最后 20 个检查点取平均,得分比表 2 中最强的集成模型高出 2 个 BLEU 以上。

这篇论文影响如此深远的原因:
- 作者用注意力替换了序列对齐循环。训练可以并行处理已知序列位置,远距离 token 之间的路径比循环模型更短。合著者 Jakob Uszkoreit 将这种并行计算和更好地利用 GPU 与 TPU 联系了起来。
- 2018 年,GPT 将 Transformer 解码器和生成式预训练结合;BERT 将双向 Transformer 编码器和掩码语言模型预训练结合。两者都从未标注文本中学习得到研究人员可以在下游任务中复用的表示。到 2020 年 10 月,谷歌报告称几乎所有英语查询都使用了 BERT。
- GPT-3 的作者利用上下文里的指令或示例来评估模型,

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新