@wafer_ai 发布第9部分GPU MODE学习资源
我们推出了目前全球最全面的AI性能工程仓库,关注并收藏来跟进这个系列。链接在本推文串中。
第九部分:GPU Mode讲座。这个条目本身就是一个完整的资源仓库。GPU MODE收集了讲座、幻灯片、笔记本和代码,涵盖GPU编程以及现代AI训练和推理背后的系统。
这些讲座能帮助AI性能工程师诊断训练和推理缓慢的问题,并确定应该优化什么。示例展示了内核内存访问、数值精度、GPU通信和运行时调度如何影响模型性能。
GPU MODE的讲者将这些问题与实现细节联系起来:
- 使用PyTorch和Nsight进行性能分析,追踪操作到GPU内核和内存传输,还有计时示例,其中包含预热和同步。
- GPU内存和执行,使用合并、共享内存分块和占用率来解释线程映射和数据复用如何影响性能。
- 使用Triton、CuTe和Gluon进行内核开发,包括将数据映射到线程和内存的张量布局,以及对异步GPU操作的控制。
- 注意力内核,逐步讲解FlashAttention的分块,以及FlashAttention-3在Hopper架构上的数据移动、矩阵乘法和softmax的重叠。
- 内核融合,检查来自torch.compile的代码,编写可减少中间内存流量的自定义内核,还有对比内存使用和执行时间的示例。
- 低精度计算,涵盖FP8和FP4格式、量化优化器状态,以及影响数值误差的舍入和缩放选择。
- 分布式训练,跟随PyTorch梯度同步进入NCCL AllReduce,检查跨GPU合并结果所需的通信。
- 推理服务,研究SGLang的CPU/GPU调度重叠和vLLM投机解码示例,对比已接受token和 drafting 与验证成本。
你可以用这个合集来制定学习计划,或是调查实际工作负载中的瓶颈。一步步研究相关实现,检查它的假设和数值结果,然后衡量在对应用很重要的硬件和输入形状上的权衡。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖