开发者发布交互式Transformer训练并行化教程
我对这个作品并不百分百满意,但我打算停止开发并公开它,我认为公开好过封存。作品是基于两篇经典文章开发的交互式内容《如何对训练中的Transformer做并行化》,由我和Fable、Sol共同完成。
我启动这个项目,是因为最近我重新研读缩放相关著作,仔细梳理公式和思路后,觉得这类内容非常适合做成交互式可探索形式。
另有一个推动我开发的原因:原文章的NVIDIA GPU版本独立成文,对新手不够友好,建议先读TPU版本再读GPU版本。随着新硬件不断推出,所有示例都需要更新。
开发过程中,我请Fable将原文章改造成类似Bret Victor风格的交互式形式,之后我们修复了大量漏洞。这个交互式作品遵循「可探索讲解」的原始精神:目标不是娱乐,而是给读者提供工具自行探究。
我决定停止开发,是因为我意识到自己真正想要做的内容是「先给出屋顶线模型,再逐步添加修正因子让结果贴近实际」,而Transformer并行化这一主题并不适合这个框架。
除了现有内容的不足,这个版本里我最担心的是混合专家模型(MoE)的调整是否正确。DeepSpeed v3包含三个稠密层,但为了简化,屋顶线模型的计算中忽略了这一点。我不知道这样处理是否合适,我还在梳理相关思路。
希望这个作品能对某些人有用,哪怕只是用到「悬停在公式上就能查看变量含义」这个功能也好。