这个分步仓库教你用PyTorch从零训练自己的LLM
从头训练你自己的大语言模型!这个代码仓库会一步步带你使用 PyTorch 从零开始构建和训练一个Transformer模型,从下载训练数据一直到生成文本。
整个架构完全按照《注意力就是一切》原始论文从头搭建。多层感知器(MLP)、单头注意力、多头注意力、Transformer块,以及完整的Transformer模型——所有代码都已写好,并且每一步都有详细示意图讲解。
训练数据来自The Pile,这是一个规模达825GB的多样化开源数据集,涵盖书籍、文章、代码、网站等内容。该代码仓库包含脚本,可使用tiktoken下载、预处理和分词数据,将其存储为HDF5格式,并分批次送入训练。
你可以在单个Colab T4 GPU上训练一个1300万参数的模型。在1300万参数规模下,模型就已经能生成符合语法规则、连贯通顺的短句。如果要训练十亿参数级模型,你至少需要一张A100或RTX 4090。该代码仓库包含完整的GPU兼容性表,你可以清楚地知道你的硬件能做到什么。
另外还提供单独笔记本,包含完整的监督微调(SFT)和人类反馈强化学习(RLHF)指南,帮助你进一步训练你的模型。
主要功能:
• 端到端流程:数据下载 → 预处理 → 训练 → 文本生成
• 使用PyTorch从零实现完整Transformer
• 在单GPU上训练1300万到20亿+参数的模型
• 训练数据来自The Pile(825GB,22个多样化数据集)
• 通过tiktoken (r50k_base)分词
• 包含SFT和RLHF指南
100%开源。我已经把链接分享在回复里了!
Github 仓库:
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖