手把手从零训练你自己的大语言模型,代码都给你了
从零训练你自己的 LLM!这个分步教程仓库会带你用 PyTorch 从头搭建并训练一个 transformer 模型,从下载训练数据开始,一直到生成文本。
架构完全遵循原始论文《Attention is All You Need》从零搭建。MLP、单头注意力、多头注意力、transformer 块、完整 transformer 模型——每一步都有代码实现、详细讲解和配图。
训练数据来自 The Pile,这是一个规模 825GB 的多样化开源数据集,涵盖书籍、文章、代码、网站等内容。仓库包含下载脚本,还会用 tiktoken 做预处理和分词,保存为 HDF5 格式,最后分批输入训练。
你可以在单张 Colab T4 GPU 上训练一个 13M 参数的模型。13M 参数规模下,模型就能生成语法正确、语义连贯的短句。如果要训练十亿参数级模型,你至少需要一张 A100 或者 RTX 4090。
仓库提供了完整的 GPU 兼容性表格,你可以清楚知道你的硬件能支持哪些训练规模。仓库还单独提供了一个完整 SFT 和 RLHF 指南 notebook,帮你进一步优化训练好的模型。
功能清单:
- 端到端流程:从数据下载、预处理、训练到文本生成
- 用 PyTorch 从零实现完整 transformer
- 单GPU可训练 13M 到 2B+ 参数规模的模型
- 训练数据来自 The Pile(825GB,22个多样化数据集)
- 通过 tiktoken(r50k_base)完成分词
- 包含 SFT 和 RLHF 指南
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖