AI Pulse
📡 X 信号

这个分步仓库教你用PyTorch从零训练自己的LLM

这个分步仓库教你用PyTorch从零训练自己的LLM

从头训练你自己的大语言模型!这个代码仓库会一步步带你使用 PyTorch 从零开始构建和训练一个Transformer模型,从下载训练数据一直到生成文本。

整个架构完全按照《注意力就是一切》原始论文从头搭建。多层感知器(MLP)、单头注意力、多头注意力、Transformer块,以及完整的Transformer模型——所有代码都已写好,并且每一步都有详细示意图讲解。

训练数据来自The Pile,这是一个规模达825GB的多样化开源数据集,涵盖书籍、文章、代码、网站等内容。该代码仓库包含脚本,可使用tiktoken下载、预处理和分词数据,将其存储为HDF5格式,并分批次送入训练。

你可以在单个Colab T4 GPU上训练一个1300万参数的模型。在1300万参数规模下,模型就已经能生成符合语法规则、连贯通顺的短句。如果要训练十亿参数级模型,你至少需要一张A100或RTX 4090。该代码仓库包含完整的GPU兼容性表,你可以清楚地知道你的硬件能做到什么。

另外还提供单独笔记本,包含完整的监督微调(SFT)和人类反馈强化学习(RLHF)指南,帮助你进一步训练你的模型。

主要功能:
• 端到端流程:数据下载 → 预处理 → 训练 → 文本生成
• 使用PyTorch从零实现完整Transformer
• 在单GPU上训练1300万到20亿+参数的模型
• 训练数据来自The Pile(825GB,22个多样化数据集)
• 通过tiktoken (r50k_base)分词
• 包含SFT和RLHF指南

100%开源。我已经把链接分享在回复里了!

Github 仓库:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新