MiniMind手把手拆大模型全训练流程
现在开始学大模型,很多教程上来就是:调 OpenAI API、套 Transformers、做个 RAG,再接一个 Agent。
东西虽然能跑的通,但是 Attention、Tokenizer、Pretrain、SFT 到底是怎么连接起来,很多时候还是一团迷雾。
这几天找一个非常适合补缺这块的项目 MiniMind,GitHub 已经 5.6W+ ⭐️。
它干的事情特别直接:让你从 0 开始,自己训练一个很小的语言模型。
主线模型大致有 64M 参数,小到普通个人 GPU 也能折腾,不需要先准备几张 H100。而且它不是只给你一个训练好的模型让你跑。
Tokenizer、模型结构、数据处理、Pretrain、SFT、LoRA、DPO,到 PPO / GRPO / CISPO,基本把一套 LLM 的训练流程都拆开给你看了。
现在连 Tool Use、Agentic RL、MoE、模型蒸馏这些都开始加入进去。
我比较感兴趣的是核心代码基本都用原生 PyTorch 自己写。
不再是调用几行 Transformers / TRL,接着告诉你“训练完成”。
所以你现在真想搞明白一个模型从随机参数,到开始会说话,中间到底发生了什么,这个仓库比直接啃几百亿参数的大模型舒服多了。
作者把门槛压得挺低。
README 给的例子里,单张 3090 跑一轮 SFT 大约 2 小时,对应租 GPU 的成本大概 3 块钱。
当然,别把它当成“3 块钱训练出一个 ChatGPT”🤣。
其实更像是拿一个足够小的模型,把大模型训练里那些步骤亲手走一遍。
你在平时 Claude、GPT、DeepSeek 用得很多,但还没真正从头训过一个语言模型,这个仓库挺适合拿来练手。
仓库: