AI Pulse
📡 X 信号

MiniMind手把手拆大模型全训练流程

MiniMind手把手拆大模型全训练流程

现在开始学大模型,很多教程上来就是:调 OpenAI API、套 Transformers、做个 RAG,再接一个 Agent。

东西虽然能跑的通,但是 Attention、Tokenizer、Pretrain、SFT 到底是怎么连接起来,很多时候还是一团迷雾。

这几天找一个非常适合补缺这块的项目 MiniMind,GitHub 已经 5.6W+ ⭐️。

它干的事情特别直接:让你从 0 开始,自己训练一个很小的语言模型。

主线模型大致有 64M 参数,小到普通个人 GPU 也能折腾,不需要先准备几张 H100。而且它不是只给你一个训练好的模型让你跑。

Tokenizer、模型结构、数据处理、Pretrain、SFT、LoRA、DPO,到 PPO / GRPO / CISPO,基本把一套 LLM 的训练流程都拆开给你看了。

现在连 Tool Use、Agentic RL、MoE、模型蒸馏这些都开始加入进去。

我比较感兴趣的是核心代码基本都用原生 PyTorch 自己写。

不再是调用几行 Transformers / TRL,接着告诉你“训练完成”。

所以你现在真想搞明白一个模型从随机参数,到开始会说话,中间到底发生了什么,这个仓库比直接啃几百亿参数的大模型舒服多了。

作者把门槛压得挺低。

README 给的例子里,单张 3090 跑一轮 SFT 大约 2 小时,对应租 GPU 的成本大概 3 块钱。

当然,别把它当成“3 块钱训练出一个 ChatGPT”🤣。

其实更像是拿一个足够小的模型,把大模型训练里那些步骤亲手走一遍。

你在平时 Claude、GPT、DeepSeek 用得很多,但还没真正从头训过一个语言模型,这个仓库挺适合拿来练手。

仓库:

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新