Keras创始人推荐其书籍章节 从零学训练大模型
如果你想从0开始学习如何训练一个大模型,那我推荐你读读这个⬇️
ARC Prize 联合创始人、Keras 创始人 François Chollet 刚刚推荐了一套从零学习 LLM 的路线。
他说如果你 17 岁,或者任何年龄,想从零开始学习怎么构建一个 LLM,直接去读他写的《Deep Learning with Python》第 15、16 章。
我刚翻了一遍,这两章确实值得收藏。
第 15 章从最基础的语言模型开始,一路讲到:
字符级 Language Model → Seq2Seq → Attention → QKV → Scaled Dot-Product Attention → Multi-Head Attention → Self-Attention → Transformer
尤其最后还有一整节专门解释:
为什么 Dot-Product Attention 会有效?
@fchollet 自己评价,这是你能找到的关于这个问题最好的解释之一。
它没有停留在 QKᵀ / √d 这些公式,而是从 Word2Vec 和 embedding space 开始,解释 Transformer 怎样通过一层层 Attention,把 token 之间的相关性逐渐变成向量空间中的距离关系。
第 16 章就更直接了,直接教你从零训练一个 mini-GPT。
具体包括如何从 C4 里取接近 10 亿 token,如何构建SentencePiece 32K 词表,如何搭一个 8 层、8 heads、hidden size 512 的 4100 万参数 mini-GPT,然后自己做数据 pipeline、weight tying、learning-rate warmup、预训练和 temperature / top-k 等采样。
从 tokenizer、数据 pipeline、causal attention、weight tying、learning rate warmup,到 pretraining,再到 greedy、temperature、top-k sampling,基本把一套 GPT Training Recipe 完整跑了一遍。
甚至算力也给你准备了免费的来源。
官方表示用Google Colab 免费提供的 T4 GPU就能跑完整个例子,大约 6 个小时。
如果用 A100 只需要一小时出头。
后面还继续讲了 Gemma、SFT、RLHF、RAG 和多模态。
所以如果有人问我完全没训练过大模型,应该从哪里开始?
这两章可能真的是一个很好的起点。
目前《Deep Learning with Python》第三版现在可以直接在线免费阅读,配套 Notebook 也全部公开,可以直接扔进 Colab 跑。
2026 年再学 LLM,确实没必要一上来先啃一百篇论文。
先亲手把一个 41M 的 GPT 从数据处理一路训到吐字,很多概念自然就串起来了。
学习地址: