AI Pulse
📡 X 信号

读了200多篇AI论文后挑出36篇经典整理分享

接上一篇,张小珺与谢青池的访谈,谢读了200多篇AI论文,从中挑出36项经典论文,我让Codex整理出下载地址,分享给有需要的人。

完整节目与 Show Notes:

他读论文的方法,带着这几个问题去读:当时遇到了什么问题?旧方法为什么不够?新工作解决了什么?它又为哪些后续技术铺了路?

下面按4条历史主线整理。建议第一次阅读不必逐行推公式,先看摘要、Introduction、核心图和 Conclusion,把因果链串起来。

一、模型范式的变迁
这条线回答:神经网络为什么变深、Attention 为什么出现,Transformer、MoE、推理与 Agent 又从哪里来?
Brook for GPUs(2004)
AlexNet(2012)
《用神经网络做序列到序列学习》(2014)
《通过联合学习对齐和翻译实现神经机器翻译》(2014)
《提炼神经网络中的知识》(2015)
《图像识别的深度残差学习 / ResNet》(2015)
《稀疏门控混合专家模型》(2017)
《注意力即是全部》(2017)
AlphaGo Zero(2017)
《惨痛教训》(2019,文章而非论文)
LoRA(2021)
《思维链提示》(2022)
ReAct(2022)

二、Infra 与数据
这条线回答:模型怎样从单机实验扩展到万卡训练?模型、数据和计算预算应该怎样匹配?
ZeRO(2019)
《神经语言模型的缩放定律》(2020)
《训练计算最优的大语言模型 / Chinchilla》(2022)
LAION-5B(2022)
《用于Falcon LLM的RefinedWeb数据集》(2023)
《MegaScale:将大模型训练扩展到10,000+ GPU》(2024)

三、语言模型的发展
这条线回答:词怎样变成向量?预训练为什么有效?模型怎样从任务微调走向上下文学习,再变成遵循指令的助手?
Word2Vec(2013)
《谷歌神经机器翻译 / GNMT》(2016)
GPT-1(2018)
BERT(2018)
GPT-2(2019)
GPT-3(2020)
InstructGPT(2022)
Tulu 3(2024)

四、多模态模型的发展
这条线回答:深度学习怎样进入视频和图像生成?Transformer 又怎样扩展到视觉与扩散模型?
《基于卷积神经网络的大规模视频分类》(2014)
《用于视频动作识别的双流卷积网络》(2014)
《生成对抗网络 / GAN》(2014)
《基于非平衡热力学的深度无监督学习》(2015)
《去噪扩散概率模型 / DDPM》(2020)
《视觉Transformer / ViT》(2020)
CLIP(2021)
《潜在扩散模型 / Stable Diffusion 的技术基础》(2021)
《扩散Transformer / DiT》(2022)

两项补充阅读
它们在访谈中被明确提到,但不属于正式36项主清单:
《硬件彩票》(2020)
PPO(2017)

如果时间有限,可以先读这10项:《注意力即是全部》、GPT-1、GPT-2、GPT-3、Scaling Laws、Chinchilla、InstructGPT、LoRA、ReAct、CLIP。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新