AI Pulse
📡 X 信号

Sergey Levine发布Deep Reinforcement Learning 2026春季版课程资料(2026)

最近如果想系统补一下强化学习,尤其是 LLM post-training,这套 Berkeley CS 185/285 很值得收藏。

Sergey Levine 的 Deep Reinforcement Learning 2026 春季版课程资料已经完整放出来了,昨天课程录像也开始上传到 YouTube。

课程从 imitation learning、Policy Gradient、Actor-Critic、Q-Learning,一直讲到 Model-Based RL、Offline RL 和 Exploration。

我比较感兴趣的是今年还专门加入了「RL with Sequences & LLMs」。

里面会从 RL 的视角重新讲 RLHF、Verifier Reward、GRPO、KL Regularization 这些现在做 LLM post-training 经常看到的东西。

而且不只是听课,Homework 4 直接要求自己实现 GR-REINFORCE 和 GRPO,再真正跑训练实验做对比。

最近 RL、Agent 和 LLM post-training 连得很紧,这套课正好可以把很多零散的概念重新串起来。

课程: YouTube 上搜索 RAIL 的「CS 185/285 (Spring 2026)」播放列表就能看到最新课程录像。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新