AI Pulse
📡 X 信号

斯坦福CS329A自我改进AI智能体课程录像公开

我最近发现 Stanford Online 把研究生课程 CS329A:Self-Improving AI Agents 的完整课程录像放到 YouTube 了,一共有9个章节。

这门课围绕一个核心问题展开:AI Agent 怎么通过和环境不断交互,持续改进自己的能力。

内容从 Test-Time Compute、Verifier 和 RL 讲起,往后推进到 Test-Time Scaling、STaR、DAPO、GRPO 这些让模型“边用边学”的关键方法。再到 Agentic Evaluations 和 Long Horizon Tasks,最后一讲直接指向未来的研究方向。

授课的是两位 Google DeepMind 核心研究员,每讲一个多小时。不收费、不限身份,实验室级别的课程直接摊开给你看。

我的感觉是:很多人学 Agent,上来就冲工具和框架——Claude Code、MCP、Skills、Multi-Agent……装了一堆,越学越乱。

这门课是反过来的。它先帮你建立一条主线:Agent 为什么能变强、变强靠什么、每一步是怎么推进的。

你看完 Test-Time Compute 和 Verifier,能理解“单次推理”是怎么被改进的; 看到 STaR 和 GRPO,能搞懂“自我反思”到底在做什么;到了 Long Horizon Tasks,才知道“长周期任务”才是 Agent 真正要面对的考验。

有了这条主线,你再回去看那些工具和框架,它们就不再是零散的碎片了——你会清楚它们各自处于这条主线的哪个位置,以及接下来可能会往哪个方向演化。这门课就是帮你把那些碎片拼成一张完整地图。

如果正在学 Agent,或者打算深入这个方向,这个播放列表值得你花时间啃下来👇👇👇

Interesting timing. The Stanford course explains how agents learn. Tibo's update explains what it costs to run them at scale. Codex is resetting usage for all paid subscriptions tomorrow.

The trigger: image inefficiencies in long sessions, high p95+ usage from Computer History, and a conversation-title feature that quietly burned more tokens than intended. A tiger team is shipping fixes. And a novel efficiency approach is coming next week.

Two layers of the same story: Theory tells you what agents can become. Production tells you how much it costs to get there. If you only watch the lectures, you'll understand the architecture. If you also watch the rate limits, you'll understand the economics. Both are required to see where this is heading. 💸

上一条Tibo在调Codex的效率,降成本、稳系统。 这一条是13个工具,把Claude Code从“能用”推到“好用”。

底层在改,工具链在扩——两边同时发力,开发效率才能真正提起来。

尤其值得装的四个: Claude Mem(不用每次重新教) Superpowers(27万星工程方法论) Caveman(砍65% token) PonyTail(像高级工程师那样写最少的代码) 收藏完记得装一个试试。🪞

一条讲 Agent 如何与环境交互、持续进化,一条讲蓝V在新规下如何发展——看起来话题不同,但底色是一样的:连接怎么建立?

Agent 课教的是机制。蓝V的帖子讨论的是真实的连接。一条往系统里走,一条往关系里走。

评论区里 @isnail 说得好:“形式变了,本质没变。”Agent 的底层逻辑和人类社交有点像——有价值、有反馈、能形成循环的东西,才会持续下去。

两条内容一起看,刚好帮你把“连接”这件事从两个角度想完整了

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新