AI Pulse
📡 X 信号

斯坦福2026新课 怎么定义AI Agent工程

今天已经看到不少人在分享 Stanford 新开的 CS329Z: Engineering AI Agents。

不想再重复介绍课程,我反而更好奇: Stanford 到底把什么算作 2026 年的「Agent Engineering」?

看完整 syllabus,RAG、Tool Use、MCP、Agent Framework 基本都放在前半程,更像 Agent 的基础能力。真正让我注意的是后半段。

第一节课就把 Agent Engineering 的核心工程问题概括成: Decomposition、Data、Evaluation。后面的课程也沿着这条线展开,从 Agent Data、Trajectory、Memory、Optimization,一直讲到 Evaluation、Coding Agent、Long-running Agent 和 Reliability。

作业设计也很值得关注。第一个作业让学生从零搭 Agent;第二个直接变成 Evaluate an Agent:自己设计 benchmark、grader、LLM-as-Judge 和 error analysis。Evaluation 甚至连续讲了两周。

一个很有意思的细节,是课程专门讲 pass@k 和 pass^k:前者看「多试几次能不能成功一次」,后者看「连续跑很多次能不能都成功」。对 Agent 来说,这其实对应两种完全不同的可靠性。

Multi-Agent 那一节也挺克制。一边讲 orchestration、handoff 和 collaboration,一边专门讨论协调失败和错误传播,reading 里甚至放了一篇: 《Don't Sleep on Single-agent Systems》至少从这份 syllabus 看,「更多 Agent」并没有被默认等同于更好的系统。

所以我更愿意把这门课看成 Stanford 对 2026 年 Agent 技术栈的一次切片。RAG、工具调用这些能力正在变成底座,后面更值得继续往下挖的,是 数据怎么来、系统怎么评、Agent 怎么优化,以及它能不能在复杂、长时间的真实环境里稳定跑下去。

这几个问题,感觉也会是接下来一两年 Agent 研究持续关注的方向。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新