AI Pulse

不是AI专家也能评估AI?4500人报了他的课

不是AI专家也能评估AI?4500人报了他的课

Hamel Husain 和别人合开了一门课,名字叫 AI Evals for Engineers and PMs,给工程师和产品经理的AI评估课。报名超过4500人,学生来自500多家公司,OpenAI、Anthropic、Google 的员工都在名单上。课名已经把主题说清了:AI评估。

博客是另一块阵地。这个列表里最早一篇在2017年5月,写的是 Airbnb 的自动机器学习实践。那一年还写过一篇 Docker,讲数据科学家如何更高效。2018年两篇:序列到序列模型做出“有魔力的数据产品”,用深度学习给任意对象做语义搜索。2019年两篇都和 GitHub 有关:用机器学习做任务自动化,以及 CodeSearchNet 挑战。2020年也有不少更新:fastcore、fastpages、GitHub Actions、Python 并发、Jupyter+Git+Kubernetes 的 MLOps,还有 nbdev 的文学编程环境。2022年写了 Metaflow 的生产笔记本和 nbdev+Quarto。

2023年上半年,他还在写 Kubernetes 和 nbdev 商业化。秋天,选题转向 LLM。10月是 vLLM 与大型模型、优化 LLM 延迟两篇;11月是整理 LLM 数据的工具;12月专门讨论分词陷阱。

2024年评估这条线变得突出。1月两篇工具文章:Dokku,他称之为最喜欢的个人无服务器平台;如何调试 Axolotl。2月的标题不留余地:《Fuck You, Show Me The Prompt.》——少废话,把提示词亮出来。3月连着两篇:《你的AI产品需要评估》和《微调还有价值吗》。4月写用对抗验证调试AI。6月总结一年来构建LLM应用学到的教训。7月介绍一门由实践者主讲的LLM开放课程。10月是 LLM 当裁判的完整指南和 FastHTML 的并发基础。11月写技术写作如何积累读者,12月介绍 nbsanity,一个能把 notebook 分享成网页的工具。

2025年继续围绕评估展开。1月写用 Devin 一个月的感想。3月是快速改进AI产品的实地指南。5月写《LLM评估:你需要知道的一切》。6月介绍 Inspect AI,一个用于 LLM 评估的开源 Python 库。7月那篇叫《Stop Saying RAG Is Dead》,别再说 RAG 已死。10月聊怎么选对的AI评估工具。

2026年的文章更直接。1月写为什么不用 nbdev 了。3月两篇:《编码智能体的评估技巧》和《数据科学家的复仇》。6月那篇标题是《“评估很难”是一种产品坏味道》。7月直接问《自动化评估有效吗?》。8月12日更新了最新一篇《AI产品工程笔记》。

把这些标题按时间排开,路径很清楚。2024年说你的AI产品需要评估,10月给出用 LLM 当裁判的方法;2025年谈选工具和落地;2026年开始诊断“评估很难”这句话本身。从“应该做”到“怎么做”,再到“遇到困难怎么办”,这几年走完了从提醒到方法论的过程。

课程的数字放在一起看:4500名学生,500多家公司,OpenAI、Anthropic、Google 的员工都在里面。评估这件事,已经被单独开成一门课了。

想跟进他的动态,Hamel 的建议是关注 X(Twitter)账号,那里是他更新最及时的地方。

阅读原文
📚 相关主题 AI工程机器学习数据科学

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新