AI Pulse
📡 X 信号

xAI工程师 Lauren Tan 用AI智能体单月合入2500个生产PR

xAI工程师 Lauren Tan 用AI智能体单月合入2500个生产PR

有点燃炸兄弟们,这才是顶级工程师驾驭 AI 最硬核的打法,建议调到两倍速把这场 38 分钟的技术内幕看完,去感受一下什么叫真正的生产力震撼。

前 Meta 和 Netflix 资深工程师、现 xAI 核心主力 Lauren Tan 刚把给 Cursor 官方大会准备的底牌直接公开了,她一个人带领智能体舰队单月合入 2500 个生产 PR,而且自己还能安稳睡大觉。

很多人用 AI 编程把自己变成了全天候无休的人肉测试员,而她做对的事情只有一件:把人类的检查点彻底往前移,让智能体不仅要写代码,还必须自己拉起真实环境把证据拿出来。

铁汁们你知道单人带队一个月往生产环境合入 2500 个 PR 是什么概念吗?整整 2500 个。按每月 22 个工作日换算,相当于每天合入 113 个,平均每 4 分钟就要上线一个功能。

但全网都在跟风吹代码生成有多快的时候,她开场第一句话直接泼了一盆冷水:如果代码质量不过关,盲目堆吞吐量就是一场灾难,连一个智能体都信不过就千万别开一百个云端舰队,那纯粹是在花钱买代码垃圾。

最先击穿行业认知的,是她把做完这两个字的定义重新写了一遍。以前大家让 AI 写代码,只要终端显示编译通过或者模型回复说搞定了,人就赶紧跑去肉眼看 diff,一行行核对直接把工程师累成整条链路里最慢的瓶颈。

在她的系统里,模型自己的口头报告连标点符号都不能信,做完必须等于铁打的运行时凭据。智能体必须自己调用 Chrome DevTools Protocol 驱动真实界面,点击到具体按钮,甚至跑完 CPU 性能分析抓出 trace 日志,把全套绿灯的执行录像留在原地,才算完成交付。

但光会验证还远远不够,遇到喜欢抄近路的智能体,下周相同的错误还会原样长出来。传统团队纠正 AI 习惯写几十页的长篇规范或者在 prompt 里苦口婆心叮嘱,结果模型转头就忘。

她在 Dune 架构里直接把代码库当成外部记忆体,按业务功能严格把代码锁在单层目录内,更绝的是把所有被团队反复骂过的坏习惯直接写成编译炸弹。比如在项目里直接封死 useEffect,谁敢写一行 CI 当场引爆,甚至连代码注释都直接禁止,配专门的清理工具全面清场,因为注释里 99% 都是过期的废话和误导性教条。

把错误路径用规则物理切断,AI 抄近路走出来的就只能是唯一正确的路。

真正让我觉得有意思的是,她把这套顶级工程师的心法全部封装成了现成的开源插件 pstack。不用再对着聊天框盲目敲长提示词,系统内嵌了 23 本应对不同场景的任务剧本和 23 条工程铁律。

从复现 bug 到分层合入,智能体被严格规定先定位根因再动手,默认先做删减再做新增。现在这套自动化外环甚至接入了用户反馈通道,智能体接到报错自己拉起模拟器复现,跑完验证直接提 PR,产品经理和设计师连一行底层代码都没摸过,都能安全地往主分支合入补丁。

用量狂飙不可怕,没有验证的并发才可怕。以前是人写代码教 AI 抄,现在是人当主厨把控出餐口,把工程品味铸进静态检查,让智能体在环内自己修到全绿。

一个只能丢 diff 等你看的智能体是在偷走你的时间,一个带着运行录像和证据链自己闭环的智能体才配做你的工程分身。这套打法已经在 Cursor 插件市场完全公开,输入命令即可直接挂载。

大家在日常写代码时,最敢彻底放手交给智能体去跑的是哪一步?我先说,排查冷门报错和抓性能日志我现在眼睛都不眨全丢给它,但核心架构的边界定义我半步都不会让。

把视频里最值钱的四个实操落地动作,以及插件安装命令整理在这里,需要的可以直接存:

插件一键安装:
在 Cursor 聊天框直接输入 /add-plugin pstack,随后运行 /setup-pstack 即可按你手头的模型预算配置路由。日常使用直接用 /poteto-mode 加上你的目标与验收方式,例如让它先复现性能毛刺再修复并验证。

重塑做完的标准:
立刻为你的项目建立自动化验证脚本。不要看模型说做完了,让它调用真实浏览器、跑测试、打 trace。没有运行凭据留存的任务一律视为未完成。

把骂过的话写成编译器规则:
禁止在 prompt 里反复唠叨规范。凡是团队禁止的模式,比如危险 hook、跨层依赖、冗余注释,直接写成 ESLint 规则或 CI 拦截脚本,把错误扼杀在提交之前。

目录即记忆:
按业务功能组织目录结构,让智能体在 80% 的时间里只在一个文件夹内完成闭环,物理缩短查找路径,防止上下文污染。

开源仓库传送门:

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新