AI Pulse

让Claude Code自己干活,先给它一套过关标准

不写代码也能让Claude Code全程自己跑:给验证指标、选对审批模式、盯紧上下文,附可直接复制的提示词。

Claude Code 是 Anthropic 出的智能体式编码环境。「智能体(agent)」的意思是,它不像聊天机器人那样答一句等一句,而是能自己读项目文件、跑命令、改文件,把一个任务从头跑到尾——你在旁边看着、纠正,或者干脆撒手。官方对工作方式的描述很直白:从「你写代码,让 AI 审」变成「你描述要什么,AI 自己琢磨怎么建出来」。更准确地说,这个流程仍以代码场景为主——官方的最佳实践来自各代码库工程师的使用经验,下面的例子也全是测试、构建、调试这些编码任务。

但这份自主有代价:上下文窗口(模型一次能记住的全部内容)填满得很快,性能随填满而下降;权限怎么放,直接影响它会不会闯祸;最关键的一条是,它默认「看起来做完」就停。跑偏了还觉得完工,是新手上手最先翻车的点。这一篇里提到的开关名称、安装渠道会随版本变化;工具界面变得快,动手前以 Anthropic 官方当天文档为准。

让它自己跑,先给它一张「过关标准」

Claude Code 停下来,通常是因为工作「看起来」做完了。问题在于「看起来」是它的观感,不是机器的判断。想让它自我纠错,就要给它一个能返回 pass/fail 的检查。检查可以是测试套件、构建退出码、静态检查工具(linter)、脚本比对输出,甚至截图对照设计稿。有了这个,闭环自己转:AI 干活 → 跑检查 → 读结果 → 没通过就继续改。

同样的需求,写法和结果天差地远。官方给出的对照例子,可以直接抄:

❌ 实现一个验证电子邮件地址的函数
✅ 写一个 validateEmail 函数。示例测试用例:[email protected] 是 true,invalid 是 false,[email protected] 是 false。实现后运行测试

❌ 把仪表盘做得更好看
✅ [粘贴设计截图] 按这个设计实现。完成后截图并和原图对比,列出差异,修掉

❌ 构建失败了
✅ 构建报这个错:[粘贴错误]。修复并确认构建能通过。要修根因,别把错误压下去

三个例子其实是同一个动作:把「你觉得完成了」翻译成「机器能判断完成了」。这条原则在任何任务上都通用——不管是写代码,还是让 AI 处理文档、整理文件:先说清什么算对、怎么自查,再放手让它跑。

审批这道关:交给谁把守

默认情况下,Claude Code 每次跑命令、改文件之前都会问你批不批。安全,但费手。官方观察过一个数据:实际使用中,用户对这类弹窗 93% 都会直接批。九成三是走过场,「把关」的含金量就被稀释了——点习惯了人就不看,真正危险的请求可能混在里头一起放行。这就是批准疲劳。

过去只有两个极端:沙箱(把工具隔离起来,安全,但每加一个能力就要配置一次,要联网、要访问宿主机的活也做不了)和跳过全部权限(让 AI 零确认裸奔)。中间态一直没有好方案。

官方的新模式 auto mode 补上了中间态:审批交给模型分类器,分两层把关。输入层,一个服务端的提示词注入探针(提示词注入,指恶意内容混在文件或网页里,试图劫持 AI 的行为)先扫一遍 AI 读到的文件、网页、命令输出,发现可疑就加警告,让 AI 锚定你原本的要求;输出层,分类器在每个动作执行前评估——先用极快的单 token 过滤拦下可疑项,只有被标可疑的才触发深度推理。分类器跑在 Sonnet 4.6 上。

但别把它当成万能保险。官方内部有一份 agent 行为事故日志,记录过:误删远程 git 分支、把工程师的 GitHub 令牌上传到内部集群、对生产数据库发起迁移——都是模型太积极,在你没这个意思的时候自作主张。现实用法是:日常长任务开 auto mode,省掉无意义的点按,把注意力留给真正危险的时刻;高风险动作(删分支、动生产库、碰鉴权文件)哪怕开着 auto mode,也值得自己过一遍手。auto mode 的开启入口在官方文档里,这类开关变得快,动手前先扫一眼当前写法。

上下文窗口是命门

Claude 的上下文窗口,装的是整场对话:每条消息、每个读过的文件、每条命令输出。一次调试或一次代码库探索,就能吃掉几万 token。而模型在窗口趋满时性能明显下滑——开始忘记早先的指令,错误变多。官方把它称作最重要的资源。

两个习惯。一是持续追踪上下文占用,官方建议用自定义状态栏常驻显示,让「还剩多少」一直可见。二是主动省着用——官方另有一份专门的省 token 攻略,如果你频繁被「失忆」卡住,先把那篇读完再回来干活,比硬撑有效。

一个现成流程:用 Lathe 生成教程,再亲手做完

Lathe 是这类 agent 流程里一个值得拆开看的现成例子:它按需生成「动手做」的技术教程——可以是一节,也可以是一整个系列,主题由你一句话定;生成好的教程进本地库,你在浏览器界面里跟着亲手做。它的自我定位很有意思:让 AI 教你,而不是替你想。

跑起来的步骤以仓库 README 的当前说明为准,大致是:Lathe 是一个自包含的单一二进制,装好后放进 $PATH;macOS 推荐用 Homebrew(brew install devenjarvis/tap/lathe),Linux 可以用仓库里的安装脚本或 go install。装好后把 skills(技能,给 AI 的专用指令包)装进项目或用户目录:lathe skills install 装到当前项目的 .claude/skills/,lathe skills install --user 装到 ~/.claude/skills/ 并对所有项目生效;Claude Code、Cursor、Codex 都能用。然后在会话里输一句:

/lathe build 用 Erlang 写一个 3D 切片器

终端里再跑 lathe serve,浏览器打开就能开始学。学的时候想追问、想让 AI 验证教程对不对、想扩展新的一节,Lathe 的 skills 支持这些操作,具体怎么触发看仓库文档。

这个例子值得抄的,是它的验证逻辑——AI 负责把教程流程跑出来,你负责亲手把它做对,这就是人类版的 pass/fail。让 AI 自己跑流程,不等于把验收也交给它;跑得再顺,最终「过没过」这道线,握在你自己手里。

📎 参考来源

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新