Claude Code effort旋钮 原来不是智商档位
Thariq这篇关于Claude Code effort旋钮的文章,看完直接把我之前的用法全推翻了,简直就是大师级Claude调参课, 我敢说绝大多数人都理解错了。effort旋钮不是模型智商档位, 是你允许它加班多久。同一台模型,同一套知识。
拧低,它尽快给你一个能用的版本,把你留在循环里一起改。拧高,它会自己多做验证,多挖边角案例,多自己做判断,少等你点头。那个类比特别准, 别人给你1小时,你先交一个能交差的版本,心里已经准备好下一轮改。
别人给你12小时,你会默认他们要成品,自己去补测试,补边界,补你觉得该有但没写清的东西。effort就是在跟Claude说这句话。新模型工程上最牛的一点, 调effort不会把prompt cache打爆,上下文还能复用。
同一段对话里,你可以先低档写,再高档验。不必重开会话,不必把前面几万token再付一遍。会话中途打/effort就能切。
没有这个旋钮会怎样呢?模型要么永远快但漏坑,要么永远慢且爱自作主张。现在把速度和验得有多狠,从模型智商里拆出来,交给你控。
注意,effort控的是投入,不是知识上限。模型选的是能力档,effort选的是这档能力愿意花多少力气。它实际改的,就是三件事: 验证做多少。
低档写完测一两个例子就停。高档对参考实现,跑官方测试套,自己写随机fuzzer。边角案例挖多深。
安全,硬件,老代码修bug,坑都藏在你没想到的那条路径里。高effort主要就是在打这些坑。自己替你做多少决定。
需求含糊时,低档给你一个简陋起点等你改。高档会自己补功能,自己定交互,自己简化设计。所以高档不一定更听话,有时是更自作主张。
还有那条失败分界线很重要。漏边角的问题,加effort能明显减少。路子就走错了的,加effort基本救不回来。
方向错了,加班也只是把错的方案打磨得更精致。需求写错,架构选错,别指望把旋钮拧到max就自动纠正。三个实验,是全文最有教学价值的部分。
他拿同一类任务,按你给它多少规格,做了三组对照。第一组,需求很糊,就说做个健身打卡App。low一分半,一个日志加一张简单图。
medium四分钟,功能多一点细节多一点。high十一分钟,更完整。max六十七分钟,复杂到带热力图。
同一句话,低档给你草稿,max给你它心目中的成品。如果你要的是迭代起点,低档完胜。如果你要一次出片不想盯着,才上max。
第二组,需求中等,让它重做Claude Code的/config菜单。每个档次想的方向差不多,子菜单加更好的搜索。差别在完成度。
low一分钟,交互草图,意思到了,看起来不像正品。max二十八分钟,很像真的Claude Code,还附带各种流程走查。作者自己的偏好特别反直觉。
这种我想看看它怎么想的活,他更爱低档。因为一分钟就能看到方向,再给反馈。二十八分钟出的精致稿,你可能只想改一个结构,前面那些打磨全废了。
第三组,需求很清楚。先让它采访你,再按规格实现。档次一拉高,产品长得开始像了,实现也接近。
max甚至会回头简化一些细节,而不是继续堆功能。时间从low十六分钟,到max七十九分钟。结论很清楚。
规格写清楚之后,effort主要买的是打磨和验收,不是另一个产品。需求越糊,effort越像产品经理。需求越清,effort越像QA。
玩具任务看不出差距,去看会挂掉的题。作者承认上面都是Claude本来就会的活。真正拉开差距的,是Terminal Bench 3.0那种社区难题。
硬件,安全,ML,科学形式化证明,运营流程。这些比日常写业务代码难一个数量级。Fable 5.1内部评测,每档大约370次尝试。
low过140题,中位约7.3万token。max过214题,中位约22.2万token。按领域看,低档到高档提升最猛的。
安全从64%到87%。硬件从34%到75%。ML从54%到73%。
科学从41%到61%。软件媒体运营也涨,但没那么夸张。规则手册式按流程填的活,effort提升很小。
因为瓶颈不在验得够不够,在第一步就理解错了。四个真人案例,把抽象分数还原成行为。你就知道高档到底在加班干什么。
第一个,HTML消毒器,防各种把JS塞进页面的方式。low约2分钟,一遍写完,拿手写的一页测一下。xhigh约33分钟。
先对自己初稿做对抗审查,去读已安装解析器源码找洞。跑干净用例确认不该改的别改,再跑标准XSS套件。最后写随机文档fuzzer。
安全这种你漏一种走私方式就全盘翻车的题,多花token是划算的。第二个,存储引擎修bug,修崩溃,还不能把压缩搞坏。low约1分钟,��复现就改,也不确认新测试能不能抓住原bug。
xhigh约11分钟。先复现崩溃,对着永不压缩的参考实现写随机测试。再检查半成品修复会不会被测试打掉。
第三个,命令行线性规划求解器。low一遍写完,几个小例子过了就停,自己还提醒大题可能慢,但没去验证。0/5。
high对着暴力求解器测随机题,再给大题计时。撞上超时崩溃后重做搜索策略。第四个,蛋白质组学的基因集富集分析。
low选一种看起来合理的数据预处理,跑一次,交差。0/5。high试两种预处理,发现显著处理列表变了,追原因,再选对的那种。