不再手写代码的工程师,给这套做法打分的也是他们自己
TL;DR:Cognition 表示,他们的工程师已没人再手写代码了。而判定这种做法有效的人,也正是他们自己。
Silas Alberti 说这话时不像是在警告——他只是在交谈中顺口一提,就像随口说起路况。
Cognition 没有一位全职工程师再手写代码。每人跑着 6 个 agent,工单落到 Linear,它会启动一个开发环境,一次性给出方案,最后有人审一下 PR。
那一次审阅就是全部安全网。
而唯一宣称这张网还兜得住的基准,来自 Cognition 自己。对于那些花了好多年靠又快又干净地写代码才挣到“资深”头衔的人来说,真正扎心的不是工作方式变了,而是:拿这份薪水取决于这套办法能不能成的人,恰恰也是给这套办法打分的人。
CodeRabbit 审查了 470 个真实 pull request,发现 AI 写的 PR 中问题数量大约是纯人工 PR 的 1.7 倍——而且这个差距在高端场景不但没有缩小,反而扩大,恰好就是同时跑 6 个 agent 的那类场景。Northflank 自己的企业数据则显示,88% 的 agent 试点项目从未走到生产环境,原因不是模型写出的代码差,而是因为在放开 agent 之前,根本没有人先搭好审计追踪。
上周 Anthropic 也对自己玩了同样的自我评分:Claude 现在“主导”了 Anthropic 自家 26% 的研发工作,评分量表——从 AL0 到 AL5——是 Anthropic 自己写的。下一次评审周期,如果有人扔给你一句“AI 杠杆效应”却不附带任何定义,先问问评分标准是谁定的。
其实已经有人在补这个缺失的检查环节——CodeRabbit 刚刚以 15 亿美元估值融了 1.43 亿美元,专门用来大规模评审 AI 写的 pull request。但它装不进单个工程师自己的口袋里。它是卖给企业采购流程的,而不是为真正在跑 agent 的那个人做的。
那个边缘缝隙还空着,没人去占。
其实它已经有雏形了——就是 CodeRabbit 卖给整个组织的那套决策轨迹纪律,只是要做得足够小、足够开放,让一个工程师能直接把它对准自己的 agent,不用先征求任何人的许可。
谁能把这个做出来,不是在跟谁赛跑。先入局者已经证明了这个市场真实存在。他们只是在做先入局者从来不需要做的那一版。
看别人给自己批改作业,这对我来说并不新鲜。我以前就见过一模一样的姿态——只不过对象不是代码,而是土地。
我曾为马来西亚最大的房地产开发商之一工作。2018 年,我被派驻在吉打州的兰卡威岛。
海岛度假村、高层服务式公寓、酒店、别墅、商业集群等项目都在规划中。
我的大老板 DT 时不时会乘坐私人飞机飞来,寻找当地的机会。是的,兰卡威就是他的私人沙盘。
我们会开着他的丰田 Vellfire,载着他和随行保镖,绕着岛跑,穿过当地村庄,与村民交谈,试图买下他们的土地用于开发。
他信赖的“智囊团”会陪在身边,听候他的调遣,判断某块地适合做什么类型的开发——是建精品酒店、公寓还是别的什么,以及是否有利可图。
几轮这样的狩猎之旅后,我注意到一件事。他并不是为了自己开发而买地。
不不,哦不,他绝对不想弄脏自己的手。我和他一起坐在 Vellfire 里,偷听他同智囊团的对话。
他在寻找交易,如果发现一桩划算的买卖,他会把提案——连同已经获批的开发许可(通过兰卡威市政厅)——打包卖给其他有兴趣的房地产开发商。
换句话说,他扮演的是中间人。而我们只是在那里做辅助——监督并把“脏活”移交给别人,同时把利润空间装进自己口袋。
他为什么会这么做?这个嘛……那是另一个话题了。
我为什么提起这件事?因为现在这些 AI agent 也是同样的道理。如果我们能把写代码的“脏活”甩给它们,最后只检查一下成果——那何乐而不为呢?
____________________________
这些片段到最后都会把没说出口的话挑明——手艺从来不是护城河。手艺底下的那份判断力才是。
其实,这让我想起一件事——Andrej Karpathy 在 7 月份对 Stephanie Zhan 说过几乎同样的话:稀缺的技能不再是写,而是有品位的指挥,连他自己都说,从来没有像现在这样觉得自己落后。
如果给新系统打分的人,就是卖这套系统的人,那到底什么样的证据才能真正改变你的看法?说说你的观点。