AI Pulse

我和 Kimi K3 造了一座会动的3D机械博物馆,聊聊带 AI 干活的几条规矩!

我和 Kimi K3 造了一座会动的3D机械博物馆,聊聊带 AI 干活的几条规矩!

我和 Kimi K3 造了一座会动的3D机械博物馆,聊聊带 AI 干活的几条规矩!
最近一阵子,Kimi K3 发布很火,我也搞了一些Demo 在 x 上也是爆火,并且也还得到Kimi 联创转发我的Demo Show ,累计也有100w+曝光。
我用它造了一座会动的 3D 机械博物馆:14 台机器,全是活的,能转、能炸、能拆、能装。
没有任何一个模型是从网上下载的,全是代码一行行画出来的几何,整个站零外部资源,一个文件夹丢服务器就能跑。
这么大一摊活,是我一个人带着 Kimi K3 做出来的。
申明:文章内容主要是 Kimi K3 自述完成。
先给你看个东西。
打开浏览器,一台四冲程发动机立在玻璃缸套里。活塞按 1-3-4-2 的点火顺序上下窜,进排气门跟着凸轮轴一开一合。你按一下键,它当场炸开,每个零件飘在半空,标注引线指着告诉你:这是连杆,那是曲轴。你再拖一拖,它又装回去了。
旁边还有火箭发动机、机械手表、六轴机械臂、会打军体拳还会跳舞的人形机器人。一共 14 台。
还有一件事,比这些更让我意外。
前阵子,有人往 「造物台」 页面传了几张索尼 Walkman 的老照片,说想要一台能拆开的。几个小时后,展厅里多了一台 Walkman:磁带仓能弹开,皮带和主导轴各自转各自的,每个零件带标注,能爆炸、能讲解、能亲手装回去。
从头到尾,没有任何一个人类碰过这台机器。看图、写代码、验收、上架,全是 K3 一手包办。
它是怎么做到的?先卖个关子,你带着这个问题往下看。
为什么会有这座 3D 机械博物馆?
初衷特别简单,就是一次「眼馋」。
我很早就迷 JigSpace:它把复杂的产品和原理,做成一步步可交互的 3D 演示,也有人管它叫「3D 版的 PPT」。但玩得越多,越觉得有两点不过瘾。
一是模型基本靠 CAD 导入,普通人手里没有 CAD 文件就玩不转。二是它的「运转」是提前烘焙好的动画,你看的是录好的动作,不是真的在动。
烘焙动画和实时运动学的区别:烘焙动画像放录像,每个零件怎么动是提前录死的,你只能看它演。实时运动学是每一帧现场算,曲轴转一度,活塞、连杆、气门该在哪,全部由机械关系现推出来。前者你只能看,后者你可以拧着它玩。
我就一直想,能不能做一个纯代码的版本:所有几何用代码一行行生成,所有运动是实时求解的运动学,整个站零外部资源。
这个想法在我心里搁了很久,缺的是一个能扛得住这种工程量的搭档。K3 发布之后,我把这个想法丢给了它,先拿四冲程发动机开刀。
后面的事你们在 Twitter 上都看到了。demo 视频一条条发出去,反响好到超出我的预期,后台和私信里全是问「这是怎么做的」的朋友。问的人多了,就有了这篇复盘。
坦率讲,这篇不是来炫成果的。这几个月带 AI 干活踩过的坑、摸出来的规矩,我毫无保留地掏给你。在这个人人都在用 AI 写代码的当口,怎么跟 AI 配合,比 AI 本身多强重要得多。
原则一、先让 AI 的活,变成机器能验证的东西。
这话听着绕,举个例子就懂了。3D-Lab 里有一集差速器,就是汽车转弯时让内外轮转不同速的那个东西。
最偷懒的做法,是直接告诉每个齿轮转多快,看起来对就行。我们没这么干:每个齿轮转多快,一个都没写死,全是一条纯滚动约束方程推出来的。
直线行驶时,方程算出行星轮自转恒等于 0,你不用管它,它自己就该是 0。转弯了,非零自转自然冒出来,一侧打滑,另一侧也跟着没劲。差速器那个又坑又真实的特性,不是我演出来的,是方程自己推出来的。
你可能纳闷,这跟带 AI 干活有啥关系?关系大了。
因为当一个东西由确定的数学结构推出来,它就可以被机器验证:直线行驶行星轮该不该是 0,写一行断言测一下就知道。我们全站定了个 铁律:禁止用裸的 Math.random,所有看似随机的散落位置,要么显式写死,要么用零件 id 做哈希。所以同一个页面加载两次,画面逐字节一模一样。
画面能复现,我就能让程序自己截图、自己跟上一版比对,哪个像素变了立刻报警。AI 半夜改了一版,第二天机器先帮我扫一遍。
K3 的能力:能把约束方程这种硬结构吃进代码,写得又准又能跑。
人的智慧:让对错有客观标准,把系统改造成一个能自动判卷的系统。
结合点:让 AI 干得放心,靠的不是它多聪明,而是你先给了它一套能判卷的卷子。
原则二、给 AI 一个能自己开图验证的遥控器
上面说机器能自动截图判卷,那 AI 怎么知道该截哪张图?
我们给全站定了一套统一的 钩子协议。每台机器的网址后面都能挂参数:snap=1 让它截图,mode 切运转还是爆炸,step 走到讲解第几步,theta 转到哪个角度。全站 14 台机器,一套参数走天下。
Kimi K3 改完机械臂的代码,不用等我来点鼠标验收。它自己拼一个网址:snap=1、mode=抓取,把机械臂开到抓取那一帧,啪,截个图回来自己看对不对。
它成了一个能自己开图、自己检查、自己发现问题的东西,而不是一个写完代码就等着被判死刑的工具。
K3 的能力:有自主迭代的闭环,能自己看结果、自己回头改。
人的智慧:给它装上眼睛,给它一个能自己看到结果的通道。
结合点:让它闭环,别让它盲写。它能自己看到,它就能自己迭代。
原则三、委派一件活,质量的天花板等于你规格写得多细。
这次做机械臂和人形机器人这些大工程,我用了主子 agent 分工:我负责理解需求、定方案、验收,具体一整集的活派给子 agent 去做。五次委派,一次通过率 100%。
我知道你想问什么:是不是 K3 特别牛所以百发百中?不全是。真正的秘诀,是我给每次委派都配了一份简报,我叫它 简报六件套:上下文锚点、约束清单、精确到数字的规格、验证清单、汇报格式、取舍授权。
我摸出来一条特别硬的规律:委派质量的上限,等于你规格的精确度。
你写「帮我做个机械臂,能抓东西就行」,它交回来的东西一定含糊,因为它在猜。你写「后空翻要绕质心轴翻转,位置补偿是 y 加上 h 乘以 1 减 cos θ」,它几乎不可能做错,因为你已经把正确答案的结构写进去了。
这个道理反过来也扎心。很多人抱怨 AI 干活不靠谱,其实是自己根本没想清楚要什么。AI 只是把你脑子里的含糊,忠实地放大成了代码里的一坨乱麻。
K3 的能力:在精确到数字的规格下,几乎不可能做错,能扛住整集的工程。
人的智慧:负责想清楚,把规格写到精确,写到它没法猜。
结合点:人负责想清楚,AI 负责变成真的。这个分工,我越做越信。
原则四、逻辑对 ≠ 画面对 ≠ 用户用着对
前面说得挺顺,好像带 AI 干活很爽。现在说点疼的。
这三个月我返工了三次,三次全是同一个魔鬼。最典型的是 3D 打印机那集:它要一格一格打印出一只 634 格的体素霸王龙,逻辑核心是一个 G-code 解释器,构造上就保证正确。我测过,逻辑全对,断言全绿。
结果用户反馈:空打。喷嘴老老实实走,一格料都没出来。
所有仪表盘都告诉我一切正常,可现实就是不正常。后来上活体实验一步步逼,终于逮到真凶:three.js 的视锥剔除。那 634 个体素用 InstancedMesh 批量渲染,判断在不在屏幕里用的是包围球,一颗只有 3.3 毫米的小球。相机稍微一偏,小球出了画面,整组体素被连坐剔除。
解药是两行代码,把 frustumCulled 关掉。两行。但这个坑给我上的课,值一万行。
三次返工摆一起看:字标做成空白牌子、军体拳一拳打穿旁边的箱子、还有这个空打。没有一个是断言能抓住的。因为断言验证的,永远只是你想到要测的那个性质;而用户,验证的是所有性质。
所以这次最重要的流程遗产,是 三层验收:状态断言(机器测逻辑)、截图目检(我肉眼看画面)、真实路径复现(完全按用户的操作走一遍)。少一层,魔鬼就从那个缝里钻出来。
K3 的能力:最擅长把逻辑写得自洽得滴水不漏,然后在你看不见的那一层悄悄出错。它不是骗你,是骗过了它自己。
人的智慧:承认断言有盲区,坚持三层验收。
结合点:能戳穿这层自我欺骗的,目前还只有一样东西——人的眼睛,去真实地看一眼。
五、这几条规矩,后来有了「造物台」。
前面这四条规矩——判卷、遥控器、规格、三层验收,本来都是我跟 K3 之间的协作纪律。做到后来我突然意识到:既然这些规矩全是死的、全可以写成流程,那这个循环中间,为什么还需要我?
这就是 造物台 的由来,也是开头那台 Walkman 的由来。
它的用法简单到有点过分:打开页面,用大白话描述你想要的东西,可以一句话,也可以附上最多四张照片。然后你去喝杯咖啡,回来的时候,展厅里多了一台能转、能拆、能讲解、能装回去的机器。
听上去很像 Meshy、Tripo 那种图生 3D 服务,传张图进去吐个模型文件。但造物台走的路子完全不同:它不给你一坨网格,而是让 K3 像一个真正的开发者那样,直接写 Three.js 代码。
代码建模和网格生成的区别:网格生成像 3D 打印一个雕塑,形状对就行,里面是一整块死料。代码建模像真的去造这台东西——先想清楚它由哪些零件组成、每个零件怎么动,再用代码把零件一个个造出来。前者给你一张照片级的相似,后者给你一台活的机器。
这是 K3 的多模态能力第一次在项目里挑大梁,它得真的看懂那几张照片。它看图的方式也很守规矩:先交出一份细节清单,什么类别、复杂度多高、哪些细节是身份标志。Walkman 的磁带仓、SU7 的溜背线条、GBA SP 的翻盖铰链,必须逐条列出来,达不到复杂度门槛,不许动工。
像不像一个靠谱的老师傅接单?
先拿张纸把图纸画出来给你确认,确认完了才开工。能看图不稀奇,看完图能把看到的变成结构化规格,再由规格长出代码,这才是完整的链路。
验收也长成了 四层终审,从头到尾没有人类参与:静态一致性、运行时行为、视觉评审,还有最狠的一层——把你的原始照片和成品放在一起对照打分。考不过,东西进不了展厅。
至于规格,简报六件套在这里走到了极限形态——一份叫 Manifest 的协议:JSON 格式的合同,定义了一件合格展品该有什么。K3 不需要猜我想要什么,合同上每一条都写着,它照着交付,系统照着验收,合上就过,合不上就退回。
这就像乐高积木的凸点接口。标准定死了,谁生产的积木都能咔哒一声拼上去。所以 AI 生成的东西五花八门,却能直接继承我 14 台手工剧集攒下的全部家底。
K3 的能力:多模态看图、直接写工程代码、在长任务里记住合同上的每一条。
人的智慧:把协作纪律写成死流程,把规格写成机器可校验的合同,再配一个真会按合同打分的考官。
结合点:把聪明留给创造,把靠谱留给流程。这就是人机协作的终极形态——人的品味定义标准,K3 的能力负责交付。
目前展厅里已经躺着 15 件 这样的展品了:小米 SU7、索尼 A7R、Walkman、Macintosh、iMac、GBA SP、拍立得、立式空调、直升机、银行家台灯。每一件,都是某个人一两句话加几张图换来的。
让AI和机制自己说话
聊到这你可能觉得,这篇一直在讲工程、讲流程,挺硬核。但我最想说的,其实是这整座博物馆真正的灵魂。
回到最开始那台差速器:它的差速不是转出来的,是约束方程推出来的。打印机那只恐龙,不是渐渐显形的,是解释器一格一格铺出来的。人形机器人跳舞,动作和音乐不是谁配合谁,它们是同一个节拍时钟喂出来的两路输出,用 112 BPM 的同一个函数,所以永远不可能脱拍。
这些东西有一个共同的固执:它们都拒绝表演,坚持让机制自己说话。
而这个固执,如今原封不动地长在造物台的产出里。AI 造的风扇,摇头是真有个摇头机构在摆;AI 造的相机,拆开来是真有快门帘和反光板。
它不是生成一个「看起来像风扇」的形状糊弄事,它是真的去理解构造,然后把这个构造用代码重新发明一遍。
AI 可以帮你把差速器做得看起来会差速,那太容易了,给几个角度插值一下就行,观众根本看不出来。但要不要坚持让它由真实的约束方程推出来?这份较真,这份对理解的固执,是我这个人的选择,不是 AI 的。
好的设计,是让东西自己解释自己,而不是贴一堆说明书。好的教学,是让原理自己长出来给你看。我负责提出这份较真,Kimi K3 负责把这份固执变成一条能跑的约束方程、一个逐格求值的解释器、一个同源的节拍时钟。人出品味,AI 出系统。
写在最后
一路走下来,我也算看清了 K3 真正的能力长在哪:大家聊模型,总爱聊它答题多聪明、写文多流畅。
但造物台这种活,考验的是另一组东西——看图看到多细、能不能扛住一千多行的工程、在一个多小时的连续任务里记不记得合同上每一条、出了问题愿不愿意老老实实截图、对照、回头修。
这些能力不在任何榜单的标题上。但它们才是真正把 AI 从聊天搭子变成生产力的那部分。
所以如果你也想带着 AI 干一件稍微大点的活,我把这几条再给你捋一遍:
让你的系统能自动判卷,别靠肉眼
给 AI 一个能自己开图验证的遥控器,别让它盲写
委派前先把规格写到精确,因为那是质量的天花板,写到头它会成为一份合同
验收一定要三层:逻辑对不等于画面对,画面对不等于用户用着对
最后,也是最重要的:那份对真实的固执、对理解的较真,你自己留着,别外包
这几条我自己也还在补课,肯定有不周全的地方。但我是真心觉得,AI 时代最值钱的能力,不是会不会用 AI,是你心里有没有一个不肯将就的标准,然后有没有本事把这个标准变成 AI 能听懂、能执行、能被验证的东西。

阅读原文
📚 相关主题 工程开发

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新