Blender AI建模盲测1200次,排名全凭网友投票
玩法是这样的:两个 AI agent 各自用 Blender 建模。你看到两个结果,但不知道分别是哪个 agent 建的。投票,选你觉得更好的那个。排名就靠这些投票堆出来。
开发者一共跑了超过 1200 次建模,跨多个 LLM 和 agent 工具链。网站叫 render-arena.izolight.xyz。
每个 agent 会收到一段提示词,里面写明环境、规则,外加一句简短的话说清要建什么。项目灵感来自 minebench.ai,初始提示词也借用了那套。
作者想验证的是:不同模型之间,会不会出现类似的进展。他还觉得,市面上的竞技场大多只比模型本身,没怎么比 agent 外面那层工具链(harness)。
他跑过的工具包括 pi、opencode、omp、codex、Claude Code 和 dsh。他还对比了两种 agent:直接往 Blender 里写脚本的,和带 MCP 的。推理级别分了多档,目标是找出成本和时间的甜点。
1200 多次听着不少,但作者说并没有覆盖每个提示词和每种组合——那样成本太高。所以网站开放了提交入口,谁跑出结果都可以补上去。
他刚加了第二种模式:agent 拿到一张参考图,照着它尽可能准确地建模。文本和图像两种模式在侧边栏切换。图像模式目前只有一张图、几次运行,之后会慢慢增长。
投票是让排名有意义的前提,花几分钟投票就帮助很大。方法上的反馈,作者也欢迎。
评论区最高赞问的是:作者到底用了哪个 Blender 技能或插件。这个答案,帖子里还没有出现。