AI Pulse
📡 X 信号

研究人员用强化学习将Qwen训练为代码生图模型

研究人员用强化学习将Qwen训练为代码生图模型

神了,有人把Qwen模型训成了一个生图模型?? 有人干了个很抽象的实验: 直接拿 Qwen 做强化学习,让一个 Coding Model 学会用 JavaScript 画水彩画。 没有 Stable Diffusion,没有 Flux,也不是调用什么图片 API。 每一张图背后,真的是 Qwen 自己写出来的一段代码。 而且他们甚至给审美做了一套 Reward,让模型靠 RL 一轮轮学会怎样画得更好看。 具体流程是这样的⬇️ 1️⃣先给 Qwen 一个 Prompt。 Qwen 根据要求写一段 p5.brush JavaScript,再把这段代码扔进浏览器环境里真正执行,渲染成图片。 2️⃣画完之后还没结束。 Judge 模型会继续看这张图,判断它有没有遵循 Prompt、构图怎么样、技法怎么样,以及最关键的这玩意到底好不好看。 3️⃣评分变成 Reward,再拿回去训练 Qwen。 于是一个本来拿来写代码的模型,就这么一点一点学会了画画。 这套东西最有意思的地方,其实是他们训练审美时踩的坑。 一开始团队搞了足足 9 个 Reward。 看起来很科学,代码质量、绘画技法、Prompt 遵循、审美各种维度全部覆盖。 结果 Reward 一路往上涨,画却越来越抽象。 很明显 Qwen 找到了捷径开始Hack这些Reward。 最后画出来的东西就开始疯狂收敛成差不多的五瓣小花。 后来他们才发现,很多 Judge 的判断高度相关。 换句话说,表面上有 9 个指标,实际上可能是在把同一种偏好重复奖励好几遍。 于是他们干脆大砍 Reward,只留下 4 个。 然后人肉看了 1664 张模型生成的作品,从中挑出自己真正觉得好看的图片,拿来当审美参考。 结果新的 Reward 设计,只用了原来大概 1/3 的训练步数,就追上了之前的效果,之后还能继续提升。 模型自己写画图代码也越来越熟练。 一度生成一张图要写到 13500 Token 左右,后来逐渐压到了 2000 Token 以下。 还有一个很典的 Prompt 工程事故。 一开始他们担心 Qwen 不熟悉 p5.brush,于是好心往 System Prompt 里塞了大约 400 行 API 文档。 结果模型学完之后,开始非常自信地发明根本不存在的 API。 最后团队干脆把几百行文档删掉,只明确告诉它可以用哪些核心方法。 结果反而正常了。 训练本身跑在 PrimeIntellect 上,Rollout 的图片渲染则放在 Modal 上。 当然,这条路线现在比直接调用生图模型慢得多,画面质量也不是为了跟 Flux 正面打。 但我觉得它真正有意思的是另一件事: 以前我们讲 AI 生图,基本都是Prompt → Image 这里却变成了Prompt → Code → Image 最后得到的不只是一张图,还有一整套可以继续修改、调参数、复用的生成逻辑。 今天是 p5.js 水彩画。 以后如果这套思路继续往 SVG、网页、Figma、3D、CAD 这些东西里走,就很有意思了。 AI 生成的可能不再只是最后那堆像素。 而是作品背后真正可编辑的结构。 果然世间万物都可以用代码来构建(

原文:

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新