AI Pulse
📡 X 信号

DiffusionOPSD 优化扩散模型训练效率最高提44%

DiffusionOPSD 优化扩散模型训练效率最高提44%

🤔 强化学习能不能教会扩散模型每一个去噪步骤该如何改进,而不是只给最终生成的图像奖励?

DiffusionOPSD: 扩散模型中的同策略自蒸馏(On-Policy Self-Distillation)

*项目主页:* *论文:* *GitHub:*

现有的扩散强化学习方法只优化图像层面的奖励,但扩散模型是通过数百次中间去噪预测来生成图像的。这就造成了一个根本性的监督缺口:终点奖励要如何有效引导中间去噪步骤?

在DiffusionOPSD中,我们提出了同策略自蒸馏(OPSD),这是一种全新的扩散后训练范式,可以把图像层面的奖励 Guidance 转化为显式的中间监督。

奖励引导的目标会在采样得到的去噪查询上构建,并且会随着策略迭代持续刷新。更重要的是,我们证明目标构建和有限优化本质上是两个不同的问题——奖励提升更高的目标不一定能带来更好的优化更新。这为扩散强化学习提出了一条全新的评估原则。

在SD3.5-M和Z-Image-Turbo上的测试显示,DiffusionOPSD在19/20个奖励匹配设置中取得了最佳的留出集性能,比最强基线提升最高达44%,并且相比DiffusionNFT将训练GPU小时数减少了40-63%。

我们希望这项工作能为让扩散后训练同时变得更有效、更可解释提供新视角。非常欢迎大家反馈和讨论!

#ByteDanceSeed #DiffusionModels #ReinforcementLearning #OnPolicy #OPD #OPSD #GenerativeAI

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新