照着大语言模型思路,做出来新的图像视频生成模型
你是否对前沿实验室如何预训练图像/视频生成模型感兴趣?我们也感兴趣。
由于这些训练方案很少完全公开,我们从开源领域最成熟的预训练方法论出发:也就是现代大语言模型的构建方式。
今天我们介绍 Chimera:一个视觉生成模型家族,它将 LLM 风格的混合线性注意力与缩放协同设计引入了视觉生成领域。
在大规模预训练中,几乎所有设计选择最终都会体现出效果。这意味着要将架构设计和缩放作为一个耦合问题来解决:每一个架构选择都会改变模型的缩放方式,而缩放行为决定了哪些选择最终能留存下来。
Chimera 联合处理这两个问题,构建了一个在模型大小、计算预算和数据分布发生变化时,依然保持可预测性的模型家族。
我们的核心架构观察来自一个简单的分工:单一光栅顺序的 KDA 流承载长程状态,而模态感知的短卷积保留原生局部几何结构。
它们共同为多维视觉数据构成了一个有效且优雅的线性注意力骨干,周期性 MLA 提供直接全局交互,稀疏 MoE 在控制激活计算的前提下扩展容量。
这个设计带来了一个实用的效果:NoPE。
在 Chimera 中,位置由计算过程本身表示。KDA 的有序循环和学习到的状态衰减编码了顺序和近因,而短卷积编码了局部时空结构。我们的设计不需要显式位置嵌入。
由于这些机制不绑定固定的训练网格或序列长度,Chimera 在空间和时间上都表现出强大的零样本外推能力。
仅在 1K 图像和 5 秒视频上训练后,它就能直接生成连贯的 4K 图像,没有可见的明显质量下降,也能生成 30 秒视频,最后五秒的 FID 仅下降 6.5%,所有这些都是零样本完成,不需要针对分辨率或长度做微调。
但仅有架构还不算一套预训练方案,除非它能可预测地缩放。因此,缩放不应该被当作事后补充:对不同模型大小拟合曲线很容易,让这条曲线有意义却难得多。
如果每个尺寸的模型调优程度都不一致,你的缩放定律可能只是在测量优化误差。
我们提出 HeteroP,按模块逐模块跨宽度和深度迁移代理调优得到的超参数,让我们得到了始终调优一致的模型家族。
这让我们可以基于激活模型大小、训练 token 数和图像-视频数据混合比例拟合 Chinchilla 风格的定律。
这些定律不仅为计算最优的模型和数据大小提供了参考,还表明视觉生成可能比我们通常假设的更需求更大模型。
在 Chinchilla 使用的相同参数损失拟合方法下,图像的计算最优模型大小随 FLOPs^0.516 增长,而语言是 FLOPs^0.46。
视频对模型的需求甚至更高,指数从图像的 0.516 上升到了 0.544(原文此处截断)
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖