哈佛新研究找到生成模型第三个缩放维度
哈佛大学一篇最新论文显示,生成模型可能缺失了第三个扩展轴:它们在训练过程中的探索量。
如果生成模型的下一个扩展轴不是更大的模型或更多数据,而是每个训练步骤生成更多候选,结果会怎样?
将探索加入强大的表征自动编码器(Representation Autoencoder, RAE)图像生成方案后,模型仅用基线处理训练样本量的 1/6.2,以及 1/4.1 的 FLOPs,就达到了基线的最终性能。
本文将最优 K 训练(best-of-K training)视作更宏大的概念:一种无需增加推理步骤,就能扩展生成模型可学习模态数量的方法。
如今,扩散模型、流模型和自回归模型处理多模态目标,大多是通过将生成拆分为多个更简单的步骤,这也会导致它们的训练方式和采样方式之间出现不匹配。
探索式建模(Explorative Modeling)反而将这一负担转移到了训练阶段。在每次更新时,模型尝试 K 个候选生成,仅从离目标最近的候选中学习,让不同的潜变量专精于不同的模态,而非被拉向平均值。
如果这种扩展趋势在更大规模的实验中成立,那么计算最优的生成训练可能需要在分配算力时,同时兼顾参数、数据和探索。
论文链接:arxiv.org/abs/2607.27372,标题:"Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation"
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖