Population Evolution 加速大语言模型进化
进化是发生在种群层面的。有益基因会在世代交替中在一个种群中变得普遍,之后传播到其他种群,在它们各自的环境中接受检验。
进化的速度取决于世代时间:细菌只需要20分钟,而大象大约需要25年。用大语言模型进化出更好的模型,通常就像是一个孤立的大象种群。每次搜索都只在一个数据集上独立运行,对于大模型来说,每一代都需要在全量数据上进行一次长时间训练。
我们的新论文《发现,而非设计》介绍了种群进化方法。它有两个目标:发现更好的模型,并且更快地发现它们。
为了发现更好的模型设计,不同搜索之间会共享它们的发现。多个搜索同时运行,每个搜索在各自的数据集上进行。当一个搜索找到一处有用的代码改动时,其他搜索会重新训练这个相同的改动。自然不会记录那些没有帮助的基因,但种群进化方法会。所有同行结果,包括弱的或不成功的迁移,都会被添加到一个共享账本中,大语言模型在进行下一次改动之前会读取这个账本。
为了更快发现模型,搜索不需要在全量数据上训练,因为全量数据训练正是拖慢每一代的原因。我们发现,只要其他搜索先对每个改动进行检验,搜索只需要用到2%到5%的数据就能找到能通过全量训练检验的改动。
在种群进化方法中,一个在某一数据分片有效的改动必须至少在另外两个分片有效,之后还要在两个更大的10%数据集上有效。只有满足这些条件,它才会进入全量训练。
我们在RMD-Bench上测试了种群进化方法,这个基准测试是我们为评估模型发现而推出的。它涵盖5个任务系列(大语言模型预训练、视觉语言模型预训练、强化学习算法发现、排序和观看时间预测),总共有34个实例。每个实例都带有参考实现和固定的训练评估协议,因此在一个数据集或数据规模上找到的改动可以在另一个数据集上重新训练并打分,其他发现方法也可以在相同条件下进行比较。
下文列出的数据是预先展示的两个成本最高的实验系列的结果。大语言模型预训练任务从一个1.85亿参数的Gemma 3风格模型开始,视觉语言模型预训练任务从一个约6.46亿可训练参数的Qwen3.5风格模型开始。
基线方法在相同的总GPU算力下,直接在全量数据上进行同类型搜索。种群进化方法找到了更好的模型:大语言模型预训练的最佳相对准确率提升从0.92%提高到了2.48%;视觉语言模型预训练的最佳损失减少从5.05%提高到了8.78%。
种群进化方法还能更快发现模型:在大语言模型预训练中,每个搜索可以完成100代,而全量数据搜索只能完成14代;在视觉语言模型预训练中,61次全量训练运行中有57次达到了成功阈值,对比全量搜索的100次运行中只有12次达标。
进化之所以有效,是因为多个种群传递有益突变,并完成多代演化,而种群进化方法为大语言模型驱动的模型搜索提供了这些必要条件。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖