AI Pulse
📡 X 信号

研究发现多视角表述让LLM更好获取知识

一项通过细致的对照实验研究大语言模型在预训练过程中如何获取知识的研究发现:比起让模型反复学习同一知识,从不同角度呈现知识——比如采用教科书、Q&A、博客等不同形式——能让LLM更好地获取知识。作者们将这种不同的知识呈现方式称为辅助视角(auxiliary views)。

这些不同的呈现方式不只是换个说法,还改变了说明方法、强调的关系、目标读者、知识整理方式。举例来说,研究论文中以公式和实验为核心说明的知识,在教科书中会从背景开始按顺序讲解,在Q&A中会围绕读者容易困惑的点重新组织内容。

实验中,研究人员从arXiv论文、美国判例、医学病例报告中收集了36份文档,让OLMo-2的1B、7B、13B、32B模型进行追加学习后做了评估,同时也用Qwen 7B做了验证。

基线实验是让模型反复学习原始文档,研究人员对比了两种实验条件:使用9种转述,以及额外加入教科书、博客、Stack Exchange风格Q&A的情况。为了保证不同实验条件下学习数据量不变,研究人员统一了目标知识对应的token量。

凭直觉就能想到,提供不同的说明方式能提升推理性能,但有意思的是,这种方法甚至还改善了事实召回(factual recall)。

实际上,本次评估的问题都来自原始文档中的内容,如果只追求单纯的记忆,反复学习原始文档看起来应该更有利。但实验结果显示,哪怕减少原始文档的重复次数,加入辅助视角也能让模型更容易回忆起原始文档包含的事实。

这说明,概念层面的理解能帮助记忆,把知识以更通用化的形式呈现,也有助于对单个事实的记忆。

研究人员还对转述的效果做了细致分析:小批量大小时,加入转述能抑制同一文档反复学习带来的过拟合;而当批量变大后,转述的收益就变小了。

实际上,在接近全局批量大小为1024的预训练条件下,加入转述几乎不存在优势了。但即便批量变大,加入辅助视角仍然能带来显著的提升。

研究还发现,生成辅助视角并不一定需要使用强的教师模型。生成模型自身的问答性能,和用该模型生成的文档训练出的模型性能,几乎不存在相关性。

因此作者们认为,这个过程与其说是从强教师到弱学生的知识蒸馏,不如说它起到的作用是将给定知识扩展为多种表达的数据增强。

另外,部分实验还显示,不光目标知识,和目标知识一起学习理解所需的前提知识,也能提升性能,但这个结果不像辅助视角的结果那样稳固。

本次研究结果说明,网络自然包含了同一知识或事实的大量辅助视角,这可能是预训练数据之所以有效的原因之一。

越是重要的知识,越不光只出现在原典中,还会被教科书、解读文章、博客、Q&A、讨论等各种形式反复讲解。因此,知识层面重复的数据不一定就该被丢弃,从不同角度呈现同一知识这件事本身,就可能具备学习价值。

评论:
哪怕是相同的事实和知识,用不同的表达方式反复学习更容易记住,这和人们对人类学习的实际感受是吻合的。

从不同语境学习同一知识,能让知识泛化为更抽象的基础知识,或是形成多条访问同一知识的回忆路径,也可能两者同时发生,这些都可以解释本次实验结果。

研究人员希望未来通过包括大规模实验在内的追加实验把问题弄清楚,虽然论文已经做了参数变化的分析,但目前还没有到能从机制上解释这个现象为什么会发生的阶段。用更简单的模型复现这个现象,尝试做理论解析,是接下来想要探索的主题。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新