AI Pulse
📡 X 信号

新研究证实大模型知识注入也符合缩放法则

有论文指出,向LLM灌输新知识的「知识注入」同样满足缩放律(https://arxiv[.]org/html/2607.19604v1)。

通过微调追加知识存在两个痛点:一是会发生遗忘已有知识的「灾难性遗忘」,二是对未知问题的泛化能力(即OOD,应对训练时未见过模式的能力)很弱。

本论文改用「超网络」(它不是给要注入知识的目标LLM本体生成权重,而是生成LoRA的适配器权重——LoRA是只给模型追加小矩阵做增量学习、节省显存的微调方法),首次系统性验证了这种在完全冻结目标模型的前提下注入知识方法的缩放律。

超网络不使用预训练权重,从随机初始化开始训练,接收事实集合与提问后,生成LoRA的权重(秩为4,缩放系数为8)。

为做验证,研究者构建了新数据集「MegaWikiQA」,它基于知识图谱Wikidata5M(包含约460万个实体、822种关系、超过2200万个事实,知识图谱就是将事实以「主语、关系、宾语」的形式存储的数据库),自动生成必须链式追溯多个事实才能回答的多跳问题。

论文给出的例子是「居里夫人国籍国的首相的出生地是哪里」(答案是博尔德),就是像这样串联多个事实的问题。数据集生成了覆盖最多4跳、39个领域的问题,训练数据总量达到125万条。

实验结果显示,超网络的宽度、深度、目标模型尺寸(阿里巴巴开源的开放模型Qwen2.5,从0.5B到14B共五个规格)、注入的事实数量这四个维度,都确认了符合幂律的缩放——即输入规模越大,输出性能的改善越平滑可预测。

其中,放大目标模型尺寸带来的收益最大。

此外,在对未知实体和换述提问的泛化能力上,超网络始终优于LoRA微调和全微调,并且目标模型越大,这种性能差距越大;但分布内精度本身,微调方法仍有微弱优势。

另一方面,论文也指出了实用层面的问题:在最大配置下,超网络本身的参数会膨胀到约2.5B,已经和目标模型(1.5B)几乎一样大了。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新