AI Pulse
📡 X 信号

大语言模型微调经验分享:12个核心微调技术整理

大语言模型微调经验分享:12个核心微调技术整理

我微调大语言模型已经超过两年了!如果要重新学习微调,我会先掌握以下这12项顶级技术。收藏这条推文吧。

1. LoRA → 冻结基础权重,只训练两个低秩矩阵作为更新,微调时需要训练的参数量能减少约95-99%。

2. QLoRA → 在4位量化基础模型之上应用LoRA。

3. Prefix tuning → 在每一层的键和值之前添加可训练向量,基础权重保持冻结。

4. Adapter tuning → 在Transformer层之间插入小型可训练模块。

5. Instruction tuning → 在(指令,响应)数据对上进行监督微调,让模型能够遵循指令,而不只是续写文本。

6. P-tuning → 通过小型编码器优化连续提示嵌入,主要用于离散提示不稳定的NLU任务。

7. BitFit → 只训练偏置项,仅占总参数量的约0.08%,在中小数据集上的效果依然能媲美全量微调。

8. RLHF/RLAIF → RLHF基于人类偏好排序训练奖励模型,再用PPO算法针对该奖励模型优化。这是初代ChatGPT背后的训练流程。RLAIF用大语言模型判断替代人工标注,就能以远低于RLHF的成本达到同等质量。

9. DPO(Direct Preference Optimization)→ 跳过奖励模型,直接用分类风格损失对偏好对进行优化,比PPO更简单。

10. GRPO(Group Relative Policy Optimization)→ 对每个提示采样一组响应,在组内对奖励做归一化。DeepSeek R1就是用它训练的。

11. RLVR(Reinforcement Learning with Verifiable Rewards)→ 用能返回可验证分数的检查器或编译器替代学习得到的奖励模型。这是R1数学和代码能力背后的免费信号。

12. 联邦微调 → 在去中心化客户端上进行微调,客户端只共享权重更新,从不共享原始数据。适用于数据不能离开设备的场景。

GRPO要求每个响应对应恰好一个标量奖励。RLVR对数学和代码任务来说,可以把答案送入检查器或编译器就能免费得到这个奖励。但对于RAG回答、客服回复、摘要这类任务,没有可以对照的金标准标签。

通常的退路是手写奖励函数,对忠实度、幻觉、完整性打分。但校准它需要好几天,权重偏移时它会奖励错误行为,而且只要你添加工具或修改系统提示,它就会失效。

由OpenPipe的ART(开源项目)实现的RULER解决了这个问题。训练过程中,它会把N个采样轨迹送入裁判大语言模型,由裁判结合智能体的系统提示对它们做相对排序,返回分数。相对排名比绝对打分更稳定,而GRPO本来就要在组内做归一化,因此这些排名可以像RLVR那样直接接入流程。

GitHub仓库链接在此:(别忘了点星⭐)

我最近写了一篇完整拆解,详细介绍它的工作原理,包含训练循环和代码。往下阅读即可。

如果你是新手,我建议你先不要碰权重,先把提示本身微调好。像GEPA这类优化器可以只通过少量示例,从失败轨迹中演化出系统提示。我在这里介绍过它:

等你把提示优化到极限之后,再专门开始做权重微调。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新