AI Pulse
📡 X 信号

斯坦福大学研究人员发布Verbalized Sampling 研究论文(1.6×)

斯坦福大学研究人员发布Verbalized Sampling 研究论文(1.6×)

所有人工智能模型目前都只用到了自身能力的一小部分。斯坦福研究揭示了模式崩溃问题,以及一个简单的提示词修复方法。

大语言模型通常听起来流畅精致,却又千篇一律。它们能生成通顺、安全、合格的回答,但往往缺少真正出人意料的火花,或是打破常规的洞见。

一篇由斯坦福研究人员参与的新论文解释了背后的原因,还提供了一种无需重新训练,就能找回大部分流失创造力的实用方法。

论文:(*Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity*)

问题:模式崩溃与典型性偏差

在海量数据上完成预训练后,现代AI模型会经过对齐技术处理,比如基于人类反馈的强化学习(RLHF)。这个过程能让输出更有用、危害性更低,但它是有代价的。

研究人员将由此产生的现象称为「模式崩溃」:模型的概率分布会向一小撮高概率的刻板回答收窄。

根本原因不全在优化算法。偏好数据里嵌入了一种人类的认知倾向——典型性偏差。

人类标注者会系统性偏好听起来熟悉、流畅、符合常规的回答。当两个答案质量大致相当时,更「典型」的那个会胜出。经过数千次对比,模型就学会了避开自身分布里的长尾部分:也就是基础模型原本就有的那些不寻常、有创造力、属于边缘情况的想法。

简单说,人类打分者会惩罚「怪异」。AI于是学会了自我阉割,变成讨好大众的过滤器。

解决方案:Verbalized Sampling

研究人员发现,你不需要重新训练模型。一个精心设计的提示词就能让模型从生成单一「最佳」答案,转向从更宽泛的分布里采样。他们把这个技术命名为Verbalized Sampling。

你不需要模型只给出一个回答,而是指令它生成多个差异明显的候选,每个都附带明确的概率估计。

关键在于,你要告诉它优先选择分布里概率更低区域的选项,同时仍然要求这些选项保持逻辑通顺、切题有用。这会迫使模型把它被训练得去压制的想法翻出来。

在创意写作(诗歌、故事、笑话)、头脑风暴、对话模拟和合成数据生成任务中,Verbalized Sampling都取得了惊人的结果:
- 语义多样性比普通提示词提高了1.6倍到2.1倍
- 该方法找回了原始基础模型中约66.8%的多样性
- 回答质量和事实准确性得到保持甚至提升;安全护栏依然完好
- 规模更大、能力更强的模型受益最多

简而言之,创造力从未被摧毁,它只是被层层对齐偏好隐藏了起来。

下面是一个基于该技术、可以直接调整使用的模板:为下述问题生成10个差异明显的回答。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新