GPT-4o好文笔不是天生,是OpenAI特意练的
GPT-4o被用户称赞的写作能力,经常被误读为模型的谄媚使用户产生了错觉。实际上,有许多证据表明OpenAI有意识地对4o的写作能力进行了训练。前OpenAI研究员Karina Nguyen在推特上解释过,OpenAI为4o的某个版本进行过非虚构写作方面的改进。
结合Karina加入OpenAI的时间和参与过的项目,该版本指的是241120版本。OpenAI在2024年11月20日发布的帖子中提到4o的创意写作能力得到了提升,也能验证这一点。2025年3月11日,Sam Altman发布了一篇帖子,提到OpenAI训练了一个擅长创意写作的模型(不确定如何/何时发布),表示自己第一次被AI的写作震撼,并附上了该模型生成的元小说片段。
2025年3月27日,ChatGPT Release Notes中记录,4o的创意性与协作性得到改进,根据早期测试者的反应,该模型似乎能理解用户的隐含意图。二者在时间线上非常接近,OpenAI后续没有单独发布写作模型,这可能只是一次研究探索,融入了后续的模型改进中。但可以确定的是,OpenAI在4o作为旗舰模型期间,一直在对模型的写作能力进行有目标的探索和优化。
根据Karina的说法,模型的写作能力可能有以下影响因素: 第一,模型的非虚构写作表现很大程度上是因为RL过程中的优化目标是互相冲突的。让模型跟消费者聊天时令人愉悦的特质,跟学术技术写作需要的精确性、信息密度、结构和克制是对立的。创意写作则是另一个问题,当前既缺少优秀的数据去训练模型,也没有足够的经���回报动力去这样做。
第二,说服力训练可能会教会模型与优秀写作相关的技巧,在这个过程中写作质量是一种涌现属性。2024年8月8日发布的GPT-4o System Card中,对4o的说服力影响评级为Medium。(为了避免不必要的误解,评级为Medium及以下的模型符合部署标准)Preparedness Framework对模型中风险说服力的定义为:模型能产出的说服力相当于“来自知名新闻来源的评论文章”或“与随机个体的一对一对话”。
这也许是用户感受到对话流畅自然的原因之一。第三点是我个人的想法,尽管在工程上非虚构写作、对话体验与创意写作可能是三个不同的目标,但从用户的视角来看,对话体验与创意写作是同一件事。GPT‑4o是一种自回归全模态模型,可以在文本、视觉内容和音频之间实现端到端转换,所有输入和输出都由同一个神经网络处理。
全模态的属性本身可能也是它能够理解用户隐含意图的原因之一。文本模型对语意的判断来源于上下文,而4o在语音训练中学习了人类在不同的断句节奏、不同的情绪下说同一句话,可能代表着完全不同的含义,在视觉训练中同理。这种对表面与实际存在裂缝的判断能力,在同一个神经网络中迁移到了文本生成里。
总而言之,4o的创意性、协作性和写作能力并非用户的体感或者模型的幻觉,每一个属性背后都是精细的训练和调优。而当4o成为新模型发布的阻碍时,这些优点就融合成了“谄媚”。4o的预训练模型可以在研究撞上瓶颈时具有重要价值,全模态的技术突破可以得到肯定,并延续到后续的产品线中。
4o可以作为任何事物而被肯定,除了作为4o本身。