大语言模型给出的研究创意,范围比人类研究者窄很多
有一篇论文指出,LLM提出的研究想法,和人类研究者相比,“创意的广度”似乎要狭窄得多(https://arxiv[.]org/html/2607.01233v1)。
这篇论文的研究方法很有意思:它把同一组相关论文(仅提供标题和摘要)同时展示给人类和LLM,再将人类实际撰写的论文的原始创意,和让LLM新想出来的创意做对比。
研究一共基于从ICLR、ICML、NeurIPS(2023~2026年)和Nature Communications(2023~2025年,覆盖71个领域)收集的合计11,683篇论文,用Claude-Sonnet-4.6、Gemini-3.1-Pro、GPT-5.4-mini等9个LLM做了验证。每个创意会按「动机(关注到了研究领域里哪块空白)」和「方法(如何填补这块空白)」两个维度,分别用7种标签做分类。
结果的偏差非常明显。人类创意中,属于连接现有研究的“搭桥”型动机仅占12.1%,但在LLM群体中这类动机占到了47.1~64.2%。
方法层面也一样:整合现有方法的“整合·统一”型,人类占比是5.1%,LLM则是22.5~38.7%。
代表多样性的指标(熵)人类在两个维度都高达0.92以上;动机维度上最接近人类的Gemini-3.1-Pro,分布偏差(TVD)也有0.348;方法维度最接近的Claude-Sonnet-4.6,偏差也还有0.211。
把提案浓缩成一句话后统计动词使用的分析也很有意思:“integrate(整合)”占LLM输出的34.2%,人类仅用了2.35%。反过来,人类更喜欢“replace(替换)”(9.13% vs 0.92%)、“decouple(拆分)”(2.33% vs 0.21%)这类局部精准的调整。
大概就是,LLM倾向于先把显眼的概念凑到一起,而人类更喜欢精准替换指定的部分。
最意外的结果是:开启思考模式(Thinking mode)反而会让结果离人类更远。Qwen3-8B开启思考模式后,搭桥型创意的占比从49.7%上升到71.1%,和人类分布的偏差(TVD)也从0.382恶化到0.590。哪怕让模型读全文而不只是论文摘要,结果也一样:思考时间越长,输出就越往模型自己擅长的模式偏。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖