AI想科研创意,输在了思路不够广
这篇耶鲁大学与芝加哥大学合作的论文显示,LLM 生成的研究想法和人类研究想法之间的真正差距并不在于想法质量,而在于想法广度:LLM 的思考范围比人类研究者更窄。
研究者基于 11,683 篇真实论文构建了一项对照测试,以每篇论文附近的先行研究作为共同起点。他们要求模型从这些相同的先行研究出发,提出新的研究动机和研究方法,再将这些想法与真实人类论文中的想法进行对比。
他们没有去评估单个想法看起来是否新颖,而是根据每个想法发现了什么空白、做出了什么类型的贡献给想法做了标注。人类想法分布在多种模式中,比如解释机制、测试失败、测量证据、构建系统、提升效率。
人类想法中只有 12.1% 主要围绕连接不同独立研究展开,但 LLM 想法中这类占比达到了 47.1% 到 64.2%,意味着模型使用这种手法的频率是人类的 4 到 5 倍。
哪怕增加额外推理也会让这种模式变得更明显,这说明模型通常只是打磨熟悉的套路,而非发掘更多样化的研究思路。
arxiv.org/abs/2607.01233
标题:"Measuring the Gap Between Human and LLM Research Ideas"
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖