三方联合发布AI探索能力新基准ExplorationBench
新研究:我们发布了 ExplorationBench,这是一个用于衡量AI系统探索能力的基准测试。
科学发现始于已知问题终结之处:一个系统必须构建假说、设计实验,并从结果中学习。而评估这项能力是很困难的。真正全新的答案无法快速检查,而在熟悉的领域中,模型可以直接回忆它见过的内容。
为解决这一挑战,来自腾讯Hy、复旦大学和清华大学的研究人员构建了可验证的“外星世界”。它们的规则是可执行的,因此每个答案都能被准确检查,并且它们与现有知识冲突,因此仅靠回忆无法解决任务。
🔹 两个沙盒:AlienCode(31处隐藏规则变更,70项任务)和 AlienLogic(24条修补推理规则,70条定理)
🔹 一份有缺陷的手册,四轮自行设计的探测,每轮结束后进行闭卷测试
🔹 每个答案都由解释器或证明检查器评分,不使用大语言模型作为裁判
我们对10个前沿AI系统的测试发现:
1️⃣ 获取反馈比独立思考更有效。AlienCode中没有运行初始正确率超过15.7%;四轮结束后最佳达到89.0%,而不接收反馈的同流程运行结果停留在0.5%–11.0%。
2️⃣ 实验设计至关重要。重放系统自己的最佳探测会给它完全相同的证据,但在AlienCode中10个系统里有9个表现比它们自行选择探测时更差。
3️⃣ 知道规则不代表会使用规则。即使所有要求的规则都被正确陈述,任务也只有73.4%的概率被解决。
4️⃣ 单个分数掩盖了大量信息。同一系统在相同预算下结果从5.7%到79.0%不等,排名在两个“世界”之间几乎无法迁移。
CL-bench 问的是模型能否从上下文学习。而 ExplorationBench 问的是它们能否自己发现规则。
📄 论文:
🌐 网站和排行榜:
📝 博客:
💻 代码(即将发布):
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖