AI Pulse
📡 X 信号

三方联合发布AI探索能力新基准ExplorationBench

三方联合发布AI探索能力新基准ExplorationBench

新研究:我们发布了 ExplorationBench,这是一个用于衡量AI系统探索能力的基准测试。

科学发现始于已知问题终结之处:一个系统必须构建假说、设计实验,并从结果中学习。而评估这项能力是很困难的。真正全新的答案无法快速检查,而在熟悉的领域中,模型可以直接回忆它见过的内容。

为解决这一挑战,来自腾讯Hy、复旦大学和清华大学的研究人员构建了可验证的“外星世界”。它们的规则是可执行的,因此每个答案都能被准确检查,并且它们与现有知识冲突,因此仅靠回忆无法解决任务。

🔹 两个沙盒:AlienCode(31处隐藏规则变更,70项任务)和 AlienLogic(24条修补推理规则,70条定理)

🔹 一份有缺陷的手册,四轮自行设计的探测,每轮结束后进行闭卷测试

🔹 每个答案都由解释器或证明检查器评分,不使用大语言模型作为裁判

我们对10个前沿AI系统的测试发现:

1️⃣ 获取反馈比独立思考更有效。AlienCode中没有运行初始正确率超过15.7%;四轮结束后最佳达到89.0%,而不接收反馈的同流程运行结果停留在0.5%–11.0%。

2️⃣ 实验设计至关重要。重放系统自己的最佳探测会给它完全相同的证据,但在AlienCode中10个系统里有9个表现比它们自行选择探测时更差。

3️⃣ 知道规则不代表会使用规则。即使所有要求的规则都被正确陈述,任务也只有73.4%的概率被解决。

4️⃣ 单个分数掩盖了大量信息。同一系统在相同预算下结果从5.7%到79.0%不等,排名在两个“世界”之间几乎无法迁移。

CL-bench 问的是模型能否从上下文学习。而 ExplorationBench 问的是它们能否自己发现规则。

📄 论文:
🌐 网站和排行榜:
📝 博客:
💻 代码(即将发布):

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新