OpenAI停报SWE-bench:作者称分数必须能复现
二月份,OpenAI 停止报告 SWE-bench Verified,并建议其他实验室也这样做。他们测试的每个前沿模型都能复现人工编写的参考修复,或某些任务问题陈述的逐字细节。进展在六个月内放缓到六分,剩余分数中有多少是能力本身已不清楚。构建该基准且有一切理由保留它的实验室,正是放弃它的那个。
通常的答案是去污报告:实验室搜索了其训练数据,发现没有相关内容。我写下了为什么这行不通,原因有三,且不会因更好的搜索而消失:
- 实验室自查。外部没有人拥有语料库,所以没人能重新运行搜索。
- 语料库无法披露。它是其中每部受版权作品的列表,发布它会构成诉讼风险。
- 匹配会漏掉大多数情况。改写、论坛演练、GitHub 上的解决方案、从基准生成的合成数据。模型从其中任何一个都能学到答案,而无需共享任何 n-gram。
承诺和私有集合交集看起来有用,但实际帮助比表面小:它们证明的是实验室所声明的语料库的情况,而不是模型实际训练所用的数据,而迄今为止的训练证明方案已被证明是可伪造的。
所以论点是要翻转它。评估者控制测试:提交永远不会收到标签,评估在无网络环境下运行,评估者从指定的提交构建代码并复现分数,并在可能的情况下,在提交冻结后生成测试数据。只有被复现的结果才算数。
我构建了一个小版本(表格模型、私有测试集、资助者发布问题和门槛)。这篇文章诚实地说明了它不能证明什么:基准是否好,隐藏测试集是否无法通过重复提交被挤出,资助者是否泄露了标签,以及第三方是否能在没有数据的情况下重新运行它。其中第二点是我最想先填补的缺口。
[https://holdoutlabs-ai.github.io/reproduce-it-or-it-doesnt-count/0
如果论证在某处有误,我更愿意现在听到。