机器学习实验到底还能不能复现?一位研究者:已是失败事业
我觉得可复现性在机器学习研究中已经是一个失败的事业,原因有三:
1. 许多研究正在走向物理AI领域,你需要昂贵的硬件甚至整个配备高速摄像机的实验室才能进行实验。你完全不知道实验是否可复现,只能相信演示。但演示并非完全可靠。而且人们只会展示演示中起作用的部分。录像一停,整个系统就可能崩溃。
2. 大型AI公司发布各种工具,声称能以一定准确率或效率解决一堆问题。除非你在这类公司工作,否则根本无法证实,只能听信他们的话。他们有强烈的金钱动机去夸大这些数字。而且由于他们解决的问题如此模糊和主观,也没有可靠的方法去验证。
3. 我们必须正视房间里的大象:人们有意制造不可复现的工作,以防被竞争对手抢走饭碗或让自己难堪。这就是为什么我们中有些人给作者发邮件索要代码时,可能永远得不到回复。
那现在怎么办?也许一切都会好起来,因为我们可以与早期历史上的科学进步做对比,比如制造原子弹或送人上月球。这些项目“外部可复现性”低,但“内部可复现性”高。而且这些工作本质上都是数学性的,经过仔细检验。但我认为机器学习研究的许多领域并非如此。你们怎么看?可复现性是否应该被抛弃?如果不抛弃,未来最好如何实施?
高票评论(帖子共 22 条讨论)
[+27] u/No_Paper_6658: 登月对比很有意思,但关键是那些项目的内部验证极其严格,正因为风险太高。大多数机器学习研究没有生死攸关的后果,所以内部检查要松散得多。第二点最让我有同感。行业实验室一旦发布一篇炫酷的博客文章,就基本没有任何问责。你只能点头同意,并假设他们在某个模糊基准上30%的改进是真实的。
[+6] u/pastor_pilao: 过去20年你在哪,居然觉得这是新问题?说真的,你被激励去写不可复现的工作这种说法完全不对。2015年以来所有出名(并因此暴富)的人,都是因为他们发布了非常容易复现、附带良好实现的东西,因此才火起来。
[+5] u/yannbouteiller: 可复现性在机器学习研究和机器人学中当然不是无关紧要的。如果你遇到我作为审稿人,基本上任何不可复现的东西都会直接被拒。通常可复现性就像开源代码库一样简单。那么,即使复现你的工作需要昂贵的硬件,有兴趣的实验室也完全可以并且会去做。
[+1] u/linearmodality: 你在开玩笑吗?机器学习研究比以往任何时候都更可复现。你有标准化的库(PyTorch),几乎所有机器学习计算都在其中完成。你有开放权重和开放数据的仓库(Hugging Face),任何人都可以用一行Python加载模型或数据集。你还有AI代理,只需要求它们“请复现[论文链接]中的结果”就能复现论文结果。试着手动复现20年前甚至10年前的典型机器学习论文,你就会发现现在变得多容易。
[+0] u/polyploid_coded: >许多研究正在走向物理AI领域,你需要昂贵的硬件甚至整个配备高速摄像机的实验室才能进行实验 今天有什么AI研究需要高速摄像机的例子?