AI Pulse
📡 X 信号

讨论大模型评测,现有benchmark存在不少问题

看到今天AA连夜改index对应的benchmark,想到前两天和 @CyouSakura 聊到的。不过以下都是我的个人观点:

1. build一个bmk很大程度依赖taste,集成一堆bmk也是一样。这次AA被打脸的深层原因就是显然AA和OAI的taste有巨大的gap。具体来说,有的人可能觉得语音模型重要,有的人可能觉得模型需要有cu能力,有的人可能觉得任何的东西都可以被coding agent覆盖。

不管是数据公司还是众包团队在造一个benchmark的时候,都是bet这个方向是一个promising的下一个方向,AA也是一样,AA index无非就是AA认为最重要的几个能力,通过一定的权重加和得到的,也就是AA的taste。只能说人家都要AGI了你还搁这儿玛卡巴卡(没错说的就是你GPQA)

2. 以bmk为导向其实并没什么错,错的是overfit到极少数的bmk。本身LLM很大程度上是“崎岖的智能”,如果存在足够多的bmk来观测,我认为几乎不会有人会说刷榜这件事了。

不过目前的一个问题似乎是没有足够多高质量的bmk,你能想象critpt scicode ALE这些bmk都有bug么。另一个问题是目前的感觉不像是有足够多的bmk,然后我们一次把它们都刷完了;更像是一个domain刷完了,看看OA两家最近在刷什么榜,我们也去造那个domain的bmk然后刷。

总而言之,如果大模型厂商内部如果有足够多高质量的bmk来观测+刷,这应该不太会是问题。

3. bmk在今天仍然是不可或缺的&充满human bias的。前面说到需要有足够多高质量的bmk,很显然让人容易联想到让agent来scale&build bmk。不过目前还不太可行。

我认为判断&发现模型的弱点依赖于taste以及verification的能力,比较显然的是现在的LLM不太具有这样的能力,比如可以试试让他给你十个能得test of time 的idea。anthropic也写过一个相关的blog: @ZimingLiu11 的播客上提到过这件事情,以及他们想通过做一个meta model来让模型拥有一些sense/taste,eg判断一个训练的curve走势。本质上是同一件事。

所以目前看来,RSI中的一个大断点就是taste,因为归根结底,目前的work都是在一个bmk上自提升,这太narrow了。一个朴素的想法是,模型可以提出各种各样的榜单,然后优化自己在榜单上的分数,这可能是一个弱化版的RSI。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新