排行榜没用,现在比大模型要藏起名字比内容
大模型现在不缺榜,缺的是人真正用起来时那一下判断。
你平时问 AI 一件事,很少会先翻排行榜。真正卡住的,是回答清不清晰、贴不贴题、拿去能不能用。名字再响,答偏了也没用;没听过的模型,答对了你也会留下。
DGrid @dgrid_ai 的 AI Arena 就把这件事摊开了。同一道题给两组回答,模型名字先藏起来,你只看内容,觉得哪边更好就投哪边。品牌光环使不上劲,剩下的是一次次很轻、但很具体的选择。
官方现在给出的数字是:超过 57 万人参与,累计 250 万次以上评测投票。这个量不是刷几轮活动能堆出来的。不同任务里赢的模型本来就不是同一个,换个场景,结论还会变。静态榜单像期末成绩单,Arena 更像平时作业——题一直在换,判断也一直在收。
Points-to-$DGAI 上线后,这条线接得更直:你去比回答、留偏好,拿到积分,积分再连上 $DGAI。重点不在“点两下就能赚钱”,而在有效反馈被记下来,再回流到模型路由里。谁更适合哪类任务,不再只靠实验室里的固定卷子。
$DGAI 已经进了 Binance Alpha,看见它的人会变多。可评测网络本身还是靠那些匿名对战里的选择在转。模型会继续变,榜单也会继续刷。更耐看的,可能是有没有一套办法,让普通人的真实判断持续进来,而不是把评测永远交给一张过时的表。
入口在这里:
下次再用 AI,与其先问“现在谁第一”,不如先看这一题谁答得更像人话。
#DGrid #AI