AI Stupid Level创始人:大模型基准测试多为快照,分数会随时间漂移
有一件事困扰我很久:大多数LLM基准测试本质上都是快照。
一个模型被评估,一个分数被发布,我们倾向于把这个分数当作一个相对稳定的对象来讨论。但API提供的模型背后,名称背后的东西会随时间变化:服务基础设施会变,提供商配置会变,版本会变,有时行为发生变化却没有明显的公开版本转换。
于是我们开始把基准测试当作一个纵向测量问题,而不是排行榜问题。
我们持续评估模型在编码、多轮推理和工具使用方面的表现,同时以更高频率运行轻量级探针。对我们来说,重要的不只是提出“哪个模型得分最高?”,而是:
* 模型是否表现出与其自身先前基线不同的行为?
* 变化是否大于其正常的重复调用变异性?
* 基准测试配置本身是否发生了变化?
* 影响是否集中在某个特定任务上?
* 同一提供商的不同模型之间是否存在相关性?
* 明显的性能下降实际上是可用性/基础设施问题,而不是能力变化?
一项历史分析涵盖了49个模型的31,352次重复得分观察。日内得分的标准差为2.80分,而日间中位数的标准差为8.43分。
这大约是3:1的差异。
我不认为这个结果本身就能证明提供商每天都在改变模型——这个结论存在太多混杂因素。任务构成、采样、缺失数据、提供商行为和方法论变化都有影响。但这足以让我们相信:时间变异应该被测量,而不是被当作围绕一个永久排行榜得分的噪声。
因此,我们当前的方法保持基准测试配置的版本化,并且只比较在兼容测量条件下产生的纵向观察结果。我们尽可能使用重复执行式评估而非LLM评判,将可用性失败与有效任务结果分开处理,在提供商暴露时跟踪服务/版本元数据,并对生成的时间序列运行变化检测。
我们越来越感兴趣的另一个问题是基准测试识别和污染。一旦基准测试变得足够显眼,发布每一个实时任务、提示转换和隐藏测试都可能会改变你试图测量的东西。因此,我们试图将方法论透明度与发布整个实时评估集分开。
我们现在已经撰写了一份方法论公开版本。它有意解释了测量设计、假设、局限性和统计解释,同时保留确切的实时任务库和一些操作参数。
PDF: [https://aistupidlevel.info/asl-public-benchmark-methodology-2026.pdf0
我特别感兴趣的是来自从事评估、变点检测或生产机器学习工作的人的批评。
有几个问题我真心希望听到意见:
1. 对于纵向LLM评估,你会使用日间中位数作为主要时间序列单位,还是直接对个体重复观察进行建模?
2. 在版本元数据不完整的情况下,你会如何区分真正的模型漂移与提供商/基础设施影响?
3. 一个实时基准测试应该隐藏多少内容,才能在保持方法论科学可审查性的同时减少污染?
4. 对于这种非平稳、相对嘈杂的模型性能序列,是否有比变点检测器更好的方法?
披露: 我是AI Stupid Level的创始人,该平台产生了这些测量。在这里发文的目的在于获得对方法论的技术批评,而不是推广商业产品。