Scale AI 测试发现旧算法比大模型更靠谱
突发消息:最新AI模型在估算数据质量方面其实表现相当糟糕!来读一读Scale AI这篇有见地的文章,作者是@jadechoghari等人,内容是如何大规模验证数据质量(双关语无意为之)。
定义:
- 光流(Optical flow):连续视频帧之间的逐像素运动向量,能告诉你什么物体发生了移动、移动了多远、朝哪个方向,无需提前识别物体本身。
- MediaPipe 姿态/手部追踪(MediaPipe pose/hand tracking):谷歌推出的轻量级端侧库,可以从视频中实时提取骨骼关键点(身体关节、手指地标点)。
- 冻结EfficientNet-B0嵌入(Frozen EfficientNet-B0 embeddings):来自一个在ImageNet上预训练的小型CNN的特征向量,该CNN的权重保持固定(即「冻结」)——你可以把它当作廉价开箱即用的图像概括工具使用,不需要重新训练。
- LightGBM梯度提升树(LightGBM gradient-boosted tree):微软推出的梯度提升快速实现方案,梯度提升是由多个小型决策树组成的集成模型,每一棵树都会修正上一棵树的错误;在表格/特征数据任务上,它的表现至今默认胜过神经网络。
- DINOv2:Meta推出的无需标签训练的自监督视觉Transformer;它的嵌入能捕捉细粒度几何和纹理信息,是密集视觉任务的首选骨干网络。
- OpenCLIP:CLIP的开源复现,是将图像和文本编码器训练为让匹配对的映射结果在特征空间中彼此接近的模型,可以通过文本提示实现零样本分类。
- VLM(vision-language model,视觉语言模型):能够联合理解图像和文本的模型,可以观察场景并基于看到的内容回答问题或遵循指令。
更具体地说,这篇文章介绍了Scale如何在机器人演示视频成为训练数据之前,自动对其进行质量控制——也就是判断哪些片段足够可靠,可以用来训练。
他们没有直接问一个大模型「这个视频合格吗」,而是把质量控制拆解成具体的失效模式:模糊、节奏错误、缺失身体支撑、帧损坏、任务不合逻辑。
对于第一视角摄像头数据集,团队计算了120种廉价的手工构建特征(时长、光流、亮度校准后的模糊度、MediaPipe姿态/手部追踪、冻结EfficientNet-B0嵌入),输入给LightGBM梯度提升树,为每条规则调整阈值,并将不确定的案例转发给人工审核。
文章报告了两个内部数据集:4,088个机械臂安装的操作演示(其中292个不合格,占比7.1%),以及9,145个标注的第一视角片段(其中1,777个留作测试集),还将该树模型与DINOv2、OpenCLIP和VLM方案做了基准测试对比。
我觉得这件事非常有意思:整个业务都建立在「前沿模型接管一切」之上的Scale,发表的结果居然显示,一个2019年的编码器加上一个梯度提升树,击败了他们测试的所有基础模型!
此外,DINOv2和OpenCLIP「相较EfficientNet质心特征(一个2019年冻结的ImageNet模型)没有带来任何提升」,而VLM提示「和廉价特征相比是冗余的」。
经典计算机 vision 居然还能在这场游戏里占有一席之地,这太让我开心了!而且质量控制的经济学逻辑和常规分类是完全颠倒的:错误拒绝几乎会彻底毁掉一个已经付费获得的数据资产,而错误接受只会增加
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖