AI Pulse
📡 X 信号

三家机构发布机器人基础模型进展评测图表(five weeks)

三家机构发布机器人基础模型进展评测图表(five weeks)

Skild、Generalist 和 Sunday 在五周内相继发布了各自的性能图表,终于让我们可以客观衡量机器人基础模型的进展。

GPT-3 的重要性在于上下文学习的诞生:把示例放进提示词,就能完成模型从未训练过的任务。

Sunday 的 ACT-2 在从未见过的家庭环境中叠衣服的成功率达到了 99.1%。但这只是实验室选定的单一任务,性能曲线已经逼近天花板。它证明了,规模化只能让选定的单一技能臻于完美。

Generalist 的 GEN-1.5:经过 8 个月训练后损失持续下降,在 10 项全新任务上的一次成功率达到 59%。这个结果相当亮眼。但损失图表追踪的是预测误差,而非任务成功率。而且 59% 只是单一规模下的单次测量。一个点无法说明规模化是否有效。

Skild 在最精准的基准测试上测试了他们的机器人模型。上下文学习的宣称只有在评估与训练集的距离维度下才有意义。他们把距离纳入了测试,将规模放在了 x 轴上。

根据这个基准测试,Skild S1 一枝独秀。面对未见过的任务,只使用一个视频提示,不做任何微调,模型在训练数据为 1k 小时的时候成功率约为 0%。10k 小时达到 7%。30k 小时达到 25%。100k 小时达到 66%。曲线向上凸,仍在上升。

上下文学习应当根据「任务未见过」和「任务长周期」两个标准来评分。S1 两项都通过了,它能完成训练中从未出现、包含数十个步骤的十分钟长任务。

Skild 很快会分享更多关于他们如何实现这些结果的信息。👀

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新