Generalist AI发布GEN-1.5,看演示就会干活
我想,机器人领域可能刚刚迎来了自己的GPT-3时刻。Generalist AI刚刚发布了新一代机器人基础模型GEN-1.5,第一次把大模型里的One-shot In-context Learning大规模搬进了物理世界: 你给机器人现场演示一遍,它几秒钟就能学会,不训练,也不微调。比如你在机器人面前演示一次怎么拉开铅笔袋的拉链,GEN-1.5看完直接开始干。
演示一次怎么从袋子里拿钱,它也能学。甚至把「拉开拉链」和「拿钱」两个完全独立的演示一起塞进Context,它会自己把两个技能拼起来,中间的重新抓取、调整位置、错误恢复全部自己完成。Generalist把这个东西叫做: Physical Prompting,物理Prompt。
以前Prompt大模型,是往Context里塞文字。现在Prompt机器人,是直接往Context里塞一段「传感器数据+动作轨迹」。GEN-1.5拥有30秒的上下文记忆,只需要看一次3~12秒的动作演示,就能立刻执行新的物理任务。
10个不同任务里,One-shot平均成功率已经达到59%。如果愿意稍微训练一下,成本也低得离谱: 只需要5分钟数据、约50次演示、10个gradient steps,平均成功率就能提高到83%。甚至1分钟数据+1个gradient step,在一个held-out任务上已经能做到66.5%。
官方还有几个挺变态的Demo。GEN-1.5的预训练数据里���全没有simulation data,但你可以先在模拟器里演示一个动作,再把这段轨迹直接当Physical Prompt喂给现实机器人。模拟器里教一次,现实里的机器人直接照着干。
有些任务甚至连遥操作机器人都不用,人直接伸手在机器人摄像头前演示一次,它就能用自己的机械手模仿。最搞笑的是,他们只教机器人怎么用刷子把积木扫进碗里。测试时不给刷子,给它一根香蕉。
GEN-1.5:行,那香蕉就是刷子。给它一个簸箕,它又自己换了策略,直接把积木铲起来倒进碗里。训练数据里根本没有教过它这么做。
而且Generalist表示,他们没有专门为了One-shot Learning设计meta-learning机制,也没有针对这种能力增加特殊训练目标。GEN-1.5已经连续预训练超过8个月,随着physical interaction data持续Scaling,这些能力自己冒了出来。当然现在的任务依然比较简单、短程,One-shot成功率也只有59%,离真正的通用机器人还有很远。
Generalist自己也把它描述为这种能力的「beginnings」。但这个方向确实很有意思: 以后给机器人编程,可能真的会变成给机器人Prompt。不会干?
来,看我做一遍。