AI Pulse
📡 X 信号

Sakana AI,东京大学发布Scaling In-Context Imitation Learning 研究论文(25%)

Sakana AI,东京大学发布Scaling In-Context Imitation Learning 研究论文(25%)

我们将在 #IROS2026 介绍「扩大上下文规模的模仿学习」(SAIL)。这项工作是 Sakana AI 与东京大学的合作成果。

机器人在处理新任务之前需要做什么?通常来说,教机器人做新任务要从收集示范数据、训练策略开始。但基础模型已经从海量的图像、文本和机器人相关数据中完成了学习。我们想探究的是,在不修改模型本身的情况下,我们能从这些知识中提取多少内容用于机器人控制。

最近的研究显示,GPT-6 Astra 可以结合通用语言和视觉能力来操作实体机器人。更早的研究也表明,大语言模型/视觉语言模型可以根据少量示范生成完整的机器人运动序列。但基础模型不一定能在单次生成中产出可靠的机器人轨迹。性能取决于提供的上下文,运动目标中一个小错误就可能导致整个任务失败。

我们提出了 SAIL,这是一种通过测试时缩放来实现更可靠的、基于视觉语言模型的机器人轨迹生成方法。SAIL 将策略视觉语言模型用作机器人轨迹生成器,生成条件是少量成功示范。它会在模拟器中测试生成的轨迹,然后用一个评估视觉语言模型检查生成的视频,定位进度停滞的位置。

之后策略视觉语言模型会利用这个反馈修正轨迹,同时用蒙特卡洛树搜索(MCTS)探索替代方案,并优化有潜力的候选轨迹。最终只有被选中的轨迹会被发送给实体机器人。

在模拟环境的六个操纵任务中,将搜索预算从1个候选增加到45个,成功轨迹的平均找到率从25%提升到了73%。我们还在实体机器人上对 SAIL 进行了评估。

我们的结果表明,机器人轨迹生成可以受益于测试时缩放,额外的计算能让模型在模拟中测试并优化它提出的动作。我们认为,通过这类反馈,现有模型能实现的效果还有更多探索空间,而且这类改进对实体机器人能带来多大的提升也仍有探索空间。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新