AI Pulse

谷歌新模型让机器人看视频自己学进度,还能多机协作

谷歌新模型让机器人看视频自己学进度,还能多机协作

谷歌周三发布了 Gemini Robotics ER 2,一款专用于机器人控制的最新具身推理模型。和过去不一样,程序员不用再逐条写指令了。ER 2 扮演机器人的“高级大脑”——理解物理世界、规划多步骤任务,然后把具体动作交给底层的视觉-语言-动作(VLA)模型。它还能直接调用 Google 搜索或你自定义的函数,获取外部信息。

它能做的事不止这些。通过观看连续视频流,ER 2 能跟踪自己的进度,出错了马上调整,准确知道什么时候该进入下一步。机器人可以“边想边干”——一边执行当前动作,一边盘算下一步怎么走。前代 ER 1.6 做不到这一点,ER 2 第一次实现了这种并行推理和执行。

ER 2 还带来了多机器人协作能力:多个机器人可以在同一空间里打配合,完成单个机器人干不了的复杂流程。谷歌做了两个演示。一个是用 ER 2 调用波士顿动力 Spot 的导航和机械臂 API,让 Spot 跟人互动、取东西;另一个是 Apptronik 的 Apollo 2 和 Franka F3 Duo 两个机器人联手操作。

在任务理解上,ER 2 有两项进展:一是进度分类,能把视频每一帧归到五个进度等级里;二是精确时刻定位,能锁定关键事件发生在哪一帧。空间推理也有提升。成功/失败检测可以直接看原始视频流判断任务是否完成。通用仪器读数从圆形表盘和视镜扩展到了数字显示屏、线性刻度、标尺和液体温度计,一共覆盖 10 种仪器。空间视觉问答能力也更强了。

安全方面,ER 2 是谷歌目前最安全的模型。人一靠近,机器人自动停下;人走开后,它再自己恢复工作。谷歌还引入了一个新的安全基准,专门测试基础模型当安全 VLA 编排器的本事——能不能遵守安全指令、能不能检测到人靠近。

现在开发者可以通过 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform(私有预览)使用这个模型。它集成了 Gemini Live API,用双向流式端点来优化对延迟敏感的任务,编排很流畅,没有那种“停下想一想”的卡顿。代码也已经在 GitHub 上开源了。

谷歌说接下来要继续让模型处理更复杂的任务,加速做出有用的机器人。不过,实际响应延迟、多机协作的通信可靠性、对陌生环境和任务的泛化能力,还有 API 调用成本,谷歌目前都还没公开。

阅读原文
📚 相关主题 机器人谷歌

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部