AI Pulse
📡 X 信号

从机器人原始数据到训练数据,中间还有一大段关键流程

从机器人原始数据到训练数据,中间还有一大段关键流程

很多人看到机器人数据,第一反应就是直接把机器人的操作记录下来拿去训练模型。实际上,从原始数据到可训练机器人模型的数据,中间还有一大段关键流程。

在@axisrobotics的架构中,一次浏览器遥操作(Browser Teleoperation)产生的轨迹(Trajectory),会记录机器人的关节状态、物体位置、控制动作与任务信息。这些原始数据进入后端后,还要经过验证→过滤→平滑化→重新采样→数据增强等处理,才会进入后续训练流程。

这一步处理非常关键。真人操作会留下很多细微误差,比如操作犹豫、突然停顿、不必要的小幅抖动,甚至一些不符合任务要求的轨迹。如果这些内容原封不动输入模型,模型学到的内容就会包含这些噪声。

@axisrobotics的数据处理流程会先做品质检查,再通过轨迹平滑与重新采样降低高频操作噪声,最后利用IsaacSim做视觉与物理环境的数据扩增,让同一笔操作经验可以衍生出更多不同场景的训练数据。

这也是数据引擎(Data Engine)有意思的地方。5万条普通轨迹和5万条经过处理的高质量可扩增轨迹,价值可能完全不同。

机器人数据真正的难点,从来不只在于收集数据的数量。它还覆盖从收集→验证→清理→扩增→训练→回到真实机器人的全流程,@axisrobotics现在做的就是把整条流水线串联起来。

作者目前关注@axisrobotics的核心点在于,它能不能让每一笔数据都产生更多数据价值。这可能才是数据引擎最值得关注的地方。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新