Axis Robotics 研究训练数据质量的影响
人工智能可以从人类的纠正中学习,但如果某些纠正实际上是劣质训练数据呢?这是 @axisrobotics 近期一项机器人研究背后的核心问题之一。
研究人员在帮助机器人把一块豆腐放到盘子上的过程中,收集到了660条人类纠正轨迹。
一开始,660条纠正听起来像是很多有用的训练数据,但人类成功完成任务,并不意味着他们采取的每一个动作都对机器人的模仿有用。人类可能会暂停、犹豫、做出多余动作,或是在机器人本可以自己完成任务的时候接管控制。
因此 Axis Robotics 需要搞清楚一个更具体的问题:纠正中的哪一部分实际上帮助了机器人恢复?他们对收集到的数据进行了一系列筛选检查。
首先,完整的人类操作必须能在模拟中成功复现。筛选后,660条变成了496条。
确认轨迹可以复现后,研究人员检查了这次干预实际上是否必要。如果原始策略本身就能完成任务,那就没有值得学习的有用纠正。这一步筛选后,496条变成了416条。
接下来是恢复测试。研究人员没有把整个人类操作当作训练数据,而是从中找出能够改变结果的短动作片段。他们回放这段片段,把控制权交还给原始策略,然后检查策略是否能自己完成任务。只有161个片段通过了这项测试,每个片段大约0.8秒长。
结果证明了筛选的重要性:原始策略在480次任务中成功了192次;用完整的人类纠正序列训练后,性能反而下降到480次成功176次;用筛选出来的161个经过验证的片段训练后,成功率提升到了480次成功236次。
因此,有用的训练信号不是整个人类接管操作,而是那些被证明能将失败场景转化为机器人可以自行恢复的场景的小动作。总共收集了660条纠正,最终只有161条被证明对训练有用。在我看来,这项研究说明了训练物理人工智能时,数据质量有多重要。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖