AI Pulse
📡 X 信号

Gautham Vasan发布博士论文《机器人通过真实世界交互快速学习》(三)

这是Gautham Vasan(@Gautham529)的新博士论文,我最近加入了他的答辩委员会。我认为这篇论文完成得尤其出色,第6章介绍的AVG算法是一种全新的流式深度强化学习(RL)演员-评论家算法(与Stream-X算法不同)。

论文标题:能够在真实世界交互中边运行边学习的机器人

摘要:能够从自身运行时经验学习的机器人,可以在其整个使用寿命中持续改善行为,并适应从未预见过的状况。当前机器人学习的主流做法不具备这种能力:从业者在部署前,根据人类提供的数据或模拟交互训练控制策略,部署后就保持策略固定。当部署后性能下降,人类工程师可能需要诊断故障、收集更多数据或优化模拟器,然后重新训练、重新部署策略。

从持续交互中进行强化学习(RL)可以减少对人类在数据收集、重训、重部署方面的依赖。实时强化学习指智能体和环境都按照实际时间推进,智能体在持续交互中感知、行动、学习的设定。实体机器人上的实时强化学习有三个实际要求:(a) 学习必须在机器人有限的计算和内存资源内运行;(b) 学习必须在实际的时间预算内可靠达到合格的性能;(c) 学习使用的奖励必须能通过机器人自身的传感计算得出,且跨任务定义简单。

我提出了三项互补的成果来解决这三个要求。第一项成果是远程-本地分布式(ReLoD)框架,用远程工作站补充机器人有限的计算资源。该框架在两台计算机之间分配动作计算和学习更新。基于视觉任务的实验显示,当机载计算有限时,使用Soft Actor-Critic(一种广泛应用的、从存储的转移中学习的批量RL算法)的智能体性能会下降,而使用ReLoD框架的机器人可以借助远程计算恢复性能。多次重复实验表明,合格的策略可以在几小时内从零开始学到。

第二项成果是对最短时间任务定义的实证研究,该定义给每个时间步分配-1的奖励,到达目标后终止回合。在交互预算相同的情况下,最短时间定义下学习到的最终策略,性能不低于甚至优于引导式奖励定义(奖励向目标推进的行为)下学习到的策略。使用最短时间定义,四台实体机器人在几小时内,无需外部仪器,就从原始像素观测中学会了到达目标的策略。

第三项成果是动作值梯度(AVG),这是一种计算成本低廉的流式强化学习算法,使用神经网络进行学习。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新