AI Pulse
📡 X 信号

一个通用框架搞定足式机器人两类运动任务

🚀 全新开源项目!我将我之前工作 GfR(RSS 2026)和 HIL(TOG 2026)中的学习框架,扩展到了 Unitree G1 的两个代表性任务:搬箱子和爬箱子,项目基于 Holosoma 构建。

同一个学习框架可同时应用于运动任务和运动操作任务。每个任务仅需单条参考运动片段,学习得到的策略就能在广泛的任务条件和目标下泛化。

核心思路(来自 GfR 和 HIL)非常简单:
1️⃣ 我们发现,策略无需将目标参考运动作为 actor 输入,就能实现高质量的运动跟踪。任务目标会从参考运动中提取出来,和机器人状态一同提供给 actor。参考运动本身仅用来定义跟踪奖励。

策略以任务目标而非参考运动为条件,学习得到的行为可以轻松迁移到新的任务条件中。

2️⃣ 在此基础上,我们开发了混合多任务训练框架:
• 在跟踪任务中,目标从参考运动提取,策略使用跟踪奖励训练。
• 在通用强化学习任务中,目标和任务条件随机采样,策略使用稀疏目标达成奖励训练。
• 在所有任务中,actor 接收的观测结构始终一致,而 critic 会获得任务特定信号。

同一个策略可以同时从跟踪任务和通用强化学习任务中学习,将通过运动跟踪获得的行为迁移到更通用的目标驱动环境中。

本项目提供了一个实用示例,展示 GfR/HIL 方法论如何适配新任务。

注:这是非官方研究实现和扩展,既不是 GfR 也不是 HIL 的官方代码发布。

🔗

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部