AI Pulse
📡 X 信号

网友Lingxiao234测试GPT-6实现端到端机器人real2sim

网友Lingxiao234测试GPT-6实现端到端机器人real2sim

GPT-6 可从机器人演示中实现端到端的真实到仿真(real2sim)转换。我只给了它多视图RGB数据、机器人动作和一条简单提示词。

它完成了相机校准,构建了物体资产,执行了物理系统识别,运行了 MuJoCo,并在 Blender 中渲染。

我认为最有意思的地方是智能体化的系统识别。它先假设一个物理参数,编辑模型,运行动力学,和视频对比,然后修正。全程没有用到优化器。智能体本身就是搜索过程。

但它遇到了瓶颈。双手操作麦克风的任务物理模拟失败了——没有一次运行能保留全部三个麦克风。你现在看到的是运动学重放,不是经过验证的动力学。卡扣式夹子需要柔顺接触,刚性代理无法实现这一点。

我没想到的一点是:我在ABC 和 DROID 上跑了 VGGT-Omega 和 MapAnything。两者都无法在不同视图间保持物体一致性。而 GPT-6 仅靠纯RGB就能做到——因为它从不预测单视图几何。它适配出一个共享场景,让所有相机都和这个场景保持一致。

所以真正的限制不在 GPT-6 本身。它通过调用模拟器来构建动力学,这意味着它的物理能力永远无法超过模拟器本身能表达的范围。

一字不差,包括拼写错误:“你能否尝试对这个droid片段做真实到仿真转换:.../droid_samples/ep0_IRIS_move-object-into-or-out/recordings,构建可用于仿真的资产,确保机器人重放在物理上可行以完成任务,并且不同视图渲染的重放能很好对齐多视图视频(多视图一致性)?数据来自使用 franka 机械臂的 droid 数据集。你可以用 blender 作为工具”

一字不差,包括拼写错误:“你能否尝试对这个droid片段做真实到仿真转换:.../droid_samples/ep0_IRIS_move-object-into-or-out/recordings,构建可用于仿真的资产,确保机器人重放在物理上可行以完成任务,并且不同视图渲染的重放能很好对齐多视图视频(多视图一致性)?数据来自使用 franka 机械臂的 droid 数据集。你可以用 blender 作为工具”

这里完全没有策略。这只是重放。机械臂在扭矩限制控制下跟踪记录的关节轨迹,物体仅通过接触运动。没有焊接,没有预设的物体位姿,没有任何学习内容——环境只是被智能体自身的反思迭代调整成了当前形状。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新