Physical AI 最难复制的是数据飞轮
Physical AI 以后真正难抄的东西是什么?模型?机械臂?
还是数据?最近连续看 @axisrobotics 的进展,我越来越倾向于最后一个。因为模型可以开源,硬件可以买,仿真环境也能搭。
但有一样东西很难短时间复制: 一个已经持续运转的数据飞轮。这也是我觉得 Axis 比“做一个机器人数据集”更有意思的地方。传统的数据集逻辑很简单: 收一批数据 → 清洗 → 发布 → 训练�� 做完基本就结束了。
但机器人不一样。机器人永远会遇到新问题。杯子换个位置不会抓了,抽屉换个角度拉不开了,摄像头偏一点判断又错了…… 你不可能提前把现实世界所有情况都写进数据集。
所以更现实的方式其实是: 先让机器人干,再看它哪里不会。不会的地方,再补数据。补完继续训练。
训练完再让它干。然后继续找新的失败。这就是我现在理解 Axis 最核心的一层: 它想做的不是一个静态的数据仓库,而是一套会根据模型能力不断改变的数据生产系统。
这两者差别非常大。假设今天模型最缺的是 Pick & Place。那就让更多人去采抓取、移动、放置的数据。
等这些简单任务逐渐学会之后,系统继续往更复杂的遮挡、干扰、多步骤任务走。模型能力越强,暴露出来的问题越难。问题越难,需要的数据也越有针对性。
所以理想状态下,它会形成一个��环: 数据 → 模型变强 → 暴露新问题 → 产生新任务 → 收集新数据 → 模型继续变强。这才是真正的数据飞轮。而 Axis 最近的一些变化,其实都能往这个逻辑里放。
Franka Sim Dataset V1 不只是堆轨迹,而是覆盖 207 个任务和 6 万+场景变体; Human-Gated DAgger 开始专门收集机器人“快做错时,人类是怎么救回来的”; Challenger Program 又把更多激励往高难度任务倾斜。你会发现方向其实很统一: 机器人已经会的,少重复一点。机器人不会的,多采一点。
我觉得这句话可能比“490 万+轨迹”更能说明 Axis 下一阶段在做什么。因为 Physical AI 最后拼的,大概率不会是谁硬盘里的数据最多。而是谁能最快发现: 当前模型到底缺什么数据。
再用最低成本,把这些数据补回来。如果这个反馈周期原本需要几个月,未来能够压缩到几周,甚至更短,那机器人模型迭代速度可能就是完全不同的量级。这也是为什么我觉得 Axis 的社区网络很重要。
20 万+用户表面上是 Contributor 数量。但换个角度看,它其实也是一个可以被调度的数据生产网络。今天需要抓取数据,就去抓取。
明天某个模型总是在插入任务上失败,就把更多任务和激励往插入场景调。后天发现仿真到真机之间某类动作掉点严重,再针对这个问题补数据。需求在哪里,数据生产就往哪里移动。
如果未来真能做到这一点,那 Axis 最难复制的可能就不是某一个 Dataset,也不是某一个模型成绩。而是: 任务生成、贡献者、数据验证、模型训练、失败反馈,再回到任务生成的整套循环。单独复制其中一个环节不算难。
难的是让整个系统持续转起来,而且越转越快。所以我现在看 Axis,会少看一点“今天又新增多少 Trajectory”,多看一点: 这些新数据,是不是上一轮模型真正缺的数据?如果答案越来越接近“是”,那这个飞轮才算真正转起来了。
而一旦数据飞轮开始形成, Physical AI 的竞争,可能就不再只是比谁的模型参数更多。而是比谁学得更快。@axisrobotics #PhysicalAI #Robotics