AI Pulse
📡 X 信号

机器人数据平台Axis调整重心:从大规模采集转向数据筛选

机器人数据平台Axis调整重心:从大规模采集转向数据筛选

这周Axis发布了两份内容,一份是平台周报,一份是脚本赏金项目的月度处理结果。Axis方面自己承认,大规模生成与采集数据已经不是当前最紧迫的工作。

平台上线接近一年,随着数据轨迹量上涨,真正耗费精力的环节变成了筛选。看起来合格的操作轨迹,不一定对当前的策略还有用。

周报中提到的模型引导数据引擎(model-guided data engine),核心逻辑是将模型表现作为反馈,以此决定保留哪些轨迹、丢弃哪些轨迹,以及下一批数据评测往哪个方向补充。

如果持续按固定分布抽取数据,训练预算很容易消耗在模型已经掌握的动作上,常规质检无法解决这个问题。

人工、视觉语言模型(VLM,Visual Language Model)、固定脚本,最多只能判断回放操作是否像真人操作。Axis现在将筛选依据转向模型表现,同时把反复失败的推演(rollout)作为下一轮采集点。

操作员会在失败位置附近接手修改,新数据与旧数据合并训练,避免新技能覆盖旧技能。这个闭环逻辑并不复杂,但前提是失败样本确实是真实操作失败,而非脚本刷出来的假完成。

脚本赏金项目不是配套运营动作。8月到9月初,社区上报的脚本经过检测后,官方封禁了127个主要脚本账号,连带处理了28个关联推荐账号。

随着回放引擎升级,脚本输入更难通过校验。本月已经发放了超过1000美元赏金,项目累计发放超过2500美元。

后续规则将会更严格:经核实的脚本账号,其数据和推荐关系都会被清除,对应Discord身份的角色也会被撤销。任务资源槽本身有限,脚本占用资源会挤掉真人贡献,同时拉低数据质量。

数据生产环节,Real2Sim2Real(真实-仿真-真实)流程仍在推进。将真实物体和场景导入仿真,补全碰撞、铰链、物理与视觉属性,在仿真中生成高保真数据,再用真机验证这些数据是否有用。

近期的目标聚焦在抓取放置、装箱、分拣这类技能上,先实现跨物体、跨场景的能力,再迁移到真机上。

TaskGen支持在同一场景挂载多条描述,尺寸限制更严格,新增了篮子放入和取出功能。系统已经接入ARX5双臂,新任务搭配新本体,会产生更多失败点,下一批数据评测大概率就会聚焦在这些失败点上。

官方称相关论文还在撰写中。目前已经形成了采集、筛选、验真、再按失败点补充采集的完整闭环。

相关活动页面可在@KaitoAI查看,链接可以和周报对照查看。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新