Physical AI平台Axis Robotics重金防bot 核心原因保住训练数据质量
用户刷Axis Robotics的社交动态发现,团队一直对反机器人(bot)一事十分重视。
Axis Robotics官推日前再次公开征集,社区用户如果发现可用的机器人脚本,可以提交至Discord的bot-reporting频道,最高可获得1ETH赏金,按当前市场价计算约合人民币两万余元。
多数项目防范机器人,是为了避免批量账号刷空投资源。Axis Robotics的目的与此不同。
它不需要页面点击量,需要的是真实的人类操作轨迹。签到、关注、转发这类任务中,机器人账号过多只会导致积分贬值,但若操作轨迹(trajectory)数据被机器人污染,低质量样本混入,整个模型训练集都会受影响。
普通项目防机器人是守住空投利益,Axis Robotics防机器人是守住数据质量。机器人模型训练关注的不是点击次数,而是轨迹是否完成目标、动作是否平滑、场景覆盖是否多样、操作对训练是否有价值。
Axis Robotics的积分体系也遵循这一逻辑,官方文档明确,积分综合计算任务量、难度、得分、多样性和推荐量,数量仅占一部分权重,质量和多样性的权重更高。
Physical AI(物理智能)不需要水军,需要真实的人类操作示范。能筛选出真实用户、真实任务和真实轨迹,才能跑通机器人数据层的业务。
判断一个数据平台的价值,标准可以总结为两点:数据有没有人用,用了有没有效果。Axis Robotics目前已有三方面信息可供参考。
第一是使用热度。Axis Franka数据集在Hugging Face上是下载量最高的开源仿真Franka操作数据集,累计下载量超过16万次。
KAIST、西北大学、清华、Yandex、Nota AI、越南邮政电信集团等机构,都使用该数据集开展World Model、WAM和VLA相关训练,数据能进入这些研究管线,说明样本格式、覆盖面和质量都满足基础要求。
第二是训练效果。Axis Dataset V1已经完成验证,确认社区采集、带噪声的仿真数据,可以用于具身预训练。
验证结果显示,经过持续预训练,π0.5在LIBERO-Plus上的成功率从83.9%提升到88.8%。数据量从25%增加到100%,模型成绩依然保持上涨,未出现明显饱和,在传感器噪声、相机偏移的扰动场景中,性能提升更明显。
参与本次验证的团队包括Georgia Tech、UC Berkeley、TAMU、JHU、Penn、UMich、NUS、NTU等。几个百分点的提升算不上决定性突破,但已经将行业讨论从“众包仿真数据是否可用”,推进到“数据量增加到多少才会出现饱和”的层面。
第三是真机迁移效果。Axis Robotics和Dexmal的合作,已经将其定位为VLA与世界模型的数据基础设施。
和Booster Robotics合作的双臂实验结果更明确:仅提供10条真实演示时,实物策略几乎无法碰到目标;补充50条和任务对齐的仿真轨迹后,接触成功率从0/20提升到17/20。完成跨任务持续预训练后,每个新任务仅需要约30条演示,效果就能超过原本用两倍真实数据微调的结果。
仿真数据的作用,是填补真机数据采集范围有限的缺口,不是替代真机数据。
目前这三方面信息,从使用热度、训练提升到真机落地,已经初步验证了Axis Robotics的数据价值。
但仿真数据的信任门槛仍待突破,当任务规模扩大、轨迹数量增加后,性能增益能否维持、是否会出现边际效益递减,是整个行业最关注的问题。
Axis Robotics下一步需要用更大规模的数据解答这个问题,后续进展可以继续观察。
Axis中文社区目前正在举办教程挑战赛,参赛者将操作过程录制成视频提交,有机会获得奖金,作品还可能被官方收录到Discord和YouTube,前三名可获得社区身份晋级奖励。
活动截止时间为9月6日20:00,参赛者需要填写表单提交作品。