AI Pulse
📡 X 信号

重金采AI训练数据,半年后可能就没用了

重金采AI训练数据,半年后可能就没用了

AI 数据赛道有一个很容易被忽略的风险: 不是采不到数据,而是你今天花重金采集的数据,半年后模型可能已经不缺了。@axisrobotics 最近在 BASECAST 采访里提到的 “hybrid data advantage”,我觉得比单纯强调数据规模更值得关注。目前,机器人训练数据主要有三条路线: 真机遥操作最接近真实机器人,数据精度高,但成本高、速度慢,而且往往与某一种硬件深度绑定。

仿真数据可以大规模并行,场景、参数也更容易调整,但始终绕不开 Sim-to-Real 的现实差距。第一人称数据最容易放大规模。普通人拿一部手机,就能记录做饭、整理房间、使用工具。

但人类动作如何转化成机器人真正能够执行的轨迹,目前仍然有很多问题没有解决。三种路线都有价值,也都有明显的短板。Axis 的思路不是押注其中一种最终会通吃,而是把相对稳定的能力沉到更底层: 贡献者网络、任务管理、数据验证,以及清洗、增强和处理管线。

在这套基础设施之上,再根据模型当下真正缺什么,灵活切换仿真数据、第一人称数据、真机遥操作,或者 post-training 数据。我觉得这是一个很现实的设计。Physical AI 还远远没有形成最终范式。

今天大家都在抢第一人称数据,半年后模型最缺的,可能已经变成失败恢复轨迹,或者某一种特定机器人的操作数据。如果一家公司只绑定一种采集方式,行业方向一变,可能不只是数据过时,而是整套生产体系都要推倒重来。所以,未来真正的���垒未必是谁的数据仓库最大。

而是谁能在模型需求发生变化之后,最快决定下一批应该生产什么数据,同时不需要重建贡献者网络和处理管线。不押某一种数据。押的是持续生产“正确数据”的能力。

这可能才是 @axisrobotics 所说的 hybrid data engine 真正值钱的地方。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新