李飞飞创办的World Labs发布Atlas多模态世界模型
🚨李飞飞创办的 World Labs 发布了世界上第一个多模态世界模型。
今天, @drfeifei 创办的 @theworldlabs 正式发布 Atlas,官方称它是世界上第一个多模态世界模型。
Atlas 最核心的变化,是它不再把视频理解成单纯的一串像素。
这个模型从头训练,原生处理文本、图像、视频、相机位姿和 3D 深度信息。
它会把所有输入放进一个统一的 3D 空间上下文里,再预测接下来应该看到什么。
所以你给它一张照片,可以直接移动虚拟相机,绕到照片里根本没有拍到的位置,Atlas 会一边补全整个世界,一边保持场景的空间一致性。
而且相机不是输入一句 push in、pan left 这种模糊指令。
Atlas 直接把相机几何作为模型输入,可以指定精确的位置、角度和运动轨迹。World Labs 称之为 pixel-perfect camera control。
目前可以: - 用 1-6 张参考图生成最长 1 分钟、1440p 的连续视频 - 从一张到几十张照片重建整个空间 - 输出新的任意视角画面 - 直接生成 Point Cloud 和 3D Gaussian Splat - 从视频恢复空间,同时模拟空间随时间发生的变化
还有一个我觉得比视频生成更值得关注的用途:机器人。
以前要给机器人搭一个真实环境的数字孪生,往往需要专门的扫描设备。
World Labs 展示的案例里,只用手机拍一段视频,抽取 24 帧,Atlas 就能重建一个大型真实环境。
随后机器人在这个虚拟环境里走任何轨迹,Atlas 都可以生成机器人摄像头本应看到的 RGB 和深度数据。
甚至物体移动、机械臂操作、光照、背景都可以继续变化,用来批量生成机器人训练和测试数据。
Atlas 是一个 multimodal autoregressive diffusion transformer。
它一半很像 LLM,自回归地不断预测下一个空间状态;另一半又像扩散模型,负责生成高质量图像和视频。
World Labs 还专门展示了 scaling 结果:随着训练算力增加,模型能力仍然持续提升。
他们似乎证明了世界模型存在自己的 Scaling Law。
这也解释了为什么李飞飞一直说,Spatial Intelligence 会是 AI 的下一个前沿。
LLM 学的是语言世界里的规律。
Atlas 想学的是一个更麻烦的东西:
空间长什么样、相机移动以后会看到什么、物体怎么运动,以及世界下一秒会发生什么。
Atlas 目前还没有全面开放,只向少数合作伙伴提供 Early Access,之后也会成为 World Labs 旗下 Marble 的底层模型。
看起来非常不错啊!