开源AI天气模型跑进普通电脑:24小时预报不到30秒
ECMWF 的 AIFS、微软的 Aurora,在 Hugging Face 上公开了权重。Google DeepMind 也开源了 WeatherNext 2。这些模型比传统物理模型快得多,消耗的资源也少得多。天气预报正在从超级计算机的专属领地往普通电脑上挪。不过开放权重不等于容易运行——计算、存储、带宽,三关都要过。
AI 天气模型是什么
这类模型跟聊天机器人在原理上有相通之处。它们是神经网络,训练目标是预测大气未来的状态,方式跟大语言模型预测下一个词类似。输入是地球表面网格点的温度、风速、湿度等变量,多数模型用 0.25° 网格。输出是未来某一时刻的三维大气状态。要预测更远,模型就把自己的输出喂回去,自回归地迭代。底层用的也是熟悉的构件——神经元、激活函数、注意力层,只是把文本换成了网格数据。
开放权重不等于容易运行
开放权重降低了获取门槛,但运行还有三个障碍。
计算上,AIFS 依赖 flash attention,只支持特定 GPU 架构。存储上,下载一次预报数据不难。但要回测一整年的数据,大约需要 360GB 磁盘空间,还没算输出。带宽往往是第一个瓶颈——一次典型预报需要约 1GB 的初始条件数据。
普通电脑能跑起来
Hugging Face 和 Earthmover 搭了一个演示空间,浏览器里就能跑通全流程。初始数据从 Earthmover 拿,模型在 Hugging Face Hub 上跑。最后和 ERA5 再分析数据对比。端到端的 24 小时预报,不到 30 秒。
回到自己的机器上,没有 GPU 也能跑。Aurora 在 CPU 上每步需要 2 到 3 分钟,在 GPU 上几秒完成。注意它不支持苹果的 MPS 加速。每个前向传播预测一个 6 小时步长,4 步是 24 小时预报,28 步是 7 天预报。权重以 MIT 许可证发布,可以自由运行、微调、构建。
初始数据
Earthmover 用了一套流式方案。它用 Zarr 格式存天气数据,把大型数组拆成许多小块的独立存储单元。配合 Icechunk 的事务性存储层,可以流式读取数据。不用下载整个文件,就能提取需要的变量。Earthmover 的数据市场里共有超过 60PB 的分析就绪天气、气候和地球观测数据。
用于初始化的 ERA5 数据集逐小时记录到 1940 年。它既能初始化模型,也能验证预报。Earthmover 免费提供 ERA5 数据,免费计划滞后 3 到 6 个月。付费计划能拿到 6 天前的数据,要做接近实时的预报,得用付费数据。ERA5 里没有的静态变量,比如土壤类型,得从 Hugging Face Hub 单独下载。这些变量必须和训练时完全一致。
成本与硬件
本地硬件不够,可以按分钟租 Hugging Face Jobs 的计算资源。A100 每小时 2.5 美元。任务只在运行时计费,构建或失败阶段免费。预测结果可以存到 Hugging Face 存储桶(免费 100GB)、AWS S3、Cloudflare R2 或 GCS。
对没有 GPU 的人来说,用 CPU 跑 Aurora 足够尝试。24 小时预报大约需要 12 分钟。
更简单的未来
目前的流程仍然需要一定的动手能力。Hugging Face 正在把天气模型集成进 transformers 库。集成后依赖更少,还可以用 transformers.Trainer 直接微调。Google 的 WeatherNext 2 也在集成清单上。目标是简化推理,并且支持在 Hugging Face Jobs 上直接微调。
这些模型的权重都在 Hugging Face Hub 上:ECMWF AIFS、微软 Aurora、NVIDIA Atlas、NVIDIA FourCastNet、Prithvi。跑起来的门槛还在,不过已经在往下降。