AI Pulse
📡 X 信号

Sol-H3推理比视频播放还快,5秒内容1.65秒生成

Sol-H3推理比视频播放还快,5秒内容1.65秒生成

🚀 Sol-H3:@MiniMax_AI 的 H3 视频生成快于播放速度 🤩

五秒的世界,1.653 秒推理完成。我们发布了 Sol-H3,这是迄今为止我们最快的端到端 MiniMax-H3 推理栈。在单台 8× NVIDIA B300 Blackwell 系统上,它能在 1.653 秒内生成五秒长、分辨率 1344×768 带立体声音频的视频。

在 1×、4× 和 8× B300 上,Sol-H3 对比 Base H3 最高实现了 15.54× 加速。在相同的 8× B300 系统上对比 50 步的 Base H3 Dense,四步配置的 Sol-H3 实现了:
• 5秒:18.250秒 → 1.653秒(11.04×)
• 10秒:50.660秒 → 3.732秒(13.57×)
• 15秒:99.513秒 → 6.612秒(15.05×)

Sol-H3 还可随 GPU 数量扩展:
• 4× B300:生成 5秒/10秒/15秒视频耗时 2.918秒 / 6.993秒 / 12.542秒(加速比 12.11–15.54×)
• 1× B300:生成 5秒/10秒/15秒视频耗时 13.745秒 / 37.813秒 / 52.260秒(加速比 9.45–14.29×)

所有数据都是经过一次预热后,三次测试结果的中位数,测试条件为分辨率 1344×768、帧率 24 FPS、带立体声音频。Base H3 使用 50 个调度点(49 次 DiT 前向传播);Sol-H3 使用四次 DiT 前向传播,所以这是完整配置对比——不是仅改变注意力机制运行时的测试。

Sol-H3 在 1× B300 上使用 Dense 注意力,在 4× / 8× 上使用带 INT8 QKV / FP8 输出传输的 SOL。计时包含文本编码、DiT 去噪以及视频/音频 VAE 解码;不包含模型加载、编译预热以及最终 MP4 编码。

Sol-H3 将 Sol-Engine × Sol-Attn 整合进一个全栈运行时:
• 无需重新训练的动态稀疏注意力
• 融合了 norm、RoPE、MLP 和稀疏注意力设置
• 跨 8 卡融合 INT8 QKV / FP8 输出通信
• 并行批量 VAE 解码
• 预计算 AdaLN 缓存

栈内优化:
• 稀疏注意力设置:1.206 → 0.285 毫秒(减少 76.4%)
• VAE 解码:7.55 → 0.602 秒
• 每张 GPU 释放约 24 GB 显存

任何 MiniMax-H3 少步 LoRA 都可以接入这个引擎,代码遵循 Apache 2.0 许可,方便部署。

对我们来说,更大的里程碑是完成了从「快速生成」到「生成快于播放」的跨越。这为持续 24 FPS 生成和真正的交互式视频系统开辟了道路。我们很高兴能与 @reactorworld 合作发布 Sol-H3,并在发布首日就开放 API 调用。立即前往 Reactor 体验:

团队协作成果,完整贡献名单见博客。@shanasaimoe @lawrence_cjs @yitongli165665 @haopengl33 @HaochengXiUCB @songhan_mit

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新