MiniMax AI 开源 H3 视频生成模型生态
开放权重。共享进展。MiniMax H3 进展神速。
我们为视频生成构建了 H3,支持原生立体声音频和多模态参考控制。开源社区正在让这一能力变得更快、更易用,也更易于在此基础上开发。
近期亮点:
• FastH3 —— 由 FastVideo、Nuva Lab 和 NVIDIA 开发:4步蒸馏,现已可在 DGX Spark 和 Apple Silicon 上运行。
• Sol-H3 —— 由 NVIDIA 的 SANA 团队开发:在 8×B300 上,以团队的预热推理基准测试,生成15秒 768p 视频+音频仅需 6.6 秒。*
• VDN —— 由 Haocheng Xi 和 OpenVDN 团队开发:重新思考注意力机制以实现更快的 H3 推理,已发布权重、训练和推理代码。
• PDD —— 这是 NVIDIA 的蒸馏方法,由阿里巴巴 PAI 以 8步 Acc-LoRAs 形式适配到 H3,现已在 ComfyUI 中支持。
• LightX2V —— 4步和8步 Turbo LoRAs,支持文本、图像和参考条件生成视频+音频的工作流。
每一个发布的背后,都有人在训练、优化、量化、测试和分享。
特别感谢:
@haoailab @nuvalab @NVIDIAAI @xieenze_jr @HaochengXiUCB @ArashVahdat @julberner @LightX2V @ComfyUI
也感谢推动这项工作前进的个人贡献者:
@haozhangml @cxlcl1 @lawrence_cjs @yitongli165665 @haopengl33 @songhan_mit @shanasaimoe
感谢你们与 H3 一同开发,帮助让它对社区来说更快、更易用、更有用。
当我们共同构建时,强大的模型才能走得更远。继续推进 H3 吧。非常期待看到接下来的进展。🚀
探索生态:
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖