AI Pulse

新模型一次生成带原生立体声视频,价格不到主流模型一半

新模型一次生成带原生立体声视频,价格不到主流模型一半

MiniMax发布了新一代多模态生成模型H3。

它把文本、图像、视频、音频放进同一个上下文里理解,然后一次性生成带原生立体声的视频。最长15秒,默认2K分辨率。

过去做一条带声音的视频,画面和声音是两条线,最后手动拼起来。H3把这几步合成一步。官方给的示例指令是:“参考视频1的希区柯克式镜头运动,让图像2中的角色唱歌,歌声要匹配音频3的声线。”模型得同时理解三段不同媒体的输入,再吐出一段完整的视频。

这是H3和前两代的分水岭。MiniMax之前做过Hailuo 01和Hailuo 02:01从零搭系统,02改进架构效率和数据质量。到H3,设计原则变成“统一和泛化任务,打破图像、视频、音频之间的界限”。

H3在早期测试里已经能扛商业内容创作。擅长三件事:指令跟随、准确的文字和品牌渲染、V2V运动迁移。

“准确的文字和品牌渲染”就是说画面里出现的文字不变形、不拼错。广告物料和品牌视频最吃这个。V2V运动迁移,是把一段视频的运动方式搬到另一段视频里。

H3预设的落地场景有电影片头、产品网站、动画海报、广告和电商。对做广告和电商的人来说,流程本来是这样的:先拍素材、再剪辑、再加特效。现在用自然语言描述创意,模型直接给可用的视频素材。

价格是H3最直接的卖点。默认输出2K。官方给的价格对比:2K分辨率下,每秒价格不到主流模型的三分之一。768p下,不到主流模型720p价格的一半。

价格能压下来,靠两项技术。

第一项是新的VAE压缩结构。它把之前的tokenizer整个重写,重建质量和可学习性都更好。高压缩比带来4倍有效序列长度增益,训练和推理成本大幅下降。原生2K分辨率也是靠它。

第二项叫In-Context Regeneration。H3的基础模型会在上下文里重新生成自己的低分辨率输出,不走传统的专用超分辨率模块。这样能恢复小文本和精细细节,传统超分对这些只能靠猜,还经常猜不回来。

开源方面,MiniMax计划近期把H3的模型权重开源,具体时间要看法律法规。硬件兼容性从设计初期就是关键考虑。

开源意味着开发者能拿到权重,在本地或自己的硬件上跑,还能改出定制版本。目前还不清楚开源许可证类型、是否允许商用、能不能跑消费级GPU。这些事直接决定谁能真正用到它。

技术上走到这一步是要付出代价的。H3放弃了Hailuo-02架构——它以前带来过明显的架构优势。但为了任务泛化,那个架构反而会引入不必要的复杂性。

H3改用分离理解和生成工作负载的训练架构,端到端训练吞吐量提升近30%。

标注管道同样烧钱。大多数源材料需要约100K token的推理,蒸馏后平均只剩约4K token。每推进一代,工程复杂度大约增长10倍。

H3还没到完全收官。视觉细节在部分场景下还能改进,MiniMax会继续追更高分辨率和视觉保真度。模型规模也还有提升空间,扩展是明确路径,更强的任务泛化会释放潜力。下一代H系列会整合M系列模型的能力,增强多模态理解。

MiniMax的长期愿景是“智能与每个人同在”。从价格、开源计划到创作门槛,H3都在往这个方向走。

阅读原文
📚 相关主题 开源多模态

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部