AI Pulse
📡 X 信号

观众发弹幕就能改直播画面,MiniMax做到了实时视频生成

观众发弹幕就能改直播画面,MiniMax做到了实时视频生成

观众在直播聊天室发弹幕就能修改直播画面,英文指令“切到街头”能让画面从动画场景直接切换成城市街景。西班牙语的“60年代木偶广告”和日语的“机器人脸上缠满电线”,不同语言的指令也都被准确响应,生成了对应风格和内容的画面。

这不是提前录制的演示视频,是一场真实的实时直播,支撑这种玩法的是MiniMax H3 Max视频生成模型。根据公开数据,它生成5秒768p分辨率的视频耗时不到3秒,生成15秒视频大约需要15秒,上一段视频播放结束时,下一段视频已经生成完成,几乎没有等待间隔。

开发者Pieter Levels搭建了一个24小时AI直播网站,首页只有一句话“由聊天决定接下来播什么”,没有导演,观众就是内容编剧。直播内容可以随时根据弹幕切换,从动画切到真人访谈再切到风格荒诞的广告,全程由观众的指令决定走向。

以往视频生成模型都定位为离线内容工具,用户输入提示词生成视频后再进行剪辑发布,生成速度不影响最终成片质量,速度快慢只影响制作效率。但实时直播改变了这个逻辑,生成速度不再只是效率指标,而是产品能否使用的基础门槛,如果生成5秒视频需要10秒,直播就会卡顿,直接破坏观众体验。

H3 Max把生成时间压缩到3秒以内,还能为排队审核、编码推流留出额外时间,这已经不是简单的参数提升,而是应用逻辑的改变。视频生成从此前离线的生产工具,变成了可以持续运转的实时内容流。Pieter Levels的这场直播在X上获得了近350万次观看,证明观众愿意参与这种实时共创的内容形式。

技术层面,H3 Max有两条优化路径都指向提升生成速度。一条是fal完成的后训练与推理优化,在开源版H3的基础上添加新数据与可验证强化学习,吞吐量达到原版的35倍。另一条是FastVideo实现的稀疏化加速,把原本49次Transformer前向传播压缩到4次,结合稀疏度90%的VSA,单张Blackwell GPU最高可以实现14倍加速。

两条优化路线都以实现实时可用为目标,没有追求更高跑分或者更好画质,只为让生成速度能够接入直播流。H3开源三个多星期,下载量已经超过2400万次,衍生出的模型超过300个,能看出AI开发社区对这个方向兴趣浓厚。如果大量衍生模型都选择优先优化速度而非画质,说明开发者已经意识到,实时场景会是视频生成下一阶段的竞争核心。

想要尝试这个方向,可以先不用直接搭建24小时直播,先用H3 Max的API做一个5分钟互动测试,验证观众发出的多条指令都能被响应,同时保证画面的连贯性。如果基础测试都无法顺利运行,直接做24小时直播会出现很多问题。另外可以关注FastH3的开源权重,如果单张Blackwell GPU实现14倍加速的效果能够复现,部署成本会降低很多。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新