能生成带声音视频的AI模型开源,但别急着跑
8月3日,MiniMax H3 的权重出现在 HuggingFace 上。这个模型在同一个前向过程里生成视频和原生立体声音频,音频还能反过来驱动画面生成。测试者说,这种音频驱动视频的模式,此前从未在开源权重里见过。
规格上,H3 支持 2K 分辨率、24 帧每秒、5 到 15 秒的片段。单次生成可以输入 9 张参考图、3 段视频、3 段音频片段,加上文字描述。文本、图像、视频、音频共用同一个上下文。
权重开放不等于体验顺畅。在消费级 GPU 上跑,迭代速度很慢。每次失败的生成,都搭进去实打实的时间和电费,而且还得重来。运动一致性比预期好,但复杂的镜头移动、较长的片段,仍要多次尝试才能得到满意结果。
先云端试,再本地跑
APOB AI 正在免费且无限量地自托管 H3,前提是权重开放。一种省时的工作方式开始成形。先在托管平台上测出哪组提示词和参考图能出干净结果,再回到本地硬件上做完全控制或自定义的运行。
另一条路:Seedance 2.5
7月31日,字节跳动发布了 Seedance 2.5。它单次生成能到 30 秒、4K 分辨率,同样带原生音频,支持 50 个多模态参考。它还能做区域级编辑,只修画面的一部分,不用重生成整段。但它仅通过 BytePlus ModelArk 提供 API,没有发布权重。想跑在自己机器上,H3 是唯一的选择。
测试者说,开源权重视频生成到这个质量水平,是本地推理的一个里程碑。有评论者把它比作一款 3A 大作开放了源码。16GB 显存的 3060 Ti 就能以合理速度运行,大约每秒 15 个 token。另一个评论者说,原本 10 多步、带多个人工审核节点的 AI 视频工作流被压成了 3 步。脚本先交给 agent 讨论,再批量生成 0.2MP 样片。通过后生成 3 段 1MP 成品,最后人工挑选定稿。全程跑在自己的 5090 上。
有人问 RTX 3090 上能跑多快,也有人问双 5090 能不能用。