MiniMax发布H3 开源视频模型(35x)
@fal 的 Gorkem Yurtseven 和 Batuhan Taskaya 谈将开源视频模型提速35倍,以及他们建成模型后好莱坞的需求:
上个月,MiniMax 发布了开源视频模型 H3。fal 对它进行了重构——他们削减了模型生成视频的步骤,重写了每个阶段的代码,让 GPU 利用率达到理论上限的70%-80%,而原来通常只有30%-40%。
画质没有任何损失。现在视频生成速度比拍摄还快。
如今模型已经足够便宜、足够快,终端用户已经不再要求这两方面的改进了。差距已经转移到画质,也就是模型遵循提示词的精准度上。
一年前好莱坞还不是 fal 的客户,现在已经成了 fal 增长最快的客户群体。制片厂喜欢它是因为一些小需求:延长镜头、移动机位、调整光照。这些编辑的成功率目前在80%-90%,fal 的目标是达到99.9%。
以下是和 a16z 的 Jennifer Li 的对话时间轴:
00:00 简介
01:45 第一个值得重构的开源模型
03:45 行业在4月遭遇算力枯竭
06:25 不损失画质的前提下提速35倍
11:05 1.5秒生成5秒视频
14:25 那个周末 fal 放下了所有其他工作
16:15 没人计划到的3个爆火项目
18:20 训练视频模型保持记忆一致性
20:25 一小时时长的连贯视频
23:30 三周内使用率达到其他模型的2倍
26:35 免费开放视频模型的理由
29:00 输入Blender草图,输出成片镜头
30:40 追求99.9%的可靠性
34:15 好莱坞,fal 增长最快的客户群体
36:50 为什么制片厂直到现在才愿意接触这个领域
YouTube链接:@gorkem @isidentical @fal @JenniferHli
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖