开源Minimax H3文生视频,赢了Grok Imagine
Grok Imagine 又再次落后于开源模型了,它还有一段追赶的路要走。
左边是 Minimax H3,一个免费的可开放权重模型,只用提示词生成一次就出图,没有刻意挑选结果。右边是 Grok Imagine,还是从三次生成结果里挑了最好的一次出来。两者我用了相同的提示词,相同的720p分辨率,生成的文生视频长度都是10秒,动作质量的差异非常明显。
Minimax H3 拥有真实的比例和速度感,动作也相对连贯。它不算完美,但观感已经很不错。自行车进入自动驾驶,女赛博特工解决掉前方的敌人,子弹从她防弹身躯上弹开……整个内容放在赛博朋克科幻背景下是合理的。
Grok Imagine 反而有种“慢半拍”的感觉,视频的剪切和转场完全不合逻辑。声音和动作物理感都很飘。
Grok 赢过的一点是逐帧画质更好,Minimax H3 视频中间的静帧会模糊或者发虚……但这毕竟是视频。我宁愿要更好的动作,也不要清晰的图片。
Grok 的另一个优势是生成速度非常快,Minimax H3 生成一个视频的时间里,Grok 能生成十个。但就算是这个速度优势,随着自强制 LoRA 推出,生成视频所需的步数减少,差距很可能也会缩小。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖