博主实测两款AI视频模型 公平对比差异
现在所有人都在聊AI视频模型,但老实说,网上大多数“对比”根本就不是真正的对比。一个视频用了不同提示词,有人调了设置,有人剪掉了不好的片段,然后人们就直接判定哪个模型更好?我一直觉得这不对劲。
所以我用测试正经工作工具的方式测试了 HappyHorse 1.1 和 Kling 3.0:相同的提示词,相同的参考图,相同的时长,也没有剪辑去掩盖缺陷。我不是要证明某个模型全面领先,我只是想看看两者面对完全相同的挑战会各自表现如何。
1. 唇形同步与语音
这个很好判断,不需要逐帧分析,只要并排看两个视频就够了。嘴巴动作和说的话对不对得上?时间节奏是不对还是自然?特写镜头下表情能保持一致吗?这虽然是小细节,但能很快告诉你很多信息。
2. 角色与场景一致性
这部分就很有意思了。现在拍出一帧好看的画面不难,难的是在多个镜头中保持角色外观一致。我给两个模型都用了相同的多视角参考集,观察它们如何处理场景变化:人脸、衣服、道具、角色站位,全部都检查了。
HappyHorse 1.1 在这一块的一致性明显更强。有一个很突出的例子:在一个撞车场景中,角色受伤倒地,乍一看差异并不明显,需要仔细观察才能发现。HappyHorse 里角色始终保持反应状态,抬起手,血迹可见,表情依然“鲜活”,就像他真的在对刚发生的事做出反应。而同一时刻 Kling 3.0 里的角色是躺着不动的,没有可见的动作或反应。
这个差异很细微,但它是逐帧(而不仅仅是镜头间)保持逻辑和一致性的真实案例。
3. 复杂动作
这一步我没有偷工减料,我想要的是连续运动。体育动作、舞蹈、快速动作——这些内容能真正体现模型是否理解重量、动量、平衡,以及身体运动后如何恢复。这类镜头能暴露出静态画面中你绝对发现不了的问题。并排连续观看两个视频,比任何文字描述都能告诉你更多信息。
4. 机位控制
两个模型都拿到了带时间戳的相同分镜和相同机位指令,然后我只需要观察它们是否真的遵循了指令。举个很好的例子:推镜、环绕、升机、拉镜,一镜到底。
仔细看你就能准确发现,哪个模型在某个时刻跟丢了主体,或是运动变得怪异,而另一个模型则全程保持在正确位置。这基本上就是一个能直接用的镜头和需要重新生成第五次的镜头之间的区别。
5. 价格与工作流
只有在对等条件下对比价格才有意义,相同输出、相同时长、相同质量和分辨率、相同数量的生
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖