AI Pulse
📡 X 信号

@ArtificialAnlys发布AA-Video-T2V v2.0 基准测试(v2.0)

@ArtificialAnlys发布AA-Video-T2V v2.0 基准测试(v2.0)

我们推出全新文生视频模型评估基准 AA-Video-T2V v2.0,同时推出适用于无音频视频生成的 AA-Video-T2V-Silent v2.0。

它基于全新方法构建,会针对 1080p 分辨率下的所有模型,使用定期更新的提示词集进行评测,并围绕 10 个用例、10 项能力和广泛风格对模型排名。

目前视频模型已经被更多行业和工作流采用,从电影工作室到广告公司都在使用。我们这个全新基准不仅会给出模型的总排名,还能展示哪个模型最适合特定用例和特定视频生成能力。

用例的划分基于消费者和企业实际使用视频生成工具的场景。能力项的划分参考了实验室和学术研究,同时也参考了创作者和企业当前对视频模型的使用需求。

我们会给每个提示词打上用例标签(比如真人电影和营销广告),以及它测试的能力标签(比如文字渲染和音频同步),整个基准在两个维度都进行了均匀抽样。

因此,总排名能反映模型在不同用例中的通用性,以及在各项能力上的全面性。我们还会给每个提示词打上视觉风格标签,比如照片写实、3D 渲染、卡通动漫和手绘插画。

AI 视频如今也开始进入更大的屏幕和生产流程,从微短剧到电影院;同时生成门槛降低也导致低质量 AI 视频内容泛滥。质量要求不断提高,因此我们现在所有片段都按 1080p 分辨率和高码率评测。

本次推出的 AA-Video-T2V v2.0 包含超过 6.8 万条高质量人工偏好投票,这些投票来自英美私有评估者,覆盖 1000 个提示词;AA-Video-T2V-Silent v2.0 包含超过 4.7 万条投票,覆盖 500 个提示词。

下面是我们对 Artificial Analysis AA-Video-T2V v2.0 排行榜排名前十的模型进行深度分析得到的初步结论:

➤ Wan 3.0 总排名第一,在 20 个分类榜单中领跑 10 个,包括卡通动漫风格和动画游戏用例,价格是每分钟 12 美元。

➤ Dreamina Seedance 2.5 排名第二,是人体表现专项模型,在人体结构和对话唇音同步两项均排名第一。它的价格是每分钟 34.12 美元,是前十名中最贵的模型。

➤ MiniMax H3 (768p) 排名第三,统计数据和 Seedance 2.5 接近,价格为每分钟 4.80 美元,约为前者的七分之一。它同时也是文字渲染项排名第一的模型。

➤ FLUX 3 排名第四,最强项是文字渲染(第三)和对话唇音同步(第二)。

➤ Gemini Omni Flash 1.1 排名第五,是二维图形和音频专项模型,在UI/UX 与动效设计用例、扁平化设计风格和音频同步能力三项均排名第一。

下文将展开用例、能力和风格的细分结果 🧵

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新