文生图模型排行榜更新,分场景排性价比了
我们已经更新了 Artificial Analysis Text to Image Arena,扩展了我们测试的用例和能力范围,从 UI/UX 设计到真人电影,从物理学到文字渲染。
我们更新后的评估不仅会衡量哪个模型整体最佳,还会衡量哪个模型最适合你的具体工作。新排行榜已经上线,投票通道已开启。
文生图模型在过去几年中能力不断提升,从窄领域的单主体渲染,发展到能遵循精细用户控制生成内容丰富的多元素场景,再到现在能渲染精确排版、以及文字与图形交错布局的系统。
广告公司用来做宣传创意的模型,未必适合产品经理用来做 UI 原型,也未必适合游戏工作室用来做概念艺术。如今选择模型意味着你需要根据自己的具体工作在质量上做取舍,而我们更新后的方法正好能解答这个问题。
我们更新后的评估依据一套分类体系展开测量,涵盖 10 种真实用例、9 项模型能力,以及范围广泛的风格与审美。
我们测试的用例包括营销与广告、零售与电商、真人电影、动画与游戏、建筑与房地产、生产力与知识工作、UIUX 设计;测试的能力包括推理、知识、文字渲染、布局、物理、人体解剖学。
我们的整体质量基准现在会在用例和能力之间均匀采样。每个提示词都来自匿名众包数据,由人工整理,每月更新。无法区分模型表现、或是偏离真实使用场景的提示词会被淘汰,我们会在能力前沿加入新提示词,因此榜单能追踪技术前沿,也不会出现过拟合。
以下是我们对 Artificial Analysis 文生图排行榜排名前 10 模型的深度分析得出的初步结论:
➤ GPT Image 2 在所有用例和能力排行榜上都位列第一,但在低价档位情况就不一样了。
➤ Nano Banana 2 在几乎所有场景都是性价比之选,它在动画与游戏、消费端、营销与广告、UI/UX 类别中都排名前三,生成每 1000 张图价格为 67 美元,而 GPT Image 2 是 210 美元。
➤ MAI-Image-2.5 是零售与电商场景最佳廉价选项,在布局能力上表现强劲。
➤ Nano Banana Pro 是真人电影场景的专用模型,是紧随 GPT Image 2(第一名)之后最便宜的模型,它在知识和人体解剖学上的表现也不错。
往下翻可以查看用例和能力的细分结果 🧵
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖