阿里通义千问刚开源了一个能打平闭源的图像生成模型
有人刚为了生成透明图层的商品图,花了小几百买了闭源AI画图的月度会员。
现在,这条花钱的路径多了一个免费的替代选项。
阿里巴巴通义千问团队刚刚发布了Qwen-Image-2.1,这是一个开放权重(可以免费下载运行)、同时支持图像生成和编辑的AI模型。
和上一代Qwen-Image-2.0不同,这次它采用允许商业使用的Apache 2.0协议,任何人都可以免费下载、修改甚至用于商业项目。
它采用70亿参数的轻量架构,也就是模型体积不大,官方称性能优于大多数闭源图像模型,还大幅加快了多图输入的推理速度。
除了基础的生成和编辑,它还支持原生生成和编辑RGBA透明图层(就是可以保留图片中物体的透明背景,方便抠图和拼接),最多能同时处理10张参考图,还支持用标记引导局部修改。
@VaibhavSisinty 认为:阿里巴巴开源的这个70亿参数图像模型,表现超过了大多数闭源替代方案。
@NVIDIARTXSpark 认为:这是开源图像生成模型向前迈出的一大步,可以在NVIDIA DGX Spark、RTX显卡和DGX Station上本地运行。
需要注意的是,目前「优于大多数闭源模型」的结论仅来自通义千问团队自有基准测试,还没有独立第三方测试结果验证这一说法。
对喜欢玩AI画图的普通人来说,这意味着不用再依赖在线服务,也不用花大价钱买闭源会员,就能在自己的电脑上运行一个功能完整的图像AI。
做电商设计、自媒体配图或者爱好创作的人,可以直接用它生成透明图层的素材,修改参考图的局部细节,甚至基于多张参考图创作新图,所有操作都可以本地完成,不用担心素材泄露,也不用按次付费。
对中小开发者和创业团队来说,符合Apache 2.0协议的开源模型意味着可以直接基于它做二次开发,不用承担版权风险,也不用支付高额的模型授权费。
原来闭源图像模型才有的功能,现在轻量开源模型也开始追上了。下一个会被开源追上的,是哪些原来只有闭源AI才能做到的事?