商汤开源 SenseNova U1.5 多模态大模型
wok??这居然是商汤的官方账号??
刚刚,商汤正式发布并开源 SenseNova U1.5。
这是一个原生统一多模态模型,一个模型内直接覆盖视觉理解、图片生成、图片编辑。这次重点把生成和编辑能力拉了上来。
支持原生 4K 图片生成,可以处理复杂构图、多主体、数量关系、风格和 Layout,对中文、英文文字生成也专门做了强化。
比较有意思的是编辑。U1.5 支持直接通过 Bounding Box、视觉 Marker、多张参考图 去指定修改区域和参考对象。比如框住图片里一个东西,让它只改这里,同时尽量保持其他区域不动。
官方 Benchmark 里,它在长文本生成、信息图和复杂 Layout 上已经开始和 GPT-Image、Gemini、Seedream、Qwen Image 这些大模型放在一张表里打了。LongTextBench 中文达到 98.9,BizGenEval Hard 51.4,IGenBench Q-acc 61.9。
而且这次直接开源,Apache 2.0。
但是有个点需要注意一下,官方名字叫 SenseNova-U1.5-8B-MoT,这里的 8B 并不是整个模型只有 8B 参数。它大概是 8B 视觉理解 + 8B 图像生成,Hugging Face 显示总参数量约 18B。
另外商汤还一起放出了 8-step LoRA,后面甚至准备继续公开从 SFT、RL 到 MOPD 的完整训练 Pipeline。
现在国产开源图像模型越来越有意思了。
前面大家还主要卷「文生图效果」,现在已经开始卷 统一理解 + 生成 + 精确编辑 这一整套工作流了。
看起来效果不错,差不多是nanobanana1.0的水平?