AI Pulse
📡 X 信号

阿里巴巴通义千问发布第三代图像生成模型Qwen-Image-3.0

🎨 来认识 Qwen-Image-3.0 —— 我们通义千问的第三代基础图像生成模型。

如果说 1.0 的核心是「精确」,2.0 新增了「多样、完整、美观、真实」,那么 3.0 可以归结到一个词:实。「实」体现在三个维度:

📓� 丰富内容 —— 支持最长 4.5k token 的提示词。一次生成即可输出复杂排版:报纸、分镜、试卷 —— 甚至是 3×3 的信息图网格,或是画中画中画的UI界面。

🔬 细节真实 —— 小到 10px 的文字都清晰可辨,整页完整 LaTeX 论文,毛孔、发丝,还有接近摄影级的皮肤纹理都能还原。

🌏 深度知识 —— 原生支持 12 种语言渲染,100 多种艺术风格,真实的界面(网页/游戏/直播),还内置世界知识与实时网页检索。

不只是「好看」—— 它真正好用。图像生成在这里是真正能提升生产力的工具,适用于设计、内容创作、教育与电商领域。快去创作吧 🏃🎨

💬Qwen Chat: 📝Blog:

横向铺展能力体现了模型在语义并列与空间控制上的实力——能在单张图像内排布多个概念,互不干扰。仅用 3.7k token,模型就渲染出一张横跨 9 个领域的 3×3 信息图:隧道安全漫画、空间几何、《出师表》文体分析、抛体运动、寄生虫学、胸痛诊断、Sylow 定理、银行内控、DNA 结构——每个格子的文字与图像都精确无误。

除了横向铺展,深度是丰富内容的另一项核心特质,考验模型的语义拆解与逻辑嵌套能力:在单张图像中逐层渲染多个嵌套界面。下方示例用一条指令就完成了从外到内的呈现:VSCode → Qwen Chat → 聊天应用 → 手冲咖啡海报。每一层都保留了对应界面的真实风格,形成了「画中画中画」的视觉深度。

细节真实与深度知识也是本次发布的重大升级。二者结合让 Qwen-Image-3.0 在高价值生产力场景实现了真正的突破:报纸PDF、短剧分镜、复杂UI等等。

随着图像生成技术不断进步,我们相信它将在设计、内容创作、教育、电商以及更多领域释放真正的生产力价值。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部