7月21日消息,阿里发布第三代图像生成基础模型 Qwen-Image-3.0。新模型最大输入长度从上一代的 1k Token 扩大到 4.5k Token,可一次生成涵盖公式符号、几何图形、逻辑推导步骤等多元素融合的知识图解和复杂 UI 界面,同时支持 12 种语言和 20 多款字体的原生渲染,10 像素小字可精准辨认。模型已在千问 Chat 端上线,API 版本 qwen-image-3.0-pro 通过阿里云百炼平台以邀测形式开放。权重暂未开源。
这次发布的核心信号不在于画质提升,而在于定位转移。Qwen-Image-3.0 官方博客将自身能力归纳为三个"实"——内容丰实(Rich Content)、细节真实(Authentic Details)、知识厚实(Deep Knowledge),明确将图像生成从创意工具拉向生产力场景。在当前 GPT-Image-2 占据图像生成领域综合排名第一的格局下,阿里选择的竞争切面不是正面追赶通用画质,而是押注信息密度和复杂排版。
4.5k Token 输入改变了提示词的使用方式
Qwen-Image-2.0 支持最长约 1k Token 的指令输入,3.0 将这一上限提升至 4.5k Token。据新浪科技转述官方材料,这意味着用户可以像给设计师写需求文档一样完整描述画面结构、文字内容、视觉风格和排版细节,而不必将需求压缩成一句提示词。
官方演示中展示了用约 3.7k Token 的单条指令生成九宫格知识图解的案例,包含 9 种不同领域内容。模型还支持多层 UI 嵌套生成——据官方材料描述,输入涉及 VSCode 界面、千问 App 界面、聊天窗口和咖啡海报的多层包含关系时,模型能依次准确生成各层界面。这些案例均来自官方挑选的演示样例,实际使用中的稳定性和成功率有待社区实测验证。
文字渲染和微观细节是官方重点强调的方向
Qwen-Image-3.0 官方博客将自身能力归纳为三个方向——Rich Content(内容丰实)、Authentic Details(细节真实)、Deep Knowledge(知识厚实),将图像生成的定位从创意工具拉向生产力场景。
据官方材料,模型支持 LaTeX 公式、上下标、手写批注和密集报纸排版的精准渲染,最小可辨认文字低至 10 像素。官方演示场景包括古碑拓片、报纸版面、数学试卷等高文字密度内容,以及人像摄影中毛孔、发丝等微观细节的还原。新浪科技在转述中提到,模型在官方演示中对 GPT-Image-2 擅长的直播间页面也能生成。
文字渲染能力是当前图像生成领域的核心竞争维度。GPT-Image-2 凭借图内文字的准确性和复杂提示词的遵循能力,在 Artificial Analysis Text-to-Image Arena 等第三方排名中位居前列。Qwen-Image-3.0 是否足以改变现有排位,需要等待独立评测数据。
从开源到闭源,Qwen-Image 系列正在转向商业化
Qwen-Image 系列的迭代历程反映了阿里在这条产品线上的路线变化。2025 年 8 月发布的第一代模型参数规模 20B,以开源形式发布,进入 Artificial Analysis Image Arena 排行榜前十。2025 年 12 月的 Qwen-Image-2512 版本继续开源。
转折出现在 2026 年初。据 DataLearnerAI 报道,2.0 版本将生成和编辑能力合并为单一模型,但不再开源。此后 2.0 系列通过阿里云百炼平台持续发布快照更新(据百炼平台记录,快照日期分别为 3 月 3 日、4 月 22 日、6 月 22 日)。3.0 延续了闭源路线。
从开源到闭源的转变意味着阿里将 Qwen-Image 从社区型技术资产重新定位为商业化产品。多语言产品海报、影视短剧分镜、商业素材批量生成等场景是官方材料中明确提及的目标市场,但具体的 API 定价尚未公布。
官方演示不等于实际可用性,独立评测是下一步关键
Qwen-Image-3.0 的发布材料展示了大量高信息密度的图像样例,但均为官方挑选的最佳结果。在独立评测和社区大规模实测出来之前,有几个能力边界需要保留判断。九宫格和多层 UI 嵌套生成的单次成功率直接影响实际生产效率。12 种语言文字渲染在非中英文场景下的实际表现通常是图像模型的薄弱环节。与 GPT-Image-2 等模型的真实差距需要 Artificial Analysis Arena 等第三方基准更新后才能判断。千问 Chat 端已可直接体验,社区实测数据预计短期内会大量出现,届时上述问题将得到更清晰的回答。