阿里巴巴旗下的千问团队于 7 月 21 日 正式发布了其图像生成与编辑模型系列的第三代基础模型——Qwen-Image-3.0。作为该系列的最新迭代,新模型在输入理解与多元素融合生成方面实现了显著升级。
与此前版本相比,Qwen-Image-3.0 最引人注目的提升在于其对超长文本输入的支持。模型可以处理最长 4.5k token 的指令,这使其能够一次性生成高度复杂的视觉内容。例如,用户可以直接输入包含大量细节的描述,让模型生成融合了公式符号、几何图形以及逻辑推导步骤的知识图解,这在教育、科研论文配图等场景中具有极高的实用价值。此外,该模型还能生成结构复杂的 UI 界面,为设计师和产品经理提供了快速原型构建的新工具。
在全球化应用方面,Qwen-Image-3.0 展现出了强大的多语言与字体适配能力。它原生支持 12 种语言 的文字渲染,并能准确调用超过 20 款不同字体。这意味着在生成海报、广告或社交媒体图像时,模型可以直接在画面中精准呈现多语种文本,而无需后期人工修图,大幅提升了多语言内容生产的效率。
此次发布正值大模型视觉能力竞争日趋白热化之际。随着各大厂商纷纷将多模态能力作为核心突破点,千问团队通过强化长文本遵循与精确排版能力,试图在专业图像生成领域建立差异化优势。对于关注马斯克生态的读者而言,虽然该模型并非来自 SpaceXAI,但其在图像生成底层技术上的进步,也间接反映了当前 AI 行业在视觉生成赛道上的最新竞争水位。