阿里巴巴旗下的千問團隊於 7 月 21 日 正式釋出了其影像生成與編輯模型系列的第三代基礎模型——Qwen-Image-3.0。作為該系列的最新迭代,新模型在輸入理解與多元素融合生成方面實現了顯著升級。
與此前版本相比,Qwen-Image-3.0 最引人注目的提升在於其對超長文本輸入的支援。模型可以處理最長 4.5k token 的指令,這使其能夠一次性生成高度複雜的視覺內容。例如,使用者可以直接輸入包含大量細節的描述,讓模型生成融合了公式符號、幾何圖形以及邏輯推導步驟的知識圖解,這在教育、科研論文配圖等場景中具有極高的實用價值。此外,該模型還能生成結構複雜的 UI 介面,為設計師和產品經理提供了快速原型構建的新工具。
在全球化應用方面,Qwen-Image-3.0 展現出了強大的多語言與字型適配能力。它原生支援 12 種語言 的文字渲染,並能準確呼叫超過 20 款不同字型。這意味著在生成海報、廣告或社交媒體影像時,模型可以直接在畫面中精準呈現多語種文本,而無需後期人工修圖,大幅提升了多語言內容生產的效率。
此次釋出正值大模型視覺能力競爭日趨白熱化之際。隨著各大廠商紛紛將多模態能力作為核心突破點,千問團隊通過強化長文本遵循與精確排版能力,試圖在專業影像生成領域建立差異化優勢。對於關注馬斯克生態的讀者而言,雖然該模型並非來自 SpaceXAI,但其在影像生成底層技術上的進步,也間接反映了當前 AI 行業在視覺生成賽道上的最新競爭水位。