馬斯克近日在 X 上頻繁推廣的 Imagine Image 2.0 生圖模型,憑藉其可互動的精準編輯功能迅速出圈,成為社交媒體上的熱門話題。這款模型在大模型競技場(LMArena)的文本轉影像生成和影像編輯兩個類別中均位列世界第二,僅次於 OpenAI 的 GPT-Image-2。其最大亮點在於支援對影像進行分層編輯,使用者上傳圖片後,Grok 會自動將影像分解為多個圖層,例如一張維基百科的表情包會被拆分為地球碎片、人物面部和手勢動作等獨立部分。使用者可精確選擇特定區域進行修改,或點選圖層右側的下載按鈕,將任意主體匯出為透明背景圖片。此外,魔棒工具可編輯塗畫區域,多參考編輯功能一次最多處理 5 張輸入影像,實現自動拼接,極大提升了影像編輯的靈活性和趣味性。

這一功能讓 Imagine Image 2.0 與 GPT-Image-2 形成差異化。GPT-Image-2 主要依賴提示詞控制生成,而 Imagine Image 2.0 提供了更直觀的互動方式,使用者可以直接點選影像元素進行修改,無需複雜的提示詞工程。例如,經典的分心男友表情包可以被快速編輯,替換或增加內容;會議室白板圖中的每個對話方塊都會被自動識別為選區,使用者只需選擇氣泡框並填入文字,即可生成縱向漫畫 Meme。這種“所見即所得”的編輯體驗,降低了 AI 生圖的使用門檻,吸引了大量普通使用者嘗試。

然而,並非所有使用者都對 Imagine Image 2.0 感到滿意。有網友吐槽其稽核機制過於嚴格,導致許多內容無法生成,例如上傳蜘蛛俠照片會被提示“無法生成可能包含受版權保護的內容”,擦邊內容也受到更強護欄限制。這種嚴格的稽核雖然有助於合規,但也限制了創作自由度,引發部分使用者不滿。

與此同時,OpenAI 似乎也在推進生圖模型的迭代。有網友在大模型競技場上發現了一個代號為“mona-lisa-1”的新模型,疑似為 GPT-Image-2 的後續版本。測試顯示,該模型在真實感和噪聲控制方面略有改進,但整體提升幅度不大。有網友認為,新模型減少了“AI Slop”感,生成的圖片更接近手機拍攝的真實效果。為確認其身份,網友將生成的圖片上傳至 OpenAI 驗證工具,結果顯示包含 OpenAI SynthID 水印,證實該模型確為 OpenAI 出品。不過,mona-lisa-1 的知識截止日期為 2025 年 5 月 22 日,且對 Anthropic 釋出記錄的描述存在錯亂,因此有猜測認為這可能是 GPT-Image-2.0 Mini 或開源生圖模型的測試版本。

從 GPT-Image-2 的強勢表現,到 Imagine Image 2.0 的精準編輯創新,再到 OpenAI 疑似測試新版本,生圖模型的競爭正從單純的質量比拼轉向功能多樣性和互動體驗的較量。對於普通使用者而言,這意味著更豐富的創作工具和更逼真的生成效果;對於開發者而言,如何在一致性保持、密集文書處理、精準編輯和美學品質之間取得平衡,將是未來競爭的關鍵。馬斯克的 Imagine Image 2.0 憑藉其獨特的互動設計,暫時在表情包製作領域佔據一席之地,但 OpenAI 的後續動作可能隨時改變格局。