马斯克近日在 X 上频繁推广的 Imagine Image 2.0 生图模型,凭借其可交互的精准编辑功能迅速出圈,成为社交媒体上的热门话题。这款模型在大模型竞技场(LMArena)的文本转图像生成和图像编辑两个类别中均位列世界第二,仅次于 OpenAI 的 GPT-Image-2。其最大亮点在于支持对图像进行分层编辑,用户上传图片后,Grok 会自动将图像分解为多个图层,例如一张维基百科的表情包会被拆分为地球碎片、人物面部和手势动作等独立部分。用户可精确选择特定区域进行修改,或点击图层右侧的下载按钮,将任意主体导出为透明背景图片。此外,魔棒工具可编辑涂画区域,多参考编辑功能一次最多处理 5 张输入图像,实现自动拼接,极大提升了图像编辑的灵活性和趣味性。
这一功能让 Imagine Image 2.0 与 GPT-Image-2 形成差异化。GPT-Image-2 主要依赖提示词控制生成,而 Imagine Image 2.0 提供了更直观的交互方式,用户可以直接点击图像元素进行修改,无需复杂的提示词工程。例如,经典的分心男友表情包可以被快速编辑,替换或增加内容;会议室白板图中的每个对话框都会被自动识别为选区,用户只需选择气泡框并填入文字,即可生成纵向漫画 Meme。这种“所见即所得”的编辑体验,降低了 AI 生图的使用门槛,吸引了大量普通用户尝试。
然而,并非所有用户都对 Imagine Image 2.0 感到满意。有网友吐槽其审核机制过于严格,导致许多内容无法生成,例如上传蜘蛛侠照片会被提示“无法生成可能包含受版权保护的内容”,擦边内容也受到更强护栏限制。这种严格的审核虽然有助于合规,但也限制了创作自由度,引发部分用户不满。
与此同时,OpenAI 似乎也在推进生图模型的迭代。有网友在大模型竞技场上发现了一个代号为“mona-lisa-1”的新模型,疑似为 GPT-Image-2 的后续版本。测试显示,该模型在真实感和噪声控制方面略有改进,但整体提升幅度不大。有网友认为,新模型减少了“AI Slop”感,生成的图片更接近手机拍摄的真实效果。为确认其身份,网友将生成的图片上传至 OpenAI 验证工具,结果显示包含 OpenAI SynthID 水印,证实该模型确为 OpenAI 出品。不过,mona-lisa-1 的知识截止日期为 2025 年 5 月 22 日,且对 Anthropic 发布记录的描述存在错乱,因此有猜测认为这可能是 GPT-Image-2.0 Mini 或开源生图模型的测试版本。
从 GPT-Image-2 的强势表现,到 Imagine Image 2.0 的精准编辑创新,再到 OpenAI 疑似测试新版本,生图模型的竞争正从单纯的质量比拼转向功能多样性和交互体验的较量。对于普通用户而言,这意味着更丰富的创作工具和更逼真的生成效果;对于开发者而言,如何在一致性保持、密集文字处理、精准编辑和美学品质之间取得平衡,将是未来竞争的关键。马斯克的 Imagine Image 2.0 凭借其独特的交互设计,暂时在表情包制作领域占据一席之地,但 OpenAI 的后续动作可能随时改变格局。