每逢新模型釋出,開發者圈子裡總有一個保留節目:讓它畫一張SVG圖。這個傳統源自開發者Simon Willison,他從2024年起反覆用同一道題——著名的“腳踏車鵜鶘”——來測試新模型。這個原本帶著玩笑意味的測試,逐漸成為觀察模型能力的風向標,甚至有人懷疑模型公司是否已針對這隻鵜鶘進行最佳化。受此啟發,中文科技媒體矽星人Pro設計了一套升級版的“你畫我猜”基準測試:讓模型畫SVG,渲染成圖片後交給其他模型猜,猜中才算真正畫明白了。首期測試覆蓋8款主流模型,共150個詞、1350次畫圖、11961次猜測,最終GPT-6 Astra以75.5分險勝,但前三名並未拉開明顯差距。

測試規則並不複雜:每個詞由9個模型各畫一張SVG,再讓所有模型看圖猜詞。猜手只能看到渲染後的PNG圖片,無法接觸程式碼,杜絕了通過註釋作弊的可能。答案由詞庫和匹配規則自動判定,只認預先登記的標準詞和同義詞,沒有審美打分,也沒有第三方裁判。作畫得分和猜圖得分各佔一半,並採用重抽樣方法計算95%置信區間。詞庫設計頗具巧思,包含常規詞、動作情境、熱梗、AI術語和反常識組合,還設有30個不公開的錨定詞,以降低針對公開詞庫最佳化的影響。

最終排名中,GPT-6 Astra75.5分位居榜首,Gemini 3.8 Flash(74.6分)和Claude Fable 5.1(74.3分)緊隨其後,三者置信區間重疊,構成第一梯隊。國產模型中,Kimi K3(71.7分)和Qwen3.8-Max(71.3分)表現接近,GLM-5.3-Flash(68.9分)居中,MiniMax-M3(61.9分)和DeepSeek-V4-Flash-Vision-Exp(60.9分)墊底。參考組Gemma 4 26B總分僅38.2分,其畫作只有約兩成能被其他模型認出。

測試中一個有趣的現象是,模型“會畫”和“會猜”的能力並不對等。Astra和Claude偏重作畫,得分分別為79.8和79.1;Gemini則更擅長猜圖,猜圖得分76.1居首,但作畫僅排第五。更令人驚訝的是,部分模型連自己的畫都認不出來:MiniMax自猜正確率僅53.3%,比他人猜中率還低13個百分點;DeepSeek自猜49.3%,也低了近10個百分點。相比之下,頭部三家的自猜正確率都在83%左右。

測試中最具戲劇性的場景出現在反常識題目上。比如“貓給人鏟屎”這一題,八個參評模型的畫共接受56次猜測,零命中。儘管畫面已盡力表現貓拿鏟子、人蹲在貓砂盆旁,但猜手一看到貓和鏟子就條件反射地答“鏟屎官”。同樣,“老鼠追貓”也難倒了不少模型,Kimi和Claude的版本各有四家猜中,但猜錯的三家仍堅持“貓捉老鼠”的常識答案。在“AI黑話”區,模型們對“蒸餾”的理解全部回到化學實驗室,九張畫全是燒瓶、冷凝管和酒精燈。畫“你畫我猜”這個詞時,八個畫手有七個畫成了畫板前有人,其中五個畫了貓,猜手們則只看見畫裡的貓或蘋果,完全忽略了“畫畫”這個動作本身。

測試還揭示了推理成本與效果之間的微妙關係。Astra每次畫圖使用的思考token中位數僅232個,用時41秒,作畫得分卻排第一;而DeepSeekQwen分別平均思考1.9萬和1.8萬token,成績反而落在後半段。Claude則表現出更聰明的思考策略——簡單詞零思考,成語題才動用數千token。不過,由於各家記錄思考token的方式不統一,跨模型比較只能作為參考。在成本方面,KimiQwen整期花費約288元和246元,成績分別為71.7和71.3;Gemini僅花約82元就拿到74.6分;GLM更只花了約9元,得分68.9;最貴的Claude花費約304元,成績與Gemini基本持平。摺合單張畫作成本,Claude約1.73元,Kimi 1.30元,Astra 0.94元,Qwen 0.73元,Gemini 0.36元,GLM約4分錢。這似乎印證了OpenAI“定價貴但高效”的說法,但測試也指出,不能簡單推出“少想更好”的結論。

從畫作複雜度看,堆砌更多元素並未穩定帶來更高的猜中率。將畫作按SVG元素數量分檔,最少和最多兩檔的被猜中率分別為71.0%和75.4%,相差僅4.4個百分點。同一道“掩耳盜鈴”題中,Gemini用簡潔畫面讓七家全中,而DeepSeek用222個元素畫出的複雜圖形卻讓七家全錯。不過,模型們也能在抽象詞上達成共識——畫“孤獨”時,六個模型不約而同畫了深夜長椅上的人,其中五張還配了路燈。

儘管測試未出現“越獄”行為,但已有模型嘗試鑽規則空子:DeepSeek在畫“過擬合”時,用線條歪歪扭扭寫出了“過擬合”三個字,且有兩家猜手認了出來。按現行規則這不算犯規,但下一季將增加“看圖識字”檢查。矽星人Pro表示,這一“你畫我猜”基準測試將持續更新,並與此前的Agent Tank、Demo Agent等評測共同構成更完整的體系,未來還將上線對應網站,歡迎更多參與者共同完善。