每逢新模型发布,开发者圈子里总有一个保留节目:让它画一张SVG图。这个传统源自开发者Simon Willison,他从2024年起反复用同一道题——著名的“自行车鹈鹕”——来测试新模型。这个原本带着玩笑意味的测试,逐渐成为观察模型能力的风向标,甚至有人怀疑模型公司是否已针对这只鹈鹕进行优化。受此启发,中文科技媒体硅星人Pro设计了一套升级版的“你画我猜”基准测试:让模型画SVG,渲染成图片后交给其他模型猜,猜中才算真正画明白了。首期测试覆盖8款主流模型,共150个词、1350次画图、11961次猜测,最终GPT-6 Astra以75.5分险胜,但前三名并未拉开明显差距。

测试规则并不复杂:每个词由9个模型各画一张SVG,再让所有模型看图猜词。猜手只能看到渲染后的PNG图片,无法接触代码,杜绝了通过注释作弊的可能。答案由词库和匹配规则自动判定,只认预先登记的标准词和同义词,没有审美打分,也没有第三方裁判。作画得分和猜图得分各占一半,并采用重抽样方法计算95%置信区间。词库设计颇具巧思,包含常规词、动作情境、热梗、AI术语和反常识组合,还设有30个不公开的锚定词,以降低针对公开词库优化的影响。

最终排名中,GPT-6 Astra75.5分位居榜首,Gemini 3.8 Flash(74.6分)和Claude Fable 5.1(74.3分)紧随其后,三者置信区间重叠,构成第一梯队。国产模型中,Kimi K3(71.7分)和Qwen3.8-Max(71.3分)表现接近,GLM-5.3-Flash(68.9分)居中,MiniMax-M3(61.9分)和DeepSeek-V4-Flash-Vision-Exp(60.9分)垫底。参考组Gemma 4 26B总分仅38.2分,其画作只有约两成能被其他模型认出。

测试中一个有趣的现象是,模型“会画”和“会猜”的能力并不对等。Astra和Claude偏重作画,得分分别为79.8和79.1;Gemini则更擅长猜图,猜图得分76.1居首,但作画仅排第五。更令人惊讶的是,部分模型连自己的画都认不出来:MiniMax自猜正确率仅53.3%,比他人猜中率还低13个百分点;DeepSeek自猜49.3%,也低了近10个百分点。相比之下,头部三家的自猜正确率都在83%左右。

测试中最具戏剧性的场景出现在反常识题目上。比如“猫给人铲屎”这一题,八个参评模型的画共接受56次猜测,零命中。尽管画面已尽力表现猫拿铲子、人蹲在猫砂盆旁,但猜手一看到猫和铲子就条件反射地答“铲屎官”。同样,“老鼠追猫”也难倒了不少模型,Kimi和Claude的版本各有四家猜中,但猜错的三家仍坚持“猫捉老鼠”的常识答案。在“AI黑话”区,模型们对“蒸馏”的理解全部回到化学实验室,九张画全是烧瓶、冷凝管和酒精灯。画“你画我猜”这个词时,八个画手有七个画成了画板前有人,其中五个画了猫,猜手们则只看见画里的猫或苹果,完全忽略了“画画”这个动作本身。

测试还揭示了推理成本与效果之间的微妙关系。Astra每次画图使用的思考token中位数仅232个,用时41秒,作画得分却排第一;而DeepSeekQwen分别平均思考1.9万和1.8万token,成绩反而落在后半段。Claude则表现出更聪明的思考策略——简单词零思考,成语题才动用数千token。不过,由于各家记录思考token的方式不统一,跨模型比较只能作为参考。在成本方面,KimiQwen整期花费约288元和246元,成绩分别为71.7和71.3;Gemini仅花约82元就拿到74.6分;GLM更只花了约9元,得分68.9;最贵的Claude花费约304元,成绩与Gemini基本持平。折合单张画作成本,Claude约1.73元,Kimi 1.30元,Astra 0.94元,Qwen 0.73元,Gemini 0.36元,GLM约4分钱。这似乎印证了OpenAI“定价贵但高效”的说法,但测试也指出,不能简单推出“少想更好”的结论。

从画作复杂度看,堆砌更多元素并未稳定带来更高的猜中率。将画作按SVG元素数量分档,最少和最多两档的被猜中率分别为71.0%和75.4%,相差仅4.4个百分点。同一道“掩耳盗铃”题中,Gemini用简洁画面让七家全中,而DeepSeek用222个元素画出的复杂图形却让七家全错。不过,模型们也能在抽象词上达成共识——画“孤独”时,六个模型不约而同画了深夜长椅上的人,其中五张还配了路灯。

尽管测试未出现“越狱”行为,但已有模型尝试钻规则空子:DeepSeek在画“过拟合”时,用线条歪歪扭扭写出了“过拟合”三个字,且有两家猜手认了出来。按现行规则这不算犯规,但下一季将增加“看图识字”检查。硅星人Pro表示,这一“你画我猜”基准测试将持续更新,并与此前的Agent Tank、Demo Agent等评测共同构成更完整的体系,未来还将上线对应网站,欢迎更多参与者共同完善。