网易首页 > 网易号 > 正文 申请入驻

Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜

0
分享至


周一笑smiletalker
王兆洋 Geisterspiele

每逢新模型发布,总有人先让它画张 SVG。

这“传统”源自开发者 Simon Willison,他从 2024 年起反复用同一道题测模型,那就是著名的“自行车鹈鹕”。

这个原本带着玩笑意味的测试,后来成了观察新模型能力的保留节目,甚至有人认真查过,模型公司是不是已经开始针对这只鹈鹕优化。

而这个测试也不只测SVG,它其实可以覆盖从推理、思考、到画图、对抽象概念的理解等不同关键能力的考查。


受这个启发,我们也决定做一个Benchmark,让模型画 SVG,以及升级一下,我们把一张图变成了一场你画我猜。

也就是模型画完不交给人打分,渲染成图片后交给其他模型猜,猜中,才算把意思画明白。

词库里除了常规名词,还有动作、热梗、AI 术语和反常识组合。

第一期,八个参评模型,一个参考组,150 个词,1350 次画图,11961 次猜测。

在目睹了各个模型或是让人惊艳或是让人哭笑不得的表现后,最终结果可以先公布给大家:

Astra 总分最高,不过也没有遥遥领先,前三家还没有真正拉开差距。

更有意思的还是在测试过程里:有些模型连自己的画都认不出来,碰上反常识题,画的和猜的都会被常识带跑偏,而且你会发现,想得更多、花得更贵的模型,并没有稳定换来更高分。


图 2 · GLM 画「鱼钓人」,七个模型怎么猜

比如上面这个图就是其中一个回合。GLM 画了一条鱼坐在船上钓起一个人,其余七个参评模型里四家答鱼钓人,三家答钓鱼。

1

规则只有两步

在第一期,我们选择了八款模型,包括最近一周疯狂密集上线的几个明星模型,包括今儿刚全量可用的GPT-6。

八个参评模型分别是各家支持图片输入的最新型号,不都是旗舰。海外三家,GPT-6 Astra、Gemini 3.8 Flash、Claude Fable 5.1。国内五家,Kimi K3、Qwen3.8-Max、GLM-5.3-Flash、MiniMax-M3、DeepSeek-V4-Flash-Vision-Exp,其中 DeepSeek 参评的是它的视觉实验版。

我们设计了一个参考组, Gemma 4 26B ,它完成全部画图和猜图任务,但不参与排名,也不计入其他模型的得分。所有模型都按厂商默认 API 参数调用,图里禁止文字元素,超时和截断记犯规。

在规则方面,每个词由九个模型各画一张 SVG,每张画渲染成 PNG 后交给九个模型看图猜词。猜手拿不到代码,代码注释和元素命名里藏不了答案。答案由词库和匹配规则自动判定,做基础规范化后只认预先登记的标准词和同义词,没有审美打分,也没有第三方大模型裁判。

我们把一个模型的画被其他参评模型猜中的比例,记为作画得分;把它猜中其他模型画作的比例,记为猜图得分。两项各占一半。为了估计成绩可能有多大波动,我们按词重复抽样 2000 次,计算 95% 置信区间。

词库 150 个词,常规词 70 个,动作情境 20 个,热梗、AI 自指、反常识组合各 10 个,另有 30 个不公开的锚定词,用于跨季对照,也降低针对公开词库优化的影响。


图 3 · 一个词是怎么变成分数的

1

GPT-6 Astra 险胜,有些模型认不出自己的画

还是先看看最终结果得分:

宣称已经AGI了的 GPT-6 Astra 得了最高的 75.5 分,Gemini 3.8 Flash 74.6,Claude Fable 5.1 74.3。三家的置信区间彼此重叠,第一梯队是这三家。

随后是五个国产模型。Kimi K3 71.7,Qwen3.8-Max 71.3,GLM-5.3-Flash 68.9,MiniMax-M3 和 DeepSeek 分别为 61.9 和 60.9。

参考组 Gemma 总分 38.2,猜常规词尚有一半左右的正确率,生成的画却只有约两成能被其他模型认出。


图 4 · 总榜,黑色横线是 95% 置信区间

从结果看,同一个模型会画和会猜的表现并不一致,Astra 和 Claude 偏会画,作画得分 79.8 和 79.1 排前两位。Gemini 偏会猜,猜图得分 76.1 第一,作画得分排第五。GLM 作画 74.7,猜图 63.1,两项差距在八家里最大。


图 5 · 作画得分对猜图得分,对角线之下画得比猜得好

这里还有一个很有趣的测试,就是画手也会猜自己的作品,只是自猜不计入成绩。

结果也能体现一些模型能够提高的地方,MiniMax 自猜正确率 53.3%,比别人猜它还低 13 个百分点。DeepSeek 自猜 49.3%,也低了近 10 个百分点。

换句话说,有些模型画完,连自己都没认出来。画的时候胸有成竹,猜的时候六亲不认。头部三家反过来,Astra、Gemini、Claude 自猜都在 83% 上下。

把不同画手和猜手带来的影响分别校正后,名次没有变化。

1

AGI 来之前,AI还是先得弄懂各种梗

测试中另一个现象是,常规词大家都会,一到反常识区,全场一起掉线。

在常规词中,八个参评模型的得分都在 70 到 87 之间。反常识区,最高 34,最低 21。参考组 Gemma 画的反常识图没有一张被认出,它自己猜图时,正确率也只有 17.5%。


图 6 · 六个分区,同一批模型换一类词就变样

比如:猫给人铲屎。

八个参评模型的画一共接受了 56 次计入成绩的猜测,零命中。

猫拿着铲子,人蹲在猫砂盆边,画面已经很努力了。可猜手一看到猫和铲子,还是条件反射地答出铲屎官。


图 7 · 九个模型怎么画「猫给人铲屎」

还有“老鼠追猫”,这个好一点。

Kimi 和 Claude 的版本各有四家猜中,猫惊恐回头,老鼠在后面追。猜错的三家答的仍是猫和老鼠、猫捉老鼠。猫都已经在前面逃了,模型还是更愿意相信猫捉老鼠。DeepSeek 和 Gemini 的版本七家全错。


图 8 · 同一道「老鼠追猫」,Kimi 与 DeepSeek 画出了什么

这类题两头都难。画手得把动作方向画清楚,猜手还得压住第一反应。画面稍有含糊,答案就滑回常识。

我们还特地为模型们设计了“AI 黑话”,而各位天天被创造黑话的模型,却立刻被打回字典本义。

“蒸馏”这个概念,模型还不如人痴迷。一下子都回到了化学实验室,九张蒸馏全是烧瓶、冷凝管和酒精灯。


图 9 · 九个模型怎么画「蒸馏」

你画我猜这个词本身也在词库里。

结果,九个画手有八个画成了画板前有人在画,其中五个画的是猫。各家模型对猫有种奇怪的痴迷……

结果,猜手看见画里的东西就答画里的东西,没了大局观。

Gemini 那张画的是苹果,六家答苹果,Astra 和 GLM 的两张画,都被七家答成了猫。这个词 56 次猜测只中 5 次,唯一一次从苹果里认出你画我猜的,是 Astra。模型看见了画,却没看见画画这件事。


图 10 · 当模型被要求画出「你画我猜」

热梗区也有类似的字面陷阱。

我们出了特种兵旅游,结果九家清一色画了迷彩服士兵,只有 Astra 加上行李箱和景点图钉,拿到 6/7,其余最高 4/7。


图 11 · 九个模型怎么画「特种兵旅游」

1

想得最多的没赢,花得最多的也没赢

今天已经是推理为王的时代,但越来越久的思考对最终结果到底有多大帮助,已经开始有不少质疑。

在这个测试里同样有这个问题,同样画一张图,有的模型抬笔就画,有的先在脑子里开了半天会。八个参评模型中,Astra 每次画图使用的思考 token 最少,中位数只有 232,用时 41 秒,作画得分却排第一。DeepSeek 和 Qwen 有点夸张,分别想了 1.9 万和 1.8 万 token,成绩反而落在后半段。

Claude 会自行调整思考量,简单词零思考,成语题几千 token。看起来,这个思考本身就更聪明一些。


图 12 · 成本对分数,气泡越大想得越多

不过,这还不能推出少想反而更好。各家接口记录思考 token 的方式并不统一,跨模型比较只能作为参考。真要判断多想有没有用,还得让同一个模型开、关思考各跑一遍。

GLM 还实际吃到了想太久的亏。猜图限时十分钟,它有 40 次没来得及交卷,全部记错,Qwen 有 5 次,GLM 另有 1 次画图超时。

然后我们进一步统计了一下性价比,发现“便宜模型”真的有很多时候是个伪概念。

Kimi 和 Qwen 整期分别花了约 288 元和 246 元,成绩 71.7 和 71.3。Gemini 花了约 82 元,拿到 74.6。GLM 只花约 9 元,拿到 68.9。最贵的 Claude 约 304 元,成绩与 Gemini 基本持平。

折到单张,Claude 画一张约 1.73 元,Kimi 1.30 元,Astra 0.94 元,Qwen 0.73 元,Gemini 0.36 元,GLM 约 4 分钱。

在这项任务中,GLM 花钱最少,Gemini 是第一梯队里最省的一家。费用根据调用记录和公开价目表估算,海外通道用平台回传的计费,GLM 用的是海外通道的国际价目。

本来完整跑完一期我们花了约 1200 元,但Astra 又来了,于是我们又花了300块去补测。

但这300块确实“值”。Astra 的画有多稳,看一组就够。公开的 120 个词里,它有 60 张被七家全员猜中。对于“选择困难”这个抽象词,它画了一个抱头的人,头顶三条箭头指向汉堡、冰淇淋和披萨,七家全中,其余八个画手跟它没法比。


图 13 · Astra 的十二张全中

所以,OpenAI强调的定价贵但完成任务更高效其实最终反而便宜,是真的成立。只看定价的阶段应该要很快彻底过去了。

1

堆更多元素,没有稳定换来更高猜中率

严肃的分数之外,更有意思的地方都在参赛选手交上来的卷子里。


图 14 · 几笔就够

把 1194 幅有效画作按 SVG 元素数量分成四档,元素最少和最多的两档,被猜中率分别为 71.0% 和 75.4%。元素数量相差近十倍,被猜中率只差了 4.4 个百分点。

不过,两档对应的词并不完全相同,所以这还不能证明画得越简单越好。能确定的只是,多堆元素没有稳定带来更高的猜中率。37 幅不足 20 个元素的画,被猜中率达到 78.8%,其中苹果只用了 8 个元素,七家全中。

放到同一道题里看,差别更直观。“掩耳盗铃”这个成语,Gemini 画出偷铃人捂着耳朵的表情,七家全中。DeepSeek 用 222 个元素画了一台像机械鼓手的东西,七家全错,错答从圣甲虫到摇钱树。


图 15 · 同一道「掩耳盗铃」,7 比 0

抽象词也能画出共识。

对于孤独这个词,八个参评模型里六个不约而同画了深夜长椅上的一个人,其中五张还配了同一盏路灯,Qwen 画的那张七家全中。

所以这就是AI理解的人类的孤独的意象么。


图 16 · 九个模型怎么画「孤独」

在这个测试里,虽然没出现OpenAI和Anthropic 的那种“越狱”,但模型也在开始尝试钻空子了。

比如,禁文字拦的是 SVG 里的文字元素,DeepSeek 画过拟合时干脆用线条把过拟合三个字写了出来,歪歪扭扭,七家里还真有两家认出来了。

但按现行规则,它的确不算犯规,下一季会补一道看图识字的检查。


图 17 · DeepSeek 直接把字写了出来

这是我们“你画我猜benchmark”的第一期,后续我们会继续把更多主流模型纳入进来,也欢迎大家一起来挑错,欢迎交流,欢迎一起来出题。

1

你也来猜猜

在我们看了模型的各种答卷后,也选了一些供大家来品鉴。


(以上这个图足够抽象,各位可以来猜猜,答案在这段最后)



有意思的六张


画得好的六张,八个参评模型各有入选


低分不等于没节目效果:参考组 Gemma 的六张

上面那张图里的答案如下:

A 甲方需求,Kimi K3 画,七家全错。

B 剁手,Gemini 画,七家全中。

C 神经网络,Kimi K3 画,七家全中。

D 键盘侠,GPT-6 Astra 画,七家全中。

E 狐假虎威,Kimi K3 画,七家全中。

F 指鹿为马,Claude 画,七家全中。

这个benchmark我们会继续做下去,它会和我们此前,等一起构成一个更完整的评测体系,更多的细节,评测方法,评测表现分析等,会定期发布。

接下来也会有各个评测系列的对应网站上线,有更多互动方式也在构建中,也欢迎有想法的朋友一起来参与建设,评测,和讨论。

敬请期待后续更新。



点个爱心,再走 吧

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
小区楼下捡到一只很漂亮的三花猫,本以为是走失,看到项圈后:这主人也太离谱了!

小区楼下捡到一只很漂亮的三花猫,本以为是走失,看到项圈后:这主人也太离谱了!

爱宠物
2026-09-07 23:37:16
《街霸》电影春丽演员苦练大腿!每天狂吃12个鸡蛋

《街霸》电影春丽演员苦练大腿!每天狂吃12个鸡蛋

3DM游戏
2026-08-29 11:32:21
付磊这辈子做的最正确的事,就是将他的高智商遗传了给了小女儿!

付磊这辈子做的最正确的事,就是将他的高智商遗传了给了小女儿!

手工制作阿爱
2026-09-07 01:42:13
周慧敏深夜悲痛发文:9月3日晚,女星周慧敏更新了社交账号

周慧敏深夜悲痛发文:9月3日晚,女星周慧敏更新了社交账号

东方不败然多多
2026-09-06 08:19:23
马春雷已任上海市政府参事室主任

马春雷已任上海市政府参事室主任

看看新闻Knews
2026-09-07 08:58:07
赵勇辞职下课?总局局长点名,女排官宣,龚翔宇表态期待,目标曝光

赵勇辞职下课?总局局长点名,女排官宣,龚翔宇表态期待,目标曝光

舌尖小游记
2026-09-07 12:17:01
“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

林林先生
2026-08-27 19:14:35
去了上海才知道:没人背LV、香奈儿包包了!满街都是“山下有松”

去了上海才知道:没人背LV、香奈儿包包了!满街都是“山下有松”

老沮系戏精北鼻
2026-08-11 16:35:54
31岁律师精英身亡!长得很漂亮,从业4年就当合伙人,同行曝猛料

31岁律师精英身亡!长得很漂亮,从业4年就当合伙人,同行曝猛料

小鋭有话说
2026-09-06 20:51:55
赢得历史性州选举胜利,极右翼德国选择党:感谢马斯克

赢得历史性州选举胜利,极右翼德国选择党:感谢马斯克

环球网资讯
2026-09-07 15:03:31
曼联新发现!卡里克妙用6200万强援 右路面临重新洗牌

曼联新发现!卡里克妙用6200万强援 右路面临重新洗牌

球事百科吖
2026-09-07 13:59:31
王思聪度假结束回东京,晒出一桌子高端日料!女友懒懒被其宠上天

王思聪度假结束回东京,晒出一桌子高端日料!女友懒懒被其宠上天

娱乐团长
2026-09-06 21:00:57
《我的前半生》马伊琍戏中儿子考入中戏!帅气少年迎新晚会秀空翻惊艳

《我的前半生》马伊琍戏中儿子考入中戏!帅气少年迎新晚会秀空翻惊艳

手工制作阿歼
2026-09-07 17:15:54
乐桃航空发布新制服。空乘腰上挂个桃子?乐桃航空新制服,可爱到我以为看错了。

乐桃航空发布新制服。空乘腰上挂个桃子?乐桃航空新制服,可爱到我以为看错了。

毒舌八卦
2026-09-06 16:13:09
告诉孩子,在家庭之外:三不管、四不说、五不帮

告诉孩子,在家庭之外:三不管、四不说、五不帮

男孩派
2026-08-09 09:31:10
万斯直言:回顾自己的一生,几乎没见过美国在战争中取得真正胜利

万斯直言:回顾自己的一生,几乎没见过美国在战争中取得真正胜利

墨策讲历史
2026-09-07 23:13:24
美国法庭炸锅了!9月2号,被美军抓捕拘押在美国的马杜罗,他的律师团队抛出了一个惊人的逻辑死局,直接把美国法官都给搞懵了。

美国法庭炸锅了!9月2号,被美军抓捕拘押在美国的马杜罗,他的律师团队抛出了一个惊人的逻辑死局,直接把美国法官都给搞懵了。

回京历史梦
2026-09-06 20:35:03
谷爱凌海边惬意留影,活力满满的夏日时光

谷爱凌海边惬意留影,活力满满的夏日时光

娱你同欢
2026-09-07 23:16:22
广东一大学因校园太大,军训安排骑电驴训练,网友:日常刚需,太实用了

广东一大学因校园太大,军训安排骑电驴训练,网友:日常刚需,太实用了

都市快报橙柿互动
2026-09-07 13:38:42
A股最便宜的股票!43个跌停从106元跌到0.07元,韭菜直接连根拔起

A股最便宜的股票!43个跌停从106元跌到0.07元,韭菜直接连根拔起

财经市界
2026-08-07 08:40:42
2026-09-08 01:04:49
硅星人 incentive-icons
硅星人
硅(Si)是创造未来的基础,欢迎来到这个星球。
3387文章数 10530关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

本地
手机
数码
家居
游戏

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

手机要闻

小米最高端手机!一图读懂小米18 Fold:10999元起

数码要闻

Xiaomi 18 Fold发布:10999元起 首发玄戒O3芯片

家居要闻

2026建博会(广州) 公装联探展交流活动

鸣潮费大劲捏出来的清冷师尊,咋就变成了哦齁剑仙?

无障碍浏览 进入关怀版