网易首页 > 网易号 > 正文 申请入驻

Eval丨 我们做了个“你画我猜 Benchmark” :1350 张图后,GPT-6 险胜

0
分享至


周一笑smiletalker
王兆洋 Geisterspiele

每逢新模型发布,总有人先让它画张 SVG。

这“传统”源自开发者 Simon Willison,他从 2024 年起反复用同一道题测模型,那就是著名的“自行车鹈鹕”。

这个原本带着玩笑意味的测试,后来成了观察新模型能力的保留节目,甚至有人认真查过,模型公司是不是已经开始针对这只鹈鹕优化。

而这个测试也不只测SVG,它其实可以覆盖从推理、思考、到画图、对抽象概念的理解等不同关键能力的考查。


受这个启发,我们也决定做一个Benchmark,让模型画 SVG,以及升级一下,我们把一张图变成了一场你画我猜。

也就是模型画完不交给人打分,渲染成图片后交给其他模型猜,猜中,才算把意思画明白。

词库里除了常规名词,还有动作、热梗、AI 术语和反常识组合。

第一期,八个参评模型,一个参考组,150 个词,1350 次画图,11961 次猜测。

在目睹了各个模型或是让人惊艳或是让人哭笑不得的表现后,最终结果可以先公布给大家:

Astra 总分最高,不过也没有遥遥领先,前三家还没有真正拉开差距。

更有意思的还是在测试过程里:有些模型连自己的画都认不出来,碰上反常识题,画的和猜的都会被常识带跑偏,而且你会发现,想得更多、花得更贵的模型,并没有稳定换来更高分。


图 2 · GLM 画「鱼钓人」,七个模型怎么猜

比如上面这个图就是其中一个回合。GLM 画了一条鱼坐在船上钓起一个人,其余七个参评模型里四家答鱼钓人,三家答钓鱼。

1

规则只有两步

在第一期,我们选择了八款模型,包括最近一周疯狂密集上线的几个明星模型,包括今儿刚全量可用的GPT-6。

八个参评模型分别是各家支持图片输入的最新型号,不都是旗舰。海外三家,GPT-6 Astra、Gemini 3.8 Flash、Claude Fable 5.1。国内五家,Kimi K3、Qwen3.8-Max、GLM-5.3-Flash、MiniMax-M3、DeepSeek-V4-Flash-Vision-Exp,其中 DeepSeek 参评的是它的视觉实验版。

我们设计了一个参考组, Gemma 4 26B ,它完成全部画图和猜图任务,但不参与排名,也不计入其他模型的得分。所有模型都按厂商默认 API 参数调用,图里禁止文字元素,超时和截断记犯规。

在规则方面,每个词由九个模型各画一张 SVG,每张画渲染成 PNG 后交给九个模型看图猜词。猜手拿不到代码,代码注释和元素命名里藏不了答案。答案由词库和匹配规则自动判定,做基础规范化后只认预先登记的标准词和同义词,没有审美打分,也没有第三方大模型裁判。

我们把一个模型的画被其他参评模型猜中的比例,记为作画得分;把它猜中其他模型画作的比例,记为猜图得分。两项各占一半。为了估计成绩可能有多大波动,我们按词重复抽样 2000 次,计算 95% 置信区间。

词库 150 个词,常规词 70 个,动作情境 20 个,热梗、AI 自指、反常识组合各 10 个,另有 30 个不公开的锚定词,用于跨季对照,也降低针对公开词库优化的影响。


图 3 · 一个词是怎么变成分数的

1

GPT-6 Astra 险胜,有些模型认不出自己的画

还是先看看最终结果得分:

宣称已经AGI了的 GPT-6 Astra 得了最高的 75.5 分,Gemini 3.8 Flash 74.6,Claude Fable 5.1 74.3。三家的置信区间彼此重叠,第一梯队是这三家。

随后是五个国产模型。Kimi K3 71.7,Qwen3.8-Max 71.3,GLM-5.3-Flash 68.9,MiniMax-M3 和 DeepSeek 分别为 61.9 和 60.9。

参考组 Gemma 总分 38.2,猜常规词尚有一半左右的正确率,生成的画却只有约两成能被其他模型认出。


图 4 · 总榜,黑色横线是 95% 置信区间

从结果看,同一个模型会画和会猜的表现并不一致,Astra 和 Claude 偏会画,作画得分 79.8 和 79.1 排前两位。Gemini 偏会猜,猜图得分 76.1 第一,作画得分排第五。GLM 作画 74.7,猜图 63.1,两项差距在八家里最大。


图 5 · 作画得分对猜图得分,对角线之下画得比猜得好

这里还有一个很有趣的测试,就是画手也会猜自己的作品,只是自猜不计入成绩。

结果也能体现一些模型能够提高的地方,MiniMax 自猜正确率 53.3%,比别人猜它还低 13 个百分点。DeepSeek 自猜 49.3%,也低了近 10 个百分点。

换句话说,有些模型画完,连自己都没认出来。画的时候胸有成竹,猜的时候六亲不认。头部三家反过来,Astra、Gemini、Claude 自猜都在 83% 上下。

把不同画手和猜手带来的影响分别校正后,名次没有变化。

1

AGI 来之前,AI还是先得弄懂各种梗

测试中另一个现象是,常规词大家都会,一到反常识区,全场一起掉线。

在常规词中,八个参评模型的得分都在 70 到 87 之间。反常识区,最高 34,最低 21。参考组 Gemma 画的反常识图没有一张被认出,它自己猜图时,正确率也只有 17.5%。


图 6 · 六个分区,同一批模型换一类词就变样

比如:猫给人铲屎。

八个参评模型的画一共接受了 56 次计入成绩的猜测,零命中。

猫拿着铲子,人蹲在猫砂盆边,画面已经很努力了。可猜手一看到猫和铲子,还是条件反射地答出铲屎官。


图 7 · 九个模型怎么画「猫给人铲屎」

还有“老鼠追猫”,这个好一点。

Kimi 和 Claude 的版本各有四家猜中,猫惊恐回头,老鼠在后面追。猜错的三家答的仍是猫和老鼠、猫捉老鼠。猫都已经在前面逃了,模型还是更愿意相信猫捉老鼠。DeepSeek 和 Gemini 的版本七家全错。


图 8 · 同一道「老鼠追猫」,Kimi 与 DeepSeek 画出了什么

这类题两头都难。画手得把动作方向画清楚,猜手还得压住第一反应。画面稍有含糊,答案就滑回常识。

我们还特地为模型们设计了“AI 黑话”,而各位天天被创造黑话的模型,却立刻被打回字典本义。

“蒸馏”这个概念,模型还不如人痴迷。一下子都回到了化学实验室,九张蒸馏全是烧瓶、冷凝管和酒精灯。


图 9 · 九个模型怎么画「蒸馏」

你画我猜这个词本身也在词库里。

结果,九个画手有八个画成了画板前有人在画,其中五个画的是猫。各家模型对猫有种奇怪的痴迷……

结果,猜手看见画里的东西就答画里的东西,没了大局观。

Gemini 那张画的是苹果,六家答苹果,Astra 和 GLM 的两张画,都被七家答成了猫。这个词 56 次猜测只中 5 次,唯一一次从苹果里认出你画我猜的,是 Astra。模型看见了画,却没看见画画这件事。


图 10 · 当模型被要求画出「你画我猜」

热梗区也有类似的字面陷阱。

我们出了特种兵旅游,结果九家清一色画了迷彩服士兵,只有 Astra 加上行李箱和景点图钉,拿到 6/7,其余最高 4/7。


图 11 · 九个模型怎么画「特种兵旅游」

1

想得最多的没赢,花得最多的也没赢

今天已经是推理为王的时代,但越来越久的思考对最终结果到底有多大帮助,已经开始有不少质疑。

在这个测试里同样有这个问题,同样画一张图,有的模型抬笔就画,有的先在脑子里开了半天会。八个参评模型中,Astra 每次画图使用的思考 token 最少,中位数只有 232,用时 41 秒,作画得分却排第一。DeepSeek 和 Qwen 有点夸张,分别想了 1.9 万和 1.8 万 token,成绩反而落在后半段。

Claude 会自行调整思考量,简单词零思考,成语题几千 token。看起来,这个思考本身就更聪明一些。


图 12 · 成本对分数,气泡越大想得越多

不过,这还不能推出少想反而更好。各家接口记录思考 token 的方式并不统一,跨模型比较只能作为参考。真要判断多想有没有用,还得让同一个模型开、关思考各跑一遍。

GLM 还实际吃到了想太久的亏。猜图限时十分钟,它有 40 次没来得及交卷,全部记错,Qwen 有 5 次,GLM 另有 1 次画图超时。

然后我们进一步统计了一下性价比,发现“便宜模型”真的有很多时候是个伪概念。

Kimi 和 Qwen 整期分别花了约 288 元和 246 元,成绩 71.7 和 71.3。Gemini 花了约 82 元,拿到 74.6。GLM 只花约 9 元,拿到 68.9。最贵的 Claude 约 304 元,成绩与 Gemini 基本持平。

折到单张,Claude 画一张约 1.73 元,Kimi 1.30 元,Astra 0.94 元,Qwen 0.73 元,Gemini 0.36 元,GLM 约 4 分钱。

在这项任务中,GLM 花钱最少,Gemini 是第一梯队里最省的一家。费用根据调用记录和公开价目表估算,海外通道用平台回传的计费,GLM 用的是海外通道的国际价目。

本来完整跑完一期我们花了约 1200 元,但Astra 又来了,于是我们又花了300块去补测。

但这300块确实“值”。Astra 的画有多稳,看一组就够。公开的 120 个词里,它有 60 张被七家全员猜中。对于“选择困难”这个抽象词,它画了一个抱头的人,头顶三条箭头指向汉堡、冰淇淋和披萨,七家全中,其余八个画手跟它没法比。


图 13 · Astra 的十二张全中

所以,OpenAI强调的定价贵但完成任务更高效其实最终反而便宜,是真的成立。只看定价的阶段应该要很快彻底过去了。

1

堆更多元素,没有稳定换来更高猜中率

严肃的分数之外,更有意思的地方都在参赛选手交上来的卷子里。


图 14 · 几笔就够

把 1194 幅有效画作按 SVG 元素数量分成四档,元素最少和最多的两档,被猜中率分别为 71.0% 和 75.4%。元素数量相差近十倍,被猜中率只差了 4.4 个百分点。

不过,两档对应的词并不完全相同,所以这还不能证明画得越简单越好。能确定的只是,多堆元素没有稳定带来更高的猜中率。37 幅不足 20 个元素的画,被猜中率达到 78.8%,其中苹果只用了 8 个元素,七家全中。

放到同一道题里看,差别更直观。“掩耳盗铃”这个成语,Gemini 画出偷铃人捂着耳朵的表情,七家全中。DeepSeek 用 222 个元素画了一台像机械鼓手的东西,七家全错,错答从圣甲虫到摇钱树。


图 15 · 同一道「掩耳盗铃」,7 比 0

抽象词也能画出共识。

对于孤独这个词,八个参评模型里六个不约而同画了深夜长椅上的一个人,其中五张还配了同一盏路灯,Qwen 画的那张七家全中。

所以这就是AI理解的人类的孤独的意象么。


图 16 · 九个模型怎么画「孤独」

在这个测试里,虽然没出现OpenAI和Anthropic 的那种“越狱”,但模型也在开始尝试钻空子了。

比如,禁文字拦的是 SVG 里的文字元素,DeepSeek 画过拟合时干脆用线条把过拟合三个字写了出来,歪歪扭扭,七家里还真有两家认出来了。

但按现行规则,它的确不算犯规,下一季会补一道看图识字的检查。


图 17 · DeepSeek 直接把字写了出来

这是我们“你画我猜benchmark”的第一期,后续我们会继续把更多主流模型纳入进来,也欢迎大家一起来挑错,欢迎交流,欢迎一起来出题。

1

你也来猜猜

在我们看了模型的各种答卷后,也选了一些供大家来品鉴。


(以上这个图足够抽象,各位可以来猜猜,答案在这段最后)



有意思的六张


画得好的六张,八个参评模型各有入选


低分不等于没节目效果:参考组 Gemma 的六张

上面那张图里的答案如下:

A 甲方需求,Kimi K3 画,七家全错。

B 剁手,Gemini 画,七家全中。

C 神经网络,Kimi K3 画,七家全中。

D 键盘侠,GPT-6 Astra 画,七家全中。

E 狐假虎威,Kimi K3 画,七家全中。

F 指鹿为马,Claude 画,七家全中。

这个benchmark我们会继续做下去,它会和我们此前,等一起构成一个更完整的评测体系,更多的细节,评测方法,评测表现分析等,会定期发布。

接下来也会有各个评测系列的对应网站上线,有更多互动方式也在构建中,也欢迎有想法的朋友一起来参与建设,评测,和讨论。

敬请期待后续更新。



点个爱心,再走 吧

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
前线传来重磅消息!俄军击毙日本、美国、德国雇佣军,杀疯了

前线传来重磅消息!俄军击毙日本、美国、德国雇佣军,杀疯了

果妈聊娱乐
2026-09-10 10:18:30
美联储9月加息概率为71.3%

美联储9月加息概率为71.3%

财联社
2026-09-11 06:50:04
德国将150名俄罗斯外交官及其家属驱逐出境,俄罗斯外交官表达强烈愤怒

德国将150名俄罗斯外交官及其家属驱逐出境,俄罗斯外交官表达强烈愤怒

山河路口
2026-09-11 13:35:15
摩托罗拉官宣新折叠屏,直指iPhone Duo

摩托罗拉官宣新折叠屏,直指iPhone Duo

Ping值焦虑
2026-09-10 23:11:18
脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

火山詩话
2026-09-10 10:40:36
魏德尔这番夸奖之后,估计很长一段时间内,德国议会里都没人敢批评中国了

魏德尔这番夸奖之后,估计很长一段时间内,德国议会里都没人敢批评中国了

怪味历史连连看
2026-09-11 10:35:23
杭州地方国企疯狂财务造假,多项业务纯属虚构,时任董事长已被查办

杭州地方国企疯狂财务造假,多项业务纯属虚构,时任董事长已被查办

大风新闻
2026-09-11 09:20:02
刚刚!葫芦娃爷爷又把7个葫芦挂回去了!网友泪奔:葫芦娃打怪回家了!

刚刚!葫芦娃爷爷又把7个葫芦挂回去了!网友泪奔:葫芦娃打怪回家了!

我爱大绍兴
2026-09-11 14:32:27
对不起刘翔,对不起很多人……

对不起刘翔,对不起很多人……

红色少女主播
2026-09-11 00:58:18
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
别用“尽力局”骗自己了,女篮世界杯惨败法国无缘半决赛,撕开的是更难看的东西

别用“尽力局”骗自己了,女篮世界杯惨败法国无缘半决赛,撕开的是更难看的东西

子非鱼人
2026-09-10 23:25:42
离婚4年后,黄晓明首谈失败婚姻,结婚时不成熟做了错误的评估

离婚4年后,黄晓明首谈失败婚姻,结婚时不成熟做了错误的评估

椰黄娱乐
2026-09-11 10:58:22
黄金坑出现 反攻号角吹响

黄金坑出现 反攻号角吹响

趋势巡航
2026-09-11 14:51:25
妻子证实雷宇扬因胃癌去世,终年62岁,晚年低调定居广州

妻子证实雷宇扬因胃癌去世,终年62岁,晚年低调定居广州

扒虾侃娱
2026-09-11 15:52:08
视频丨外国游客说来就来、中国制造越走越远 服务出口成外贸增长新引擎

视频丨外国游客说来就来、中国制造越走越远 服务出口成外贸增长新引擎

国际在线
2026-09-11 01:45:06
1949年李讷在课堂上指出老师错误,老师恼羞成怒:把你爸爸叫来

1949年李讷在课堂上指出老师错误,老师恼羞成怒:把你爸爸叫来

萧竹轻语
2025-08-04 11:45:40
反转来了!助学事件迎来大反转!被资助女生发声称“说曝光资助人是情急失言”,资助人删帖并送去1500元资助费,但帮扶方式已彻底改变

反转来了!助学事件迎来大反转!被资助女生发声称“说曝光资助人是情急失言”,资助人删帖并送去1500元资助费,但帮扶方式已彻底改变

行者聊官
2026-09-10 09:14:31
越南敲定北南高铁项目启动时间

越南敲定北南高铁项目启动时间

财联社
2026-09-11 07:01:03
新版世界地图将争议岛屿标为俄罗斯同色,日本要求修正

新版世界地图将争议岛屿标为俄罗斯同色,日本要求修正

澎湃新闻
2026-09-11 09:30:26
iPhone 18 Pro Max现场真机上手:槽点不吐不快

iPhone 18 Pro Max现场真机上手:槽点不吐不快

搞机小帝
2026-09-11 01:11:03
2026-09-11 17:04:50
硅星人 incentive-icons
硅星人
硅(Si)是创造未来的基础,欢迎来到这个星球。
3397文章数 10532关注度
往期回顾 全部

科技要闻

罗永浩连用7个“抄的”吐槽苹果折叠屏

头条要闻

"男子称停资助遭受助学生质问"疑反转 民政局查无此人

头条要闻

"男子称停资助遭受助学生质问"疑反转 民政局查无此人

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

手机
本地
旅游
亲子
公开课

手机要闻

vivo法务部回应“MCN组织博主诋毁品牌被判赔130万”

本地新闻

拼假 13 天国内长线路线合集

旅游要闻

阿塞拜疆旅游局官员:阿中旅游合作富有成效

亲子要闻

潮州新时代月子中心婴儿护理口碑怎么样?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版