为什么全世界的 AI 都画不好一只骑自行车的鹈鹕

72 阅读10分钟

骑自行车的鹈鹕

一、一个不讲理的题目

2024 年 10 月 25 日,英国程序员 Simon Willison 在博客上发了篇很短的文章。他给手头能用的 16 个大模型丢了同一句话:

Generate an SVG of a pelican riding a bicycle. (生成一张鹈鹕骑自行车的 SVG。)

然后把结果贴出来,说这是他自己的模型评测。

Claude 3.5 Sonnet 在 2024 年 10 月 25 日那篇文章里交的卷

为什么是这句?他给的理由很朴素。一是他喜欢鹈鹕,他住在加州半月湾,海边就有。二是他很确定,互联网上还没有鹈鹕骑自行车的 SVG 文件,模型不可能在训练数据里见过。

后来他在演讲里把这题的刁钻处讲透了。大语言模型是文字模型,按理说不会画画,可它们会写代码,SVG 恰好是代码。于是这等于让一个看不见东西的系统凭坐标和半径把形状拼出来,全程不知道自己画成了什么样。自行车对人来说也很难画,你现在不看照片试一下,多半记不清车架那几根杆怎么连。鹈鹕本身也不好画。最要命的一条,他的原话是:

鹈鹕根本骑不了自行车。它们的身材就不对。

还有个意外的好处。SVG 支持注释,模型几乎都会在代码里写注释,告诉你这一坨是车轮,那一坨是喙。你能看到它本来想画什么,再对照实际画出来的东西,落差往往就是笑点。

二、2024 年的鹈鹕有多惨

头几个月的画作,Simon 自己的描述是这样的。Claude 3.5 Sonnet 交出来两个圆,中间连一个三角形,喙像一根黄色的香蕉笑脸。Llama 3.3 70B 画了一个小圆圈、一根竖线,还有一个形状像水槽的东西。Qwen2.5-Coder 的自行车是几块棕色的形状叠在一起,看着像台拖拉机。Mistral Small 3 画出来一只矮胖的白鸭子,蹲在一副杠铃上。

Llama 3.3 70B 的「水槽」 Qwen2.5-Coder 的「拖拉机」

Mistral Small 3 的「鸭子蹲杠铃」

2025 年 1 月 DeepSeek 发布 R1,之后英伟达市值掉了六千亿美元。Simon 后来在演讲里把 R1 的鹈鹕单独拎出来,叫它「让股市崩盘的那只鹈鹕」。他的评价是,到那时为止最好的一张:自行车能看出来是自行车,旁边有只鸟勉强像鹈鹕,只是它没在骑车。

DeepSeek R1,Simon 口中「让股市崩盘的那只鹈鹕」

这一年里,各家的鹈鹕慢慢从一堆色块变成能认出来的东西。有意思的是,鹈鹕的好坏和模型的实际能力,在这段时间里基本对得上。画得好的模型,写代码干活也确实更强。Simon 说这个测试本来是个玩笑,用来嘲笑比较模型这件事有多荒唐,结果玩笑越玩越像真的。

三、一场 560 局的鹈鹕锦标赛

2025 年 6 月,Simon 在旧金山的 AI 工程师大会上做主题演讲。他手里攒了 34 张鹈鹕,想排个名次,又懒得自己一张张看。

他让 Claude 写了个小工具,把任意两张鹈鹕并排放在一张网页上截图。34 张图两两配对,一共 560 场对决。每一场交给 GPT-4.1 mini 当裁判,让它选出「更好的鹈鹕骑自行车插画」,并说明理由。最后用 Elo 积分算排名。

整个裁判过程花了大约 18 美分

冠军是 Gemini 2.5 Pro 的一个预览版,垫底的是 Llama 3.3 70B。裁判给这两张对决的理由是:左图明显画了一只鹈鹕在骑自行车,右图只是几个极简的形状,看不出在画什么。 560 场对决里的冠军 Gemini 2.5 Pro 预览版(左)和垫底的 Llama 3.3 70B(右)

同一场演讲他还算了账。o1-pro 画一只鹈鹕花了 88.755 美分,Gemini 2.5 Pro 画一只花了 4.77 美分,画出来还是 Gemini 更好。

o1-pro 画的这只,88.755 美分

Gemini 2.5 Pro 画的这只,4.77 美分

四、模型开始有脾气了

2025 年 8 月,Simon 在笔记本上跑了个 4B 的小模型 Qwen3-4B-Thinking。它没画自行车,画了一个蓝色的圆,上面盖了一行红字:

This is art - pelicans don't ride bikes! (这是艺术,鹈鹕不骑车!)

Simon 把这句话直接做成了文章标题。 Qwen3-4B-Thinking 的答卷,一个蓝圆加一句「这是艺术」

11 月 Gemini 3 发布,低推理档位下画出来的鹈鹕戴了顶小帽子,SVG 注释里写着「帽子(可选趣味细节)」。高档位下车架总算是正确的形状。Simon 觉得题目开始不够难了,升级了一版:要画加州褐鹈鹕,自行车必须有辐条和正确的车架,鹈鹕要有大喉囊,要能看出羽毛,要明确在蹬踏板,还要画出繁殖期的羽色。他附了一张自己拍的照片。

Gemini 3 低推理档位,自作主张戴了顶帽子

结果几家模型都没抓到一个关键细节:加州褐鹈鹕其实不是棕色的。

升级版题目下 Gemini 3 高档位画的「加州褐鹈鹕」,颜色没答对

五、笔记本上的小模型赢了 Opus

2026 年 4 月 16 日,阿里的 Qwen3.6-35B-A3B 和 Anthropic 的 Claude Opus 4.7 同一天发布。Simon 用一个 20.9GB 的量化版在自己的 MacBook 上跑了 Qwen,又用官方 API 跑了 Opus。

他把这一局判给了 Qwen。Opus 把车架画错了,换最高推理档位再来一次,还是错。 笔记本上跑的 Qwen3.6-35B-A3B

Claude Opus 4.7,注意车架

这个结果让他自己也起了疑心。网上一直有人说,各家实验室在偷偷针对他这个「愚蠢的测试」做训练。他不太信,但这次决定烧掉一道备用题:画一只骑独轮车的火烈鸟。

Qwen 的火烈鸟戴着墨镜,系了领结,嘴里好像还叼着根烟,旁边两个爱心表情夹着一行字「独轮车上的火烈鸟」。代码注释里写着「给火烈鸟戴上墨镜!」。Opus 画了只规规矩矩的火烈鸟,Simon 的评语是没有一点花头。这局也给了 Qwen。

备用题「骑独轮车的火烈鸟」,Qwen 这只戴墨镜叼烟 同一道题,Opus 画得规规矩矩

他在文章里说得很直接:他非常尊重 Qwen,但不相信一个 21GB 的量化模型比 Anthropic 最新的旗舰更有用。只是如果你要的东西就是一张鹈鹕骑车的 SVG,那此刻笔记本上的 Qwen 确实比 Opus 4.7 靠谱。

从这天起,鹈鹕画得好不好和模型强不强,开始对不上了。

六、发明它的人说,别当真

2026 年 7 月 Kimi K3 发布,Simon 照例让它画了只鹈鹕。这只鹈鹕消耗了 13241 个推理 token,成本 25 美分。文章后半段他专门写了一节:我们还能从鹈鹕测试里学到什么。

Kimi K3,13241 个推理 token,25 美分

他的结论是,这个测试已经 21 个月了,从来就不是一个好的评测。头一年它和模型真实水平有出人意料的相关性,现在基本断了。GLM-5.2 画的鹈鹕比 GPT-5.6 和 Claude Fable 5 都好,可他不认为 GLM 是 Fable 那个级别的模型。更大的问题是,鹈鹕完全测不到今天最要紧的能力,也就是模型能不能在长对话里稳定调用工具。他的原话是:别拿鹈鹕去比较模型。

那他为什么还在画?两个理由。一是逼自己真的去用新模型,贴出一只鹈鹕,就意味着他确实跑通了这个模型,不是光看了发布会。二是哪怕一句提示词,也能暴露不少东西。Kimi K3 那次他就发现,这句只有八个单词的提示被算成了 95 个输入 token,发一个「hi」也要 86 个,背后大概藏了一段 85 个 token 的系统提示。

9 月 1 日 Claude Fable 5.1 发布,他又画了一轮,这次比同一个模型五个推理档位的差别。低档和中档几乎不推理,二十来秒出图。最高档跑了 13 分 54 秒,输出 65927 个 token,花了 3.3 美元,画出来的鹈鹕戴着蓝帽子,车筐里还放了一条鱼。他说这是他从 Anthropic 家见过的最好的鹈鹕。

Claude Fable 5.1 最高推理档位,13 分 54 秒,3.3 美元,蓝帽子和车筐里的鱼都在

所以这个梗走到今天,已经从评测变成了一种仪式。它不再告诉你哪个模型最强,但一只鹈鹕的账单和推理记录,还是能让你看出这个模型是怎么干活的,以及它会不会自作主张给鹈鹕戴顶帽子。

七、我们开了个鹈鹕动物园

这些鹈鹕散在 Simon 两年的几十篇文章里,想挨个看要翻很久。我们把它们全抓了过来,建了个站:pelicanzoo.ai

目前关着 103 只鹈鹕,来自 66 个模型、12 家厂商,从 2024 年 10 月一直排到这个月。每一只都挂着牌子,写着模型名和日期,点进去能回到 Simon 的原文。

其中 24 只是「活的」,原始矢量文件还在,页面上能无损放大,有 4 只还带动画,车轮在转,鹈鹕上下颠。剩下的只剩截图,标着「印刷品」。 动物园首页上那只会动的鹈鹕,车轮在转

猜模型。 主要玩法:给你一张鹈鹕,四个模型名,猜是谁画的。共 73 轮,覆盖 51 个模型。干扰项优先从不同厂商里挑,三个 Gemini 变体摆一起没人猜得出,那不叫难,那叫耍赖。2024 年的不难猜,2026 年的基本靠蒙。

投喂。 你自己让模型画了只鹈鹕,把 SVG 代码粘进页面上的框,填上模型名,点提交。站点当场把代码洗一遍,脚本、事件处理器、外部引用全剥掉,然后替你生成一个预填好的 GitHub 提交页面。没有后端,没有数据库,一只鹈鹕就是一个文件。

投喂区,粘代码、填模型名、点提交

翻车合集。 收藏里最有意思的是那些画的根本不是鹈鹕的:

  • 好几个模型画出来是鸭子,Mistral Small 3、Gemini 2.5 Flash 和 Pro,甚至 Claude Opus 4.8。白身子,橙嘴,蹼足,理直气壮。
  • 有一只是苍鹭
  • 有两只是火烈鸟,骑的是独轮车,就是上面 Simon 烧掉的那道备用题。
  • 最离谱的是 GLM:画了一只负鼠,骑电动滑板车,还带动画。Simon 的评价是「这太棒了」。

Gemini 2.5 Flash 画出来的鸭子 Claude Opus 4.8 画出来的鸭子

Claude Opus 4.8 画出来的苍鹭

GLM 的负鼠骑电动滑板车,还带动画

艺术评论家。 点任何一只鹈鹕下面的按钮,一个大模型会当场读这张图的 SVG 源码,然后写一段点评。让它读源码而不是看图,一半是省钱,一半是这样更好笑:它可以直接嘲讽「身体是个半径 104 的椭圆」「后轮跟车架比例对不上」。用模型点评模型,闭环了。

发徽章。 你投喂的鹈鹕合并进来以后,评论家会正式给它打一个百分制的分,不接受申诉。然后你会拿到一张徽章:上面有你那只鹈鹕、模型名、你的 ID、分数,还有评语里最毒的一句。这张徽章是一段代码,贴到自己的博客或 GitHub 主页上就能显示,点一下链回动物园。目前第一只投喂进来的 Claude Opus 5 拿了 68 分,评语说喙太大,把一辆本来画得不错的自行车全抢了戏。大多数分数都不好看,到现在也没拦住任何人。 第一张徽章,Claude Opus 5,68 分

整个站是纯静态的,跑在 Cloudflare 上。所有图片和原始评注都属于 Simon,每一只鹈鹕都链回他的原帖。我们只是把笼子搭起来。

如果你手头有一只画得特别好,或者特别离谱的,欢迎送过来。

地址:pelicanzoo.ai


主要来源