AI画画考试宣布”毕业”,鹈鹕还在翻车
8月2日,全球 AI 圈最出名的一场”画画考试”,被宣布可以毕业了。宣布人叫卡帕西(Andrej Karpathy),前特斯拉 AI 主管、OpenAI 创始成员,是 AI 圈少数几个普通人也叫得出名字的人物。他的原话是:“我们开始离开用’画一只骑自行车的鹈鹕’来测试 AI 的时代了。“这条帖子一天被看了 274 万次,在技术论坛 Hacker News 上拿到近 400 分、300 多条评论,是当天最热的话题。
热闹的评论区里,一位叫 Morromist 的网友泼了盆冷水:“我没见过任何 AI 能稳定画出一只骑自行车的鹈鹕。哪怕画得最好的那些,仔细看也总有毛病——两条腿都在自行车的同一侧,或者长了两个喙。”
考试宣布毕业了,考场里的鹈鹕还在翻车。这中间到底发生了什么?
先说说这场”考试”是什么
2024 年底,一位叫 Simon Willison 的程序员随手发明了一个小测试:让 AI”生成一张鹈鹕骑自行车的图片”。听起来像个段子,两年后它成了 AI 圈流传最广的民间考题——130 多篇文章拿它当素材,每个新模型发布都要先过这一关。
它难在哪儿?拆开看就明白了:一只鹈鹕(动物长什么样)、一辆自行车(机械怎么组装)、“骑上去”(两者的空间关系),三件事凑在一起,AI 就晕。
为什么晕?因为 AI 画图本质是”学舌”——它在互联网上见过海量鸟的图片、自行车的图片,但”鹈鹕骑车”这种组合,人类历史上也没拍过几张。它没法抄,只能凭对两样东西的零散理解现场拼装。而拼装恰好是它的软肋:让它模仿见过的画面,它一流;让它把没见过的部件按物理规律组装,它就露馅。好比一个从没骑过车的人画”人骑车”:人画得像,车画得像,但脚蹬、链条、刹车的位置全靠猜。
翻车名场面,两年没断过
这两年的”鹈鹕考卷”收藏了不少名场面:两条腿在自行车同一侧蹬(现实中这姿势骑不了三秒)、一只鹈鹕长两个喙、车轮没有辐条、车架凭空悬浮、车把连在空气上。

图:某主流模型默认模式下的答卷。鹈鹕没在骑车,是飘在车上面。来源:simonwillison.net
更小的模型直接交白卷级别的抽象画:两个蓝圆圈、一个棕色长方形、一坨橙色不明物体,就算”鹈鹕骑车”了。

图:一个超小模型对同一道题的作答,几乎看不出鹈鹕和车。来源:simonwillison.net
就在上个月底,Simon Willison 实测最新模型,默认模式下鹈鹕依然悬空、自行车依然散架;把”多想一会儿”的开关调高,才画出一张像样的。评论区有人翻旧账:Claude 的鹈鹕,18 个月来没见明显进步。
那为什么宣布”毕业”?
卡帕西的意思,更接近于”这道题已经考不出差别了”。
这得先懂一个概念:考试的价值在于区分度。全班都考 30 分时,分数能说明问题;全班都考 95 分时,这张卷子就废了——它不再能告诉你谁强谁弱。鹈鹕考试正走到这一步:主流模型都能画出”乍一看还行”的鹈鹕,大家的争论从”谁画错了”变成了”谁的鹈鹕更好看”,后者已经是品味之争,能力之争反而被挤掉了。
于是卡帕西换了道题:给 AI《指环王》第一段文字,配 100 万个思考单位(约 10 美元成本),让它用 3D 技术把整个故事渲染成可进入的场景。AI 埋头干了 2 小时,写了 5500 行代码,真的搭出了一个霍比屯——可以走进去逛,还配了汤姆·邦巴迪尔的歌。卡帕西调侃:“小心了,‘GTA 霍比屯’可能抢在《GTA VI》之前发售。”

图:同一模型、同一道题,调高思考强度后的结果,与上面那张判若两”鹈”。来源:simonwillison.net
全班考满分,代表全班都会了吗
这里有个普通人容易忽略的陷阱:考试毕业,和真的会画,是两回事。
第一层原因,是”刷题效应”。鹈鹕考试火了两年,网上到处是示范答案,AI 的训练数据里很可能早就装进了这些图——它考满分,也许只是记住了这道题的答案,而不是真懂了鹈鹕和自行车。这不是笔者的猜测:有人专门做了实验,拿 7 个主流模型、48 种”动物+交通工具”组合(鹈鹕骑车、火烈鸟骑滑板、苍鹭开船……)逐一测试,结论是:鹈鹕并没有比其他动物画得更好。如果模型真的”开窍”了,为什么只开窍在鹈鹕这一题上?更像是这道题被做熟了。
第二层原因,是”大家一起变强”和”一起背下答案”在分数上无法区分。考试题目一旦公开流传,它就从”能力测验”退化成了”熟练度测验”。卡帕西换题,某种意义上也是承认:鹈鹕卷子已经被污染了,不值得再考。
第三层原因,是 AI 的老毛病还在。卡帕西自己就承认,AI 做 3D 场景时没法真正”看”自己的作品——它只能一张张截图慢慢检查,还经常检查出错。自己画的东西自己看不出毛病,这恰恰是鹈鹕翻车的根源:它没有一双眼睛盯着画面,告诉它”两条腿不该在同一边”。
跟普通人有什么关系
下次看到 AI 生成的图片,尤其是带机械、带动作、带多件东西互动的图,值得多看一眼。风景、海报、插画这类”氛围图”,AI 已经相当可靠;但”骑车的人""组装示意图""产品细节图”这类需要空间感的,细节处仍可能悄悄翻车——就像那只把腿放在自行车同一侧的鹈鹕,第一眼没问题,细看全是问题。
两年前鹈鹕考试刚出来时,大家觉得”AI 连这都画不好”;两年后它毕业了,大家又开始争论”AI 是不是真的会了”。这场考试真正的遗产,或许是提醒所有人:分数可以毕业,能力不会。下一场考试的监考老师,已经站在考场门口了。
参考链接:
- Karpathy 的 X 帖子(宣布鹈鹕测试退役 + 《指环王》3D 渲染演示)
- HN 讨论帖(“Karpathy’s Pelican”,近 400 分、300 余条评论)
- Simon Willison:pelican-riding-a-bicycle 标签页(130 篇相关文章)
- Simon Willison:Kimi K3,以及我们还能从鹈鹕基准学到什么
- Dylan Castillo:AI 实验室是否在偷偷”刷鹈鹕题”(pelicanmaxxing 研究)