AI 海报刷屏被骂丑,作者试了 100 版才发现真问题

AI 海报刷屏被骂丑,作者试了 100 版才发现真问题

AI 工具排版设计

数据源:HN + web research

一张英国乡村集市(village fayre)海报在 Facebook 上被疯传,连《独立报》都专门跑来报道这种被称为「AI poster slop」的视觉垃圾。这些图片本身其实并不难看,水彩质感和乡村风情都达到了及格线。真正的反常识在于,普通人把完整的活动需求喂给机器后,生成的依然是一张千篇一律的模板图。同一个风格见二十遍之后,观众就开始感到厌烦。

基于统计概率的模型天然倾向于向均值回归。当你向机器索要一张海报时,它输出的是训练集中所有海报的重叠残影。在 Hacker News 上,这场关于排版设计的讨论获得了 1281 个支持和 707 条评论,拿下了当日最高分。开发者 John Hartnup 发布了一份包含上百种海报风格提示词的目录,他的极限测试揭露了一个残酷事实:AI 并没有犯画工不足的错,却犯了最基础的排版常识错误。

流传的乡村集市海报 图:网上流传的 AI 生成乡村集市海报拼图。来源:john.hartnup.uk

极限测试:历史流派击破形容词堆砌

John Hartnup 的实验从一场虚构的春季集市开始。他给 ChatGPT 喂了详尽的活动信息:4 月 21 日上午 11 点到下午 3 点在 Mill Beach Park 举行,免费入场。活动包含抽奖、蛋糕饮料、手工艺摊位,甚至还有桑巴乐队配 dhol 鼓队以及杂耍体验课。为了避开俗套,他在提示词里明确要求干净、不繁琐、明亮的排版,使用粗体春天图形,并强调避免粉彩、喷枪、油画风格和人物。

第一次的产出依然保留了那股挥之不去的廉价乡村集市味。机器无视了否定的形容词,死死咬住了「集市」这个词的默认概率分布。扩散模型对否定词的权重控制依然孱弱,抽象的布局指令在具象的物体标签面前毫无抵抗力。机器看到十个活动元素,它第一反应是在画布上塞进十个对应的图形,而不是规划文字版面。

Hartnup 随即转换思路,要求机器输出相异的设计美学,并把刚才那一版当反面教材。这次出来的结果是一张 Bauhaus(包豪斯)风格的几何排版。它仅仅因为打破了默认样式,就立刻从无数同质化的图片中跳了出来。

包豪斯风格测试 图:作者第二次尝试得到的 Bauhaus / 几何现代主义风格海报。来源:john.hartnup.uk

这一尝试揭示了一个违背常规提示词法则的规律:指名一种具体的历史流派,比如要求做成四十年代立体主义展览海报的样子,比单纯堆砌抽象形容词有效得多。历史流派在训练数据中已经构成了高度凝聚的特征簇,直接调用特征簇的索引,远比临时用十几个形容词去拼接一个新风格来得精确。

ChatGPT 随口就能列出十几种它能处理的具体风格,其中有些名字连原作者都没听过。下面是该实验中暴露出的风格映射关系与输出效果对照:

测试阶段提示词输入策略机器输出流派核心效果判定
初步测试避免粉彩与油画,要求干净排版默认乡村集市模板极易重复,同一风格见二十遍令人厌烦
反向测试避开上一版美学,作为反面教材Bauhaus / 几何现代主义视觉效果更佳,仅仅因为不一样就跳出来了
流派指定指名要求四十年代立体主义立体主义展览海报视觉呈现精准,比抽象描述有效得多
批量验证直接输入瑞士国际主义(一百种海报风格之一)证明直接指定历史风格比抽象描述更有效
批量验证直接输入 Risograph 印刷(一百种海报风格之一)(同上)
批量验证直接输入 Matisse 剪纸拼贴(一百种海报风格之一)(同上)
批量验证直接输入 九十年代锐舞传单(一百种海报风格之一)(同上)

字被视觉杂物淹没,观众被迫玩寻宝游戏

即使大模型展现了对粗野主义、Memphis、单色叠加单一强调色等上百种风格的熟悉度,它的实际成片依然让人感到不适。Hacker News 上的开发者 eloisant 给出了最锋利的判据:AI 海报的核心灾难在于信息需要靠找,而不是靠一眼看见。

在 AI 介入之前,哪怕是社区志愿者用 Word 凑合拼贴的业余海报,也没有犯过这种低级毛病。人再业余,也知道要把具体的活动时间、地点和几十个字的要求放得足够大,保证路人走在街上能看得清。然而机器的处理方式是把画面塞满繁复的花纹、桑巴乐器和马戏团杂耍图案,让关键信息委屈地挤在画布角落。

当前的图像生成模型并不理解文字作为信息载体的优先级。它们把字母当成与花朵、树木平级的像素色块来排列,追求的是整体画面的密集度与构图平衡,而不是阅读层级。当你丢给它几行字,它给你的是一张布满像素噪点的迷宫。

90 年代 drum & bass 传单风格 图:作者点名的 90 年代 drum & bass 传单风格。来源:john.hartnup.uk

机器分发画笔,却没有同时交付排版品味

出图门槛一旦被抹平,产出必然走向趋同。讨论区里的 vintagevibe 点破了这场混乱的实质:专业设计师在产业链中的核心价值在于担任编辑。他们负责在客户的庞杂需求与受众的有限注意力之间做删减,把信息主次分明地传递出去。

把生成能力直接交还给没有设计背景的普通客户,却无法同时交付排版判断力,这就是工业垃圾泛滥的源头。由于没人负责做精简,出来的就只能是堆砌所有要求元素的缝合怪。用户 yellowapple 直言,短期内设计师不会被替代,因为客户缺的正是那种基于克制的判断力。

全能生成器在特定细分领域存在巨大的能力真空。当工具赋予所有人做加法的能力时,做减法就成了稀缺资源。连 Hartnup 本人,也就是 ID 为 ereiamjh 的原作者,也在评论区下场认错。他承认自己渲染了一百组提示词、来回跑了两遍之后,才猛然意识到问题出在画面杂物太多,并表示下一个版本必须强制要求更少的视觉元素。

生成代码剥离图层,跳出像素合成死胡同

为了解决信息无法编辑的死局,Hartnup 指出了一条更务实的技术路径:不再让模型死磕单层位图的像素合成,而是让 Claude 或 Gemini 直接生成 HTML、PNG 图层或 PDF 文件。在这个框架下,文字回归真实的文字属性,图层恢复真实的图层结构。海报不再是一张写死所有像素的图片,而是一个可以二次操作的数字资产。字体可以随时在 CSS 里更换,元素位置可以在 DOM 树中任意挪动,背景与前景完成解耦。

从系统设计的角度看,这是一种通过架构降维来解决质量瓶颈的策略。既然扩散模型处理不好信息层级的排版,就把它降级为单纯的背景插图生成器,把文字排版的工作交还给擅长处理结构化代码的大语言模型。用代码构建版面,用图片填充背景,各取所长。

AI 把这些海报画得不丑,但也把它们塞得没法念。这场关于生成式设计的风波给全行业提了醒:工具能批量生成精美的像素,但替代不了排版环节中必备的克制与筛选。当整个屏幕都被繁复华丽的内容填满时,如何留下空白,反而成了当前生成系统最难越过的门槛。

参考链接:

  • AI Event Posters
  • HN 讨论