一张英国乡村集市(village fayre)海报在 Facebook 上被疯传,连《独立报》都专门跑来报道这种被称为「AI poster slop」的视觉垃圾。这些图片本身其实并不难看,水彩质感和乡村风情都达到了及格线。真正的反常识在于,普通人把完整的活动需求喂给机器后,生成的依然是一张千篇一律的模板图。同一个风格见二十遍之后,观众就开始感到厌烦。
基于统计概率的模型天然倾向于向均值回归。当你向机器索要一张海报时,它输出的是训练集中所有海报的重叠残影。在 Hacker News 上,这场关于排版设计的讨论获得了 1281 个支持和 707 条评论,拿下了当日最高分。开发者 John Hartnup 发布了一份包含上百种海报风格提示词的目录,他的极限测试揭露了一个残酷事实:AI 并没有犯画工不足的错,却犯了最基础的排版常识错误。
图:网上流传的 AI 生成乡村集市海报拼图。来源:john.hartnup.uk
极限测试:历史流派击破形容词堆砌
John Hartnup 的实验从一场虚构的春季集市开始。他给 ChatGPT 喂了详尽的活动信息:4 月 21 日上午 11 点到下午 3 点在 Mill Beach Park 举行,免费入场。活动包含抽奖、蛋糕饮料、手工艺摊位,甚至还有桑巴乐队配 dhol 鼓队以及杂耍体验课。为了避开俗套,他在提示词里明确要求干净、不繁琐、明亮的排版,使用粗体春天图形,并强调避免粉彩、喷枪、油画风格和人物。
第一次的产出依然保留了那股挥之不去的廉价乡村集市味。机器无视了否定的形容词,死死咬住了「集市」这个词的默认概率分布。扩散模型对否定词的权重控制依然孱弱,抽象的布局指令在具象的物体标签面前毫无抵抗力。机器看到十个活动元素,它第一反应是在画布上塞进十个对应的图形,而不是规划文字版面。
Hartnup 随即转换思路,要求机器输出相异的设计美学,并把刚才那一版当反面教材。这次出来的结果是一张 Bauhaus(包豪斯)风格的几何排版。它仅仅因为打破了默认样式,就立刻从无数同质化的图片中跳了出来。
图:作者第二次尝试得到的 Bauhaus / 几何现代主义风格海报。来源:john.hartnup.uk
这一尝试揭示了一个违背常规提示词法则的规律:指名一种具体的历史流派,比如要求做成四十年代立体主义展览海报的样子,比单纯堆砌抽象形容词有效得多。历史流派在训练数据中已经构成了高度凝聚的特征簇,直接调用特征簇的索引,远比临时用十几个形容词去拼接一个新风格来得精确。
ChatGPT 随口就能列出十几种它能处理的具体风格,其中有些名字连原作者都没听过。下面是该实验中暴露出的风格映射关系与输出效果对照:
| 测试阶段 | 提示词输入策略 | 机器输出流派 | 核心效果判定 |
|---|---|---|---|
| 初步测试 | 避免粉彩与油画,要求干净排版 | 默认乡村集市模板 | 极易重复,同一风格见二十遍令人厌烦 |
| 反向测试 | 避开上一版美学,作为反面教材 | Bauhaus / 几何现代主义 | 视觉效果更佳,仅仅因为不一样就跳出来了 |
| 流派指定 | 指名要求四十年代立体主义 | 立体主义展览海报 | 视觉呈现精准,比抽象描述有效得多 |
| 批量验证 | 直接输入瑞士国际主义 | (一百种海报风格之一) | 证明直接指定历史风格比抽象描述更有效 |
| 批量验证 | 直接输入 Risograph 印刷 | (一百种海报风格之一) | (同上) |
| 批量验证 | 直接输入 Matisse 剪纸拼贴 | (一百种海报风格之一) | (同上) |
| 批量验证 | 直接输入 九十年代锐舞传单 | (一百种海报风格之一) | (同上) |
字被视觉杂物淹没,观众被迫玩寻宝游戏
即使大模型展现了对粗野主义、Memphis、单色叠加单一强调色等上百种风格的熟悉度,它的实际成片依然让人感到不适。Hacker News 上的开发者 eloisant 给出了最锋利的判据:AI 海报的核心灾难在于信息需要靠找,而不是靠一眼看见。
在 AI 介入之前,哪怕是社区志愿者用 Word 凑合拼贴的业余海报,也没有犯过这种低级毛病。人再业余,也知道要把具体的活动时间、地点和几十个字的要求放得足够大,保证路人走在街上能看得清。然而机器的处理方式是把画面塞满繁复的花纹、桑巴乐器和马戏团杂耍图案,让关键信息委屈地挤在画布角落。
当前的图像生成模型并不理解文字作为信息载体的优先级。它们把字母当成与花朵、树木平级的像素色块来排列,追求的是整体画面的密集度与构图平衡,而不是阅读层级。当你丢给它几行字,它给你的是一张布满像素噪点的迷宫。
图:作者点名的 90 年代 drum & bass 传单风格。来源:john.hartnup.uk
机器分发画笔,却没有同时交付排版品味
出图门槛一旦被抹平,产出必然走向趋同。讨论区里的 vintagevibe 点破了这场混乱的实质:专业设计师在产业链中的核心价值在于担任编辑。他们负责在客户的庞杂需求与受众的有限注意力之间做删减,把信息主次分明地传递出去。
把生成能力直接交还给没有设计背景的普通客户,却无法同时交付排版判断力,这就是工业垃圾泛滥的源头。由于没人负责做精简,出来的就只能是堆砌所有要求元素的缝合怪。用户 yellowapple 直言,短期内设计师不会被替代,因为客户缺的正是那种基于克制的判断力。
全能生成器在特定细分领域存在巨大的能力真空。当工具赋予所有人做加法的能力时,做减法就成了稀缺资源。连 Hartnup 本人,也就是 ID 为 ereiamjh 的原作者,也在评论区下场认错。他承认自己渲染了一百组提示词、来回跑了两遍之后,才猛然意识到问题出在画面杂物太多,并表示下一个版本必须强制要求更少的视觉元素。
生成代码剥离图层,跳出像素合成死胡同
为了解决信息无法编辑的死局,Hartnup 指出了一条更务实的技术路径:不再让模型死磕单层位图的像素合成,而是让 Claude 或 Gemini 直接生成 HTML、PNG 图层或 PDF 文件。在这个框架下,文字回归真实的文字属性,图层恢复真实的图层结构。海报不再是一张写死所有像素的图片,而是一个可以二次操作的数字资产。字体可以随时在 CSS 里更换,元素位置可以在 DOM 树中任意挪动,背景与前景完成解耦。
从系统设计的角度看,这是一种通过架构降维来解决质量瓶颈的策略。既然扩散模型处理不好信息层级的排版,就把它降级为单纯的背景插图生成器,把文字排版的工作交还给擅长处理结构化代码的大语言模型。用代码构建版面,用图片填充背景,各取所长。
AI 把这些海报画得不丑,但也把它们塞得没法念。这场关于生成式设计的风波给全行业提了醒:工具能批量生成精美的像素,但替代不了排版环节中必备的克制与筛选。当整个屏幕都被繁复华丽的内容填满时,如何留下空白,反而成了当前生成系统最难越过的门槛。
参考链接:
- AI Event Posters
- HN 讨论