英国の伝統的な村祭り(village fayre)を告知する1枚のポスターがFacebook上で瞬く間に拡散され、英紙インディペンデントまでもが「AI poster slop(AIポスターの粗製乱造)」と揶揄されるこの現象を大々的に報じる事態となった。これらの画像自体は決して見苦しいわけではない。水彩画のような質感もカントリー風の牧歌的な佇まいも、単体で見れば一定の水準を満たしている。真の違和感は、一般のユーザーが過不足のないイベント情報を入力したにもかかわらず、生成されるものが常に判を押したような定型テンプレートに陥る点にある。同じ意匠を掲示板で20回も見せられれば、見る側はうんざりし始める。
統計的確率に基づく基盤モデルは、本質的に平均への回帰という性質を抱えている。ユーザーがイベントポスターを要求したとき、モデルが出力するのは訓練データに存在する無数の汎用フライヤーが重なり合った残像にすぎない。Hacker Newsでは、このデザインのジレンマを巡る議論が1,280以上の支持票と700件を超えるコメントを集め、当日のトップスコアを記録した。開発者のJohn Hartnupは、100通りを超えるポスター様式のプロンプトカタログを公開。彼の限界テストが突きつけた冷徹な現実は、生成AIの過ちは描画能力の不足にあるのではなく、タイポグラフィにおける最も基本的な常識の欠落にあるという点だった。
図:ネット上で話題となったAI生成の村祭りポスターのコラージュ。出典:john.hartnup.uk
限界テスト:抽象的な形容詞の羅列を打ち破る「歴史的様式」の指定
Hartnupの実験は、架空の春祭りを設定することから始まった。彼はChatGPTに対し、極めて詳細かつ現実的な催し物の情報を入力した。4月21日午前11時から午後3時までMill Beach Parkで開催、入場無料、富くじ(tombola)、ケーキやドリンクの販売、手芸品の屋台、サンババンドやドール(dhol)太鼓隊の生演奏、サーカススキルの体験教室。ありきたりな陳腐さを避けるため、プロンプトでは「春をテーマにした大胆で力強いグラフィック、すっきりと整理された明るいレイアウト」を明確に求め、「パステル調、エアブラシ、油絵スタイル、人物の描写は避けること」と強く念を押した。
しかし最初に出てきた出力は、相変わらず安っぽいバザーの雰囲気を濃厚にまとっていた。モデルは否定の形容詞をあっさりと無視し、「春祭り(spring fayre)」という語が持つデフォルトの確率分布に執着した。拡散モデルにおける否定語の重み制御はいまだ脆弱であり、抽象的なレイアウト指示は具体的な名詞タグの引力にいとも簡単に屈してしまう。モデルは10個のアトラクション情報を受け取ると、情報の優先順位を整理するのではなく、キャンバス内に10個のイラスト要素を力任せに詰め込もうとしたのだ。
Hartnupは直ちに発想を転換した。先ほどの結果を反面教師として提示し、意図的に全く異なる美学を出力するよう求めた。その結果得られたのが、バウハウスに触発された幾何学的モダニズムの幾何学的な組版だった。デフォルトの定型テンプレートを脱却したというただそれだけの理由で、そのポスターは無個性な画像の群れの中から鮮烈に浮き上がって見えた。
図:著者が2回目の試みで得たバウハウス/幾何学的モダニズム調のポスター。出典:john.hartnup.uk
この試行は、従来のプロンプトエンジニアリングの常識を覆す実践的な法則を示唆している。抽象的な形容詞を幾重にも積み重ねるよりも、1940年代のキュビスム展ポスターのように、具体的かつ確立された歴史的様式を指定する方がはるかに有効だという事実だ。歴史的な芸術運動は、モデルの訓練データの中で強固に凝集した特徴クラスタを形成している。認知された様式のインデックスを直接呼び出すことは、主観的な形容詞を10個以上並べて新しいスタイルを継ぎ接ぎするよりも、はるかに整合性の取れた視覚文法を引き出すことができる。
ChatGPTは自身が再現可能な多様な流派を次々と列挙したが、その中には原作者すら耳にしたことのない名称も含まれていた。以下は、実験を通じて観察されたプロンプトの入力戦略と出力結果の対照である:
| テスト段階 | プロンプト入力戦略 | モデルが出力した様式 | コア評価判定 |
|---|---|---|---|
| 初期テスト | パステル調や油絵を避け、クリーンな配置を指示 | デフォルトの村祭りテンプレート | 極めて重複しやすい。同一スタイルを20回見ると辟易する |
| 反対指示テスト | 前回の美学を回避し、反面教師として指定 | バウハウス/幾何学的モダニズム | 視覚的効果が大幅に向上。単に他と異なるだけで際立つ |
| 様式の明示 | 1940年代のキュビスム展と具体的に指定 | キュビスム展ポスター | 正確な視覚的再現。抽象的な形容詞の羅列よりはるかに効果的 |
| 一括検証 | スイス・インターナショナル・スタイルを直接指定 | (収録された100種類のポスタースタイルの一つ) | 歴史的様式を直接指定する方が抽象的記述より有効と証明 |
| 一括検証 | リソグラフ(Risograph)印刷を直接指定 | (収録された100種類のポスタースタイルの一つ) | (同上) |
| 一括検証 | マティスの切り絵コラージュを直接指定 | (収録された100種類のポスタースタイルの一つ) | (同上) |
| 一括検証 | 90年代のレイヴフライヤーを直接指定 | (収録された100種類のポスタースタイルの一つ) | (同上) |
視覚的ノイズに埋もれる文字:鑑賞者を宝探しに追い込む構図
ブルータリズム、メンフィス・デザイン、単色背景にアクセントカラーを1色重ねる構成など、大規模モデルが100種類以上のスタイルに対する適応力を誇示しても、実際の出力画像は依然として鑑賞者に強い疲労感を与える。Hacker Newsの議論において、開発者の eloisant は最も核心を突いた指摘を投じた。AIポスターが抱える致命的な欠陥は、情報が一目で飛び込んでくるのではなく、鑑賞者に情報を探させる点にあるというのだ。
「私がAIポスターに対して抱く最大の問題は、あまりにも要素が多すぎて過密であり、瞬時に目に入るべき情報を見つけ出すために画面内を探さなければならない点だ」と eloisant は述べる。AIが登場する以前、地域のボランティアがMicrosoft Wordで作った稚拙な貼り合わせチラシであっても、このような根本的な過ちを犯すことは稀だった。どれほど素人であっても、日時、開催場所、重要な催し物といった中核情報を路上の歩行者が読み取れるよう大きく配置すべきだという感覚は持ち合わせている。しかし画像モデルの処理法は、画面全体を装飾文様やサンバの楽器、サーカスの小道具で埋め尽くし、肝心のイベント情報を画面の片隅に押し込めてしまう。
現在の画像生成モデルは、文字が持つ情報伝達の優先順位を理解していない。文字フォントを花や木々と同じ単なるピクセルの色彩ブロックとして均一に並べ立て、読みやすさの階層ではなく、全体の画面密度と構図の均整ばかりを追求する。数行の文字情報を与えた結果として返されるのは、伝達手段としてのポスターではなく、ピクセルノイズが散乱する迷路なのだ。
図:著者が言及した90年代のドラムンベース(drum & bass)フライヤー様式。出典:john.hartnup.uk
筆を与えられても、タイポグラフィの「目利き」は手に入らない
画像の生成コストがゼロまで引き下げられたとき、制作物は必然的に画一化へと向かう。コメント欄の vintagevibe は、この混乱の本質を的確に言語化した。制作のサプライチェーンにおいて、プロのデザイナーが提供する本質的価値は「編集者」としての機能にある。彼らはクライアントの膨大な要望と鑑賞者の有限な注意力の間に入り、大胆な間引きと整理を行うことで、情報の主従関係を鮮明に伝達する。
デザインの素養を持たない一般利用者に生成能力だけを渡し、肝心のタイポグラフィに対する判断力を同時に手渡せないことこそが、視覚的粗悪品が氾濫する根本原因だ。誰も要素を削ぎ落とす責任を負わないため、出力されるのは提示されたすべての要件を無秩序に盛り込んだキメラのような画像にならざるを得ない。ユーザーの yellowapple が率直に指摘するように、短期間でデザイナーが完全に代替されることはない。なぜならクライアント側に欠けているものこそが、抑制に基づく美的な目利きだからだ。
万能の生成器は、特定の専門領域において巨大な能力の空白を抱えている。ツールがあらゆる人々に「足し算」の力を与えたとき、真に希少な資源となるのは「引き算」を行う技術だ。Hacker Newsで ereiamjh として活動する著者Hartnup自身も、スレッド内でその非を認めている。100組のプロンプトをレンダリングし、2巡にわたって検証を重ねた後、彼は画面に要素が過剰に詰め込まれているという事実に思い至った。「プロンプトで明示的に指示しない限り、AIはプロンプトに含まれるすべての単語に対して視覚的要素を割り当てようとする。もっと画面の雑音を減らすよう強制すべきだった」と彼は振り返る。
コードによるレイヤー分離:1枚のビットマップ合成という袋小路を脱する
編集不能な平坦画像という行き詰まりを打破するため、Hartnupはより現実的で技術的な解決策を提示している。単層のビットマップ画像にすべてを完結させる力任せの合成をやめ、Claude CodeやGeminiのような言語モデルにHTML/CSS、ベクターSVG、あるいはレイヤー付きのPDFを直接出力させるアプローチだ。この構造においては、文字はテキストとしての属性を維持し、レイヤーは独立した構造を取り戻す。ポスターは変更不可能な固定画像ではなく、CSSでフォントをいつでも差し替えられ、DOMツリー上で要素の位置を自由に再配置でき、前景と背景が完全に分離された再編集可能なデジタル資産へと昇格する。
システム設計の観点から見れば、これはアーキテクチャの次元を下げることで品質のボトルネックを解消する戦略といえる。拡散モデルが情報の階層構造を伴う組版を苦手とするならば、それを背景の挿絵生成器へと役割を絞り込み、文字の配置とレイアウトの仕事は構造化コードの扱いに長けた大規模言語モデルに任せる。コードで骨格を組み、画像で余白を彩るという適材適所の協調だ。
AIが生成するポスターは、見かけの絵としては成立していても、情報伝達としては機能不全に陥っている。生成デザインを巡る今回の一連の議論は、業界全体に重要な教訓を残した。ツールは精緻なピクセルをいくらでも大量生産できるが、タイポグラフィに欠かせない自制と選別の美学までを肩代わりすることはできない。画面全体を華麗な装飾で埋め尽くすことが容易になった今、いかに美しい余白を残せるかという問いこそが、現代の生成システムにとって最も乗り越えがたい壁となっている。
参考リンク:
- AI Event Posters
- Hacker News 議論