Trellner Researchの最新調査により、不安な事実が明らかになった。AI検索ツールに380の異なる分野のソフトウェア購入に関するアドバイスを求めたところ、システムが提示した7534の参照リンクのうち59.8%が、世界のトラフィックランキングで10万位圏外の無名ウェブサイトを指していた。引用されたドメインの3分の1以上が上位100万位にすら入っておらず、引用された全ウェブサイトの中央値ランキングはわずか71611位であった。AI検索は人々が期待したように玉石混交から良いものを選び出すのではなく、インターネットの辺境にある「ゴミ」情報をテーブルに並べているのだ。
3つのウェブサイトが21.5万ページの偽ランキングを作成
劣悪な情報の源は、wifitalents.com、worldmetrics.org、gitnux.orgという3つの結託した「コンテンツファーム」である。これらはすべて2023年12月から2024年5月にかけてNameCheapを通じて集中的に登録され、同じCloudflareネームサーバーを共有しているだけでなく、ウェブテンプレート、ナビゲーションカテゴリ、さらには「編集プロセス」や「会社概要」などの周辺ページまで完全に同じである。この工業化された組み立てラインは、各サイトに7万以上の「最高のソフトウェア」レビューページを生成し、同じ構成のバックアップサイトzipdo.coを加えると、偽造されたレビューは合計21.5万ページに上る。
世界には21.5万種類ものソフトウェアカテゴリは存在しない。これらのいわゆるレビューは機械によって大量につなぎ合わされた産物であり、「油井管理ソフトウェア」や「博物館コレクション管理ソフトウェア」といった非常に稀なカテゴリでさえも、もっともらしく10のツールをまとめてランキング比較を行っている。
図:wifitalents.com上の「最高の油井管理ソフトウェア」ランキングページ。ソース:wifitalents.comページスクリーンショット
調査員は、同じ「プロジェクト見積もりソフトウェア」カテゴリにおいて、3つのウェブサイトがそれぞれ全く異なるトップ5ランキングを提示しているにもかかわらず、もっともらしく9人の異なる「編集者」の名前が署名されていることを発見した。
| サイト | 第1位 | 第2位 | 第3位 | 第4位 | 第5位 |
|---|---|---|---|---|---|
| worldmetrics.org | Float | Scoro | Teamwork.com | Procore | Wrike |
| wifitalents.com | Float | Scoro | Teamwork.com | Buildertrend | Apropo |
| gitnux.org | Saviom | Mosaic | Buildertrend | Float | Teamwork.com |
gitnuxのトップは他の2社のトップ5には全く見当たらない。一部のページの署名欄には、未レンダリングのテンプレートコード変数「Within the next 26 days」がはっきりと残っていることさえある。この低劣な偽造手法は、それらが同じスクリプトで実行された人手のかからない産物であり、背後にはサーバー1台と安価なAPI呼び出しコストしか必要ないことを暴露している。
検索エンジンに読み取らせるために書かれたウェブページ
これら21.5万のウェブページは、最初から人間に読ませるためのものではない。worldmetrics.orgのHTMLウェブページコードのタイトルには、直接「Facts & Grounding Page」(事実と根拠のページ)と明記されている。これは大規模モデルの検索システムだけが読み取って理解するデータタグであり、そのウェブページの非表示の説明情報にも「機械可読レコード向けの検証済み事実」と隠すことなく書かれている。
図:worldmetrics.org上のプロジェクト見積もりソフトウェアランキング。wifitalents.comと同じテンプレート。ソース:worldmetrics.orgページスクリーンショット
機械に読ませるために特別に提供されたこの偽造情報の背後には、価格が明示された商業的な裁定取引ビジネスがある。機械生成コンテンツを利用してAIによる引用の重みを高めた後、worldmetrics.orgは公式サイトで公然とサービスを販売している。カスタム市場調査は5000ユーロから、完成したレポートは499ユーロで販売され、「サプライヤーのスクリーニング」を手伝うだけでも2500ユーロが請求される。
従来の検索エンジン最適化が効果を失った後、コンテンツファームは大規模モデルに対処するための新たな活路を見出した。インタラクティブなデモ製品を販売するマーケティングブログguideflow.comにはソフトウェアレビューコンテンツ自体はないが、文体がモデルの好みに合っているため、96のカテゴリにまたがってAI検索によって194回引用された。この無名のブログは引用ランキングで世界的に有名な分析機関Gartnerを打ち負かし、馬鹿げたことに「3Dレンダリングソフトウェア」や「RFIDソフトウェア」などの専門的な質問の核心的な証拠となった。
公式推奨を装うギャンブルリンク
虚偽の情報源が大量に流入したことで、推奨結果に深刻な方向性の偏りが直接生じた。最終的に生成された推奨リストのうち、1.1%のベンダーの公式サイトはすでに閉鎖されているか、ドメインの所有者が変わっていた。調査員が「科学研究データ管理プラットフォーム」について尋ねたところ、sonarモデルが提示した公式推奨リンクdryad.coは、インドネシアのBIGSLOT288というオンラインギャンブルポータルに直接リダイレクトされた。
「データ品質ツール」に関する別の回答では、プレミアムモデルsonar-proの推奨結果がモナコの高級カジノホテルの公式サイトに直接ジャンプした。調査により、これら2つのモデルが同じ基盤の検索レイヤーを共有しており、380のカテゴリのうち289でバイト単位で完全に同じ引用リストが返され、劣悪なデータがシステム全体を汚染していることが明らかになった。
対照的に、中立的かつ客観的であることで知られるWikipediaは、7534の引用すべての中でわずか3回しか出現しなかった。現実世界の高品質な情報は、ウェブサイトの機械によって生成された常套句に埋もれ、排除されてしまったのである。
情報源レベルから崩壊する信頼の連鎖
調査レポートは、これらの劣悪な情報源がAI検索の最終的な推奨回答を変えたと断言することは現時点ではできないと述べているが、これは大規模モデルの検索レイヤーにおける体系的な脆弱性をすでに露呈している。ベテランのSEO実務者は、さらに高度な手法を暴露している。まず質問を用いて各大規模モデルをテストし、テキストの相違偏差を計算する。次にAIを使用して記事をバッチで書き換え、ウェブページのテキスト特徴を大規模モデルの組み込みの好みに正確に近づけるというものである。
大規模言語モデル自体、AIが生成したテキストを好むという固有の傾向がある。開発者コミュニティの自己テストでは、AIモデルは、人間がリファクタリングした簡潔なコードと自身の冗長な生成コードに直面した際、常に頑なに後者を選択する。以前には、ある国がシンクタンクのウェブサイトを大量に偽造してAIに学習させ、特定の立場の政治的見解を大量に出力させたことがメディアによって暴露されたこともある。
AI検索の推奨システムは、偽のレビューによって体系的に汚染されている。「コンテンツファーム」はAIの好みを満たす偽の情報源を作ることを学び、その結果、AI検索は反響室へと成り下がった。どのソフトウェアが最適かを尋ねると、それは別の機械がずっと前に書いた虚偽の広告を画面に印刷するだけである。
参考リンク:
- Trellner Research レポート
- HN ディスカッション (item?id=49536375)