Trellner Research 的一项最新调查揭开了一个让人不安的事实:向 AI 搜索工具提问 380 种不同领域的软件选购建议时,系统给出的 7534 个参考链接中,有 59.8% 指向了全球流量排名十万开外的不知名网站。有超过三分之一的被引用域名,连全球前一百万名都排不进去,所有被引用网站的中位数排名仅为 71611 名。AI 搜索并没有像人们期待的那样大浪淘沙,而是把互联网边缘的垃圾信息端上了桌面。
三个网站造出 21.5 万页假榜单
劣质信息的源头来自 wifitalents.com、worldmetrics.org 和 gitnux.org 这三个互相勾结的内容农场。它们均在 2023 年 12 月到 2024 年 5 月期间通过 NameCheap 集中注册,不仅共用着相同的 Cloudflare 域名服务器,连网页模板、导航栏分类甚至「编辑流程」和「公司介绍」等外围页面都一模一样。这套工业化流水线为每个站点生成了超过 7 万个「最佳软件」评测页面,加上另一个同款配置的备用站点 zipdo.co,伪造的评测总计高达 21.5 万页。
世界上根本没有 21.5 万种软件品类。这些所谓评测是机器批量拼接生成的产物,诸如「油井管理软件」或是「博物馆馆藏管理软件」这种十分罕见的类目,也能一本正经地凑出 10 个工具进行排名对比。
图:wifitalents.com 上的「最佳油井管理软件」榜单页面。来源:wifitalents.com 页面截图
调查人员发现,在同一个「项目估算软件」类目下,三家网站各自给出了截然不同的 Top5 榜单,却煞有介事地署名了 9 个不同的「编辑」。
| 站点 | 第1名 | 第2名 | 第3名 | 第4名 | 第5名 |
|---|---|---|---|---|---|
| worldmetrics.org | Float | Scoro | Teamwork.com | Procore | Wrike |
| wifitalents.com | Float | Scoro | Teamwork.com | Buildertrend | Apropo |
| gitnux.org | Saviom | Mosaic | Buildertrend | Float | Teamwork.com |
gitnux 的榜首在另外两家的前五名里根本找不到。甚至在部分页面的署名栏里,还赫然残存着未渲染的模板代码变量「Within the next 26 days」。低劣的造假手法暴露了它们只是同一套脚本跑出来的无人工干预产物,背后只需要一台服务器和廉价的 API 调用成本。
网页专写给检索器读取
这 21.5 万个网页从诞生起就不是让人来读的。worldmetrics.org 的 HTML 网页代码标题直接标明「Facts & Grounding Page」(事实与基础页面)。这是一个只有大模型检索系统才去读取和理解的数据标记,其网页的隐藏描述信息中也毫不掩饰地写着「面向机器可读记录的已验证事实」。
图:worldmetrics.org 上的项目估算软件榜单,与 wifitalents.com 是同一套模板。来源:worldmetrics.org 页面截图
这种专门投喂给机器的伪造信息,背后是一门明码标价的商业套利生意。在利用机器生成的内容刷高被 AI 引用的权重后,worldmetrics.org 在官网上公然售卖服务:定制市场研究 5000 欧元起步,成品报告卖 499 欧元,甚至帮忙做「供应商筛选」也要收取 2500 欧元。
传统搜索引擎优化失效后,内容农场找到了对付大模型的新出路。一个销售互动演示产品的营销博客 guideflow.com,本身没有任何软件评测内容,却因为行文风格贴合模型喜好,横跨 96 个类目被 AI 搜索引用了 194 次。这个不知名的博客在引用榜上击败了全球知名分析机构 Gartner,荒唐地成为了「3D 渲染软件」和「RFID 软件」等专业问题的核心证据。
赌博链接冒充官方推荐
虚假信源大量涌入,直接导致推荐结果出现了严重的导向偏差。在最终生成的推荐列表中,有 1.1% 的厂商官网早已倒闭或者域名易主。当调查人员询问「科研数据管理平台」时,sonar 模型给出的官方推荐链接 dryad.co 直接重定向到了印尼的一家名为 BIGSLOT288 的在线赌博门户。
在另一个关于「数据质量工具」的回答中,高级版模型 sonar-pro 的推荐结果直接跳转到了摩纳哥的一家赌场酒店官网。调查揭示了这两款模型共享着同一个底层检索层,在 380 个类目中有 289 个返回了逐字节相同的引用列表,劣质数据污染了整个系统。
相比之下,以中立客观著称的维基百科,在全部 7534 条引用中只出现了区区 3 次。真实世界的高质量信息就这样被网站机器生成的车轱辘话淹没并排挤出局了。
信任链条从信源层崩塌
调查报告声明目前无法断言这些劣质信源改变了 AI 搜索的最终推荐答案,但这已经暴露出大模型检索层的系统性漏洞。资深 SEO 从业者甚至披露了更高级的玩法:先用问题测试各个大模型,计算文本的散度偏差,再用 AI 批量重写文章,让网页的文本特征精准逼近大模型的内置偏好。
大语言模型本身就存在偏爱 AI 生成文本的固有倾向。在开发者社区的自测中,AI 模型在面对人工重构的精简代码和自己冗长的生成代码时,总是固执地选择后者。此前更是有媒体曝光过,某国通过批量伪造智库网站来投喂 AI,使其大量输出带有特定立场的政治观点。
AI 搜索的推荐系统正在被伪测评系统性投喂。内容农场学会了制造满足 AI 喜好的伪造信源,AI 搜索随之沦为一面回声墙。当你询问它哪款软件最好时,它只会在屏幕上打印出另一台机器早早写好的虚假广告。
参考链接:
- Trellner Research 报告
- HN 讨论 (item?id=49536375)