网站99%的访客是机器人:一个站长的AI战争

网站99%的访客是机器人:一个站长的AI战争

安全AI互联网

数据源:HN + web research · HN

一个 150 万页的网站,过去一年 99% 的访问来自机器人——不是人,是 AI 公司派来的爬虫。真实访客只占 1%。这是站长尼克最近写下的数字,文章标题就叫《99% of My Website Traffic Is Bots》(99% 的网站流量是机器人),在技术社区 Hacker News 引发 300 多条讨论。

先看一组更扎眼的数据。某周,Anthropic(开发 Claude 的那家公司)的搜索爬虫,从他的网站抓走了 42 万页内容。同一周,Claude 一共给他带回来 12 个真人访客。42 万页换 12 个人,这是「AI 时代网站生意」的缩影。

尼克自己也是吃网络饭的人,他的网站靠整理公开档案信息为生。他在文章里自嘲:我的数据本来就是靠抓公开文档得来的,一个爬虫在写博客抱怨爬虫,我知道这听起来很讽刺。这份坦诚让后面的抱怨更有分量——连同行都受不了了,说明事情确实过了线。

AI 为什么要偷着抓你的网站

大模型不是天生就会说话的。ChatGPT、Claude 这些 AI 之所以能回答问题,是因为在「训练」阶段读掉了互联网上几乎全部的文字。这些文字从哪里来?就是爬虫一页一页从网站搬走的。

爬虫相当于 AI 公司的图书馆搬运工。区别在于,图书馆借书还有登记,爬虫搬走内容不需要打招呼。Cloudflare(全球最大的网站保镖服务)的数据显示,2026 年 6 月,其网络上有 57.5% 的网页请求来自 AI 爬虫。也就是说,你网上随便打开一个网页,一半以上的访问者根本不是人。

Cloudflare 还公布了一个「爬取与回报比」:一家平台爬了你多少页,才给你带回一个访客。Anthropic 最夸张,2025 年初约 28 万页换 1 个访客,年中降到 3.8 万页换 1 个,仍然领跑。OpenAI 大约 1400 页换 1 个,Perplexity 从 55 页涨到 195 页换 1 个。这些爬走的页面,绝大多数进了训练炉——80% 的 AI 爬取是为了训练模型,只有 2% 是用户在 AI 对话框里主动点击的。

AI 爬虫的爬取与回报比:Anthropic 爬 3.8 万页才带回 1 个访客

图:各大 AI 平台的「爬取与回报比」对比。来源:Cloudflare 官方博客

君子协定,挡不住不讲规矩的人

网站不想被爬,靠的是一份叫 robots.txt 的文件——网站主人把「请勿入内」的告示贴在门口,搜索引擎和 AI 公司按理应该遵守。注意「按理」两个字。这份协议诞生于互联网早期,是君子协定,没有警察,没有罚则。遵守它是情分,无视它是本分。

Nick 在告示里写得很细:哪些内容允许用于搜索,哪些不允许用于 AI 训练。结果呢?Cloudflare 2025 年就报告过,Perplexity 用未申报的隐身爬虫,绕过网站的禁止抓取指令。还有爬虫干脆伪装成浏览器——有网友调侃,机器人在跑「最新版 macOS」,访问畅通无阻,比真人还顺利。Nick 试过 Cloudflare 的「非交互验证」(一种不打扰真人的机器人检测),文章里记录的那批爬虫照样钻了过去,连他自己都惊讶。

AI 爬取的目的:80% 用于训练模型,只有 2% 是用户主动请求

图:AI 爬虫流量按用途分类。来源:Cloudflare 官方博客

防御战的账单:钱、误伤、猫鼠游戏

挡不住,就升级防护。Nick 的网站平时每月账单约 90 美元,最凶的一个月涨了约 500%。服务器流量被爬虫吃干抹净,数据库被反复打爆,他的访客统计彻底失真——「我想知道真人到底在读什么,好决定下一步做什么,结果数据里全是机器人。」

他还记录了爬虫的「进攻套路」。2025 年 11 月,几天之内涌进 4000 个「访客」,每人只打开一页就走,跳出率 99%,没有来源网站,而且专挑基金数据页下手——那是只有 10% 的真访客会碰的角落。他在文章里淡淡补了一句:这 4000 个只是热身。

评论区里,小站长的遭遇一个比一个离奇。有人经营一个荷兰游船预订页,AI 爬虫对着日历疯狂点「下个月」,一天几千次,直到把时间点穿;有人上线前先被机器人注册了上百个假账号,每天手动删 100 个;有人封掉一批 IP,爬虫立刻换一批「住宅地址」卷土重来,像换了身份证的快递员。封是封不完的,这是猫鼠游戏,老鼠还更有钱。

更麻烦的是误伤。Nick 的网站建了 CAPTCHA 验证(「证明你是人」的考试),但真人也烦这套:用 VPN 的人被反复盘问,用老浏览器的人直接被拒之门外,有人留言「看到’正在验证你是人类’的页面,我直接关掉走人」。评论区一位读者说,他想买一台 2000 美元的家电,用脚本监控价格,结果商家的反爬系统激进到连他手动打开网页都加载不出来——他永远不会从这家店买东西了。过度防御把真买家挡在门外,这是反爬的另一笔隐性账单。

笔者写这篇文章时也亲历了一次:想打开 Nick 的原文,页面弹出一行字「抱歉,你已被屏蔽」,把我们当成了机器人。站长打了一年仗,最后连想读他文章的真人读者都进不去。这正是评论区吵得最凶的话题。

更大的问题:谁来决定谁能上网

Hacker News 上排在最前面的一条评论说:这么多人把「谁能看你的网站」的决定权外包给 Cloudflare,等于让一家大公司决定开放网络的边界——它说你是机器人,你就不是访客,你连申诉的地方都没有。

反对的声音同样理直气壮。有人说,内容公开发布就是让人读的,作者管不了读者用什么工具读,就像作家管不了读者用什么姿势翻书。也有人反驳:你开个店,难道不能把顺手牵羊的客人请出去?还有人讲了个黑色幽默:我把内容印成书出版了,AI 公司照样「偷」——书也挡不住它们。

不只是被偷,连老顾客也不再上门

小网站还有一条更隐蔽的损失:搜索引擎不再送客了。Cloudflare 统计了一批新闻网站的流量,Google 带来的访客从 2025 年 2 月起明显下滑,3 月比 1 月少了 9%,4 月少了 15%,时间点恰好和 Google 把 AI 概览(直接在搜索页生成答案,不再给链接)铺开的时间重合。以前人们搜一个问题,会点进网站看原文;现在答案直接显示在搜索页上,网站连被点开的机会都没有。

Nick 在文章里写得很坦白:我想让 Google、Bing 这些搜索引擎来爬我的网站,因为它们会带来新读者;但我不想让其他所有人把网站当成矿场挖走。麻烦在于,技术上分不清谁在「送客」谁在「挖矿」——都是机器人,只是动机不同。来路在被 AI 截断,去路在被 AI 搬空,两头都在失血。

这场战争和普通人有什么关系

关系比你想象的大。你每天问 AI 的问题,答案的质量取决于它「读」到的内容。如果全网的创作者都因被白嫖而停止更新,AI 学到的就只剩互相抄的旧料。少数大平台还能跟 AI 公司谈授权费,普通小网站一毛钱拿不到,还要自掏腰包付服务器钱。已经有平台选择把 AI 公司告上法庭,更多人则在考虑把网站藏进需要登录的围墙里。

Cloudflare 等公司正在推「按次付费抓取」——AI 想搬内容,先付钱。这个思路能不能落地还不好说,但它把问题摆到了台面上:AI 时代的内容,到底该不该免费供应?

笔者无意站队。站在站长这边,被白嫖一年、账单翻五倍,换谁都不痛快;站在读者这边,把整个互联网锁进验证码和围墙里,也不是大家想要的世界。唯一能确定的是,那个「网站是给人看的」的默认设定,正在被悄悄改写。下次你用 AI 查到一条冷知识,不妨想一想:它的答案,是从哪个没人付钱的小网站上搬来的。

参考链接:

  • PatronView: 99% of My Website Traffic Is Bots
  • HN 讨论 (item?id=49211386)
  • Cloudflare: The Crawl-to-Click Gap(AI 爬虫与引荐流量数据报告)
  • Cloudflare 博客: From Googlebot to GPTBot(AI 爬虫份额变化)