谷歌爬遍全网起家,如今想用版权法阻止别人爬自己

谷歌爬遍全网起家,如今想用版权法阻止别人爬自己

GoogleDMCAcopyrightsearchweb scraping

数据源:HN + web research · HN

2026 年 7 月 20 日,美国加州北区联邦法院首席法官 Yvonne Gonzalez Rogers 驳回了 Google 针对 SerpApi 的 DMCA 诉讼。Google 试图用一部为保护 DVD 加密而写的法律,来阻止一家 40 人规模的创业公司爬取其搜索结果。法官的回答很直接:搜索结果是公共事实,不归版权法管。

Google 诉 SerpApi 案的核心:一家靠爬虫起家的公司试图用版权法阻止别人爬自己

一个价值万亿美元的反讽

Google 1998 年靠爬取整个互联网起家。PageRank 算法的基础就是爬虫——它遍历全网页面,复制内容建索引,然后靠整理这些信息卖广告,建起了一个市值接近两万亿美元的商业帝国。

2025 年 12 月,同样是这家公司,把一家叫 SerpApi 的创业公司告上了法庭。SerpApi 做的事情本质上和 Google 当年做的一样:爬取网页,把结果整理好,通过 API 卖给别人。唯一的区别是——它爬的是 Google 的搜索结果页面。

Google 诉称 SerpApi 绕过了它的反爬系统 SearchGuard,发起了数十亿次自动化查询,违反了 DMCA 第 1201 条的反规避条款。这条法律 1998 年与 DMCA 一同通过,初衷是防止人们破解 DVD 的区域码和加密保护。Statutory damages(法定赔偿金)按每次违规计算,以数十亿次查询的量级,Google 要求的赔偿额足以让 SerpApi 直接关门。

Techdirt 的 Mike Masnick 在 2025 年 12 月就评论说,这桩诉讼”几乎每个方面都有问题”——“最不体面的一点是,Google 的整个业务就是靠爬取网络建立起来的。告别人爬自己,这感觉……太霸道了。“

法官的核心判决:锁必须锁在书上,而不是大楼上

SerpApi 在 2026 年 2 月提出驳回动议。2026 年 5 月 19 日,法院举行了听证。7 月 20 日,Rogers 法官批准了驳回动议。

判决的关键逻辑可以这样理解。DMCA 第 1201 条规定,绕过”有效控制访问受版权保护作品”的技术措施是违法的。Google 的逻辑是:SearchGuard 阻止了自动化爬虫访问搜索结果页面,搜索结果页面上有 Google 从第三方获得授权使用的图片(比如知识面板中的图片),所以绕过 SearchGuard 就是违反 DMCA。

法官把这个问题拆成了两个篮子。

篮子一:包含任何受版权保护内容的搜索结果。 这一部分被永久驳回(with prejudice)。理由是:搜索结果页面上的 URL、摘要、排名位置——这些都是公共事实,不是”受版权保护的作品”。SearchGuard 控制访问的对象如果本身就不是版权法保护的对象,那么 DMCA 的适用基础就不存在。

篮子二:包含授权图片的搜索结果(如知识面板)。 这一部分也被驳回,但允许 Google 修改起诉状后重新提交。问题是”授权”。第 1201 条要求技术保护措施必须”在版权持有人的授权下”运行。Google 自己不拥有那些知识面板图片的版权——图片是第三方授权给 Google 展示的。Google 没有举证证明那些版权持有人授权 Google 部署 SearchGuard 来保护它们的作品。

SerpApi 的律师用一个比喻击中了要害:锁必须锁在书上,而不是大楼上。 一个反爬系统保护的是整个 google.com,不能因为里面偶然有一些授权图片,就把它说成是版权保护措施。国会当年通过第 1201 条时,立法历史中明确提到它的目标是制止”相当于闯入上锁房间”的电子行为。在公共海滩上拉一道铁丝网,不能因为沙滩上有一条毛巾就说这是为了保护毛巾。

ScrapeBadger 的报道引用了法庭的另一项关键认定:SearchGuard 的功能是”管控自动化访问,而非保护版权作品”。换句话说,Google 建这个系统是为了保护广告收入,不是保护版权。

为什么 Google 要用版权法来打爬虫官司?

要理解这桩诉讼的深层意义,需要回顾过去几年平台公司反爬策略的演变。

过去十年,平台阻止爬虫的主要武器是 CFAA(计算机欺诈与滥用法)——主张爬虫绕过了网站设置的”授权”屏障。但 2022 年第九巡回上诉法院在 hiQ Labs v. LinkedIn 案中裁定,爬取公开可访问的数据不违反 CFAA。这一判决让 CFAA 作为反爬武器基本失效。

Terms of service(服务条款)违约诉讼属于合同法范畴,赔偿额度有限,在大规模商业爬虫面前威慑力不足。普通版权侵权诉讼面对搜索结果的公共事实性质也难以成立。

于是平台开始尝试 DMCA 第 1201 条。这条法律的危险之处在于它不要求原告证明实际的版权侵权——仅仅”规避技术保护措施”这个行为本身就可能构成违法,而且法定赔偿金极高。Reddit 在 2025 年秋季对 SerpApi 和 Perplexity 提起了类似的 DMCA 诉讼,目前仍在进行中。

SerpApi 案判决页——法官裁定 DMCA 不适用于不包含版权内容的搜索结果

这个判决意味着什么?

从法律层面看,这个案子有两层意义。

第一层是直接判决:对于普通搜索结果(不含版权内容),Google 不能再以 DMCA 为由起诉爬取者。SerpApi 的 CEO Julien Halégu 在判决后发表声明说:“我们很高兴法院拒绝了 Google 试图将 DMCA 扩展到公开页面访问控制的努力。互联网的基本原则——开放访问可用信息——对推动创新至关重要。”

第二层是判例效应。如果 Google 最终无法就包含授权图片的搜索结果部分拿出有效证据(即证明版权持有人授权了 SearchGuard),这部分请求也可能被放弃。业界观察人士认为 Google 的最终走向可能是与 SerpApi 达成某种妥协,而不是继续缩窄诉讼范围去较真知识面板那几个图片。

但这起案件更大的意义在于它设立了一个司法坐标。当 AI 时代让数据变得前所未有的珍贵,当每个平台都在修筑围墙时,法院说了一句:你不能把反爬系统和版权保护混为一谈。

一边爬别人,一边防别人

Google 的选择并非孤立现象。SerpApi 案是开放互联网”梯子被抽走”趋势的最新一例。

过去两年间,Google 在技术层面也加大了反爬力度。2025 年 9 月,Google 移除了搜索结果页面的 num=100 参数——这个参数允许一次请求返回 100 条结果,爬取全量数据的成本因此增加了大约 10 倍。当 DataForSEO 找到了一个成本降低 80% 的绕过方案后,Google 在数周内就封堵了这个漏洞。

与此同时,Google 与 Reddit 达成了独家 API 内容授权协议,然后 Reddit 转头就起诉了那些从 Google 搜索结果中抓取 Reddit 内容的第三方服务。一家公司花钱买下内容,另一家公司用反爬系统保护它,再用版权法起诉那些通过公开渠道获取它的人——整个链条在逻辑上已经绕成了死结。

Techdirt 的 Masnick 在判决报道中引用了 SerpApi 声明的最后一段:“互联网的创始原则——开放访问可用信息——对确保每个人都能受益于数据的承诺至关重要。“这段话让人想起 Google 早期那句著名的口号:“Don’t be evil。“

后续走向

Google 有 21 天时间修改起诉状。如果它选择缩小范围,只针对包含版权内容的搜索结果(知识面板等),理论上案件可以继续推进。但在修改前,Google 需要回答一个它暂时还没有答案的问题:它的版权持有人客户真的书面授权过 SearchGuard 吗?

Rogers 法官在判决中专门引用了第九巡回法院在 Blizzard v. Bossland 案中的判决意见——有效的访问控制必须由版权持有人或其授权方部署。Google 目前持有的只是图片的展示授权,这不是部署反爬系统的法律依据。

对 SerpApi 来说,这起诉讼的成本已经很高——一家 40 人的公司要承受 Google 法务部门的全部火力。但判决结果给了整个爬虫数据行业一个喘息的窗口。对搜索引擎优化工具、位置追踪服务、市场调研平台——这些依赖 SERP 数据的小型商业生态——来说,这个判决告诉他们:至少目前,公开搜索结果还是公共资源。

对普通人而言,这个案件最终指向一个更基础的问题:当世界上最大的搜索引擎选择用版权法来保护自己的围墙时,我们还能不能指望一个开放的互联网?


参考链接:

  • Techdirt: Judge Rejects Google’s Attempt To DMCA Its Way Out Of Being Scraped
  • ScrapeBadger: Google Sued a Scraper Under Copyright Law and Lost
  • ProxyCove: Google Lost the Lawsuit Over SERP Scraping
  • Search Engine Roundtable: Google Lawsuit Against SerpApi Dismissed
  • PPC Land: Google Loses DMCA Bid to Treat Search Scraping Like DVD Piracy
  • HN 讨论 (item?id=49073513)