如果要选出 2026 年互联网世界的 " 公害 ",那么 AI 爬虫一定榜上有名。大批中小网站、个人博客已经被 AI 爬虫逼到崩溃的边缘,为抓取更多的数据训练模型,AI 厂商的爬虫以近乎 DDoS 的方式疯狂访问他们能访问的网站。

当大量中小网站开始关闭,实质上掌握互联网流量分配权的谷歌终于行动起来。目前,谷歌正在逐步推广一种新的搜索结果跳转机制,当用户点击搜索结果时,链接不再直接指向目标网页,而是为搜索结果对应的网址(URL)添加 "goto" 跳转参数。
对此谷歌公司发言人表示," 我们长期以来一直在部署技术措施以应对不断演变的滥用行为,并会定期采取行动保护我们的服务和用户 "。
事实上,在常规的 Web 开发中,goto 并非标准协议参数,而是由开发者自定义的查询参数(Query Parameter)。在长期的实践过程中,Web 开发者普遍会选择将 goto 参数作为重定向目标。例如用户从网站的某个页面登录账号系统,登录成功后系统会将其重定向至原页面,这时 URL 中便包含类似 goto=/original-page 这样的参数。

那么谷歌为搜索结果对应的网址(URL)添加 "goto" 跳转参数,让用户的访问先来到带有 "google.com/goto" 参数的中转地址为什么能反 AI 爬虫呢?这是因为 " 重定向 " 在反爬策略中,是比直接封 IP 更柔和却又有效的方式。其逻辑是通过检测请求的合法性,将爬虫请求重定向到验证页或空白页,这时候爬虫往往就会自动跟随重定向而丢失目标数据,或者干脆无法识别重定向。
谷歌为搜索结果的 URL 加入 goto 跳转参数后,谷歌的服务器就将负责最终的重定向跳转。由于这些 goto 链接无法被直接解码,爬虫服务商就必须实际跟随完整的重定向链路才能识别最终页面,无法再像之前那样批量快速提取真实网址对应的页面内容。
一直以来,AI 爬虫并不是一次只抓取几个网页,在大规模抓取场景下,每个搜索结果页可能就包含数百个 URL,爬虫要是逐一解析每一个 URL,就会显著增加数据获取的成本与难度。简而言之,谷歌这个新策略并不能从技术层面过滤 AI 厂商的爬虫,而是大幅度提升 AI 爬虫的运行成本,消耗 AI 厂商宝贵的算力和带宽,让后者觉得爬取网站缺乏性价比。

那么问题就来了,百度会跟进谷歌的这个做法吗?大概率不会,倒不是因为百度不想维护自己的搜索生态,而是没必要。
网络技术调查机构 W3Techs 去年公布的一组数据显示,截至 2024 年,在全球所有可被搜索引擎抓取的公开网站中,中文内容占比仅为 1.3%,在全球排名第 13 位,不仅远低于英语的 51.7%,还排在了俄语、法语、西班牙语后面,只略高于印尼语和越南语。
当然不是不生产中文内容,恰恰相反,中文互联网的内容产量极其庞大。只不过这些内容大部分被困在了搜索引擎触达不到的地方,也就是 App、小程序里。为了自家的注意力生意,各大互联网厂商纷纷选择 " 圈地自萌 ",甚至就连百度自己都在做大做强百度 App。
虽然超级 App 提供的一站式闭环体验满足了用户大部分需求,但也让用户习惯于在一个 App 里完成所有操作。不仅如此,相比注册抖音、微信公众号,搭建并运营一个网站的门槛要高得多,所以贡献高质量内容的创作者也就随之迁移到知乎、小红书、B 站、微信公众号等平台。

相比于自行建站的成本,直接托庇于这些平台显然才是更具性价比的选择,比如服装企业直接在天猫开店,以及餐厅在美团提供外卖服务的成本,无疑要远低于自己建设网站并进行推广。同时,大量国内网民第一次触网是通过智能手机而非 PC,所以他们也更习惯通过 App 来获取信息。
如此一来,当平台、创作者、用户都在拥抱 App 时,Web 生态又岂有不衰退的道理。从某种意义上来说,海外的中小网站、个人博客在国内变成了不同平台的大 V、中 V、小 V。海外创作者既然选择了更自由、开放的网站,自然就要自己来负责反爬虫,而国内创作者选择受控于平台的规则,反爬虫这个工作也就 " 外包 " 给了平台。
【本文图片来自网络】
加入收藏 点赞 ( 0 ) 踩 ( 0 )


登录后才可以发布评论哦
打开小程序可以发布评论哦