SEO 百科

特殊爬虫

本页目录

特殊爬虫是 Google 在常见抓取工具之外使用的另一类爬虫,前提是被抓取的网站与 Google 产品之间就抓取过程达成了协议[3]。

触发条件

这一类爬虫由特定产品使用,而不是由搜索本身使用[3]。所以这类爬虫出现的前提,是双方有约在先。比如 AdsBot 会在广告发布商许可时,忽略 robots.txt 里的全局用户代理规则[3]。

也就是说,这类爬虫的行为可以越过一般规则,但越过有前提,不是随意发挥。

与常见爬虫的差别

正因为可能忽略 robots.txt,特殊爬虫用的 IP 范围也和常见抓取工具不同[3]。这些范围单独发布在 special-crawlers.json 里[2][3]。

验证身份的方式也不同:它的反向 DNS 掩码以 rate-limited-proxy- 开头,以 .google.com 结尾[3]。所以验证时,不能套用常见爬虫那一套。

几个例子

官方列表里能看到的例子有这几类[1][3]。

爬虫 用途
APIs-Google 服务于 Google API 的推送通知
AdsBot、AdsBot Mobile Web 用来检查网页广告的质量
Google-Safety 处理针对滥用行为的抓取,比如在公开发布的链接里发现恶意软件
Mediapartners-Google 与广告发布相关

其中 Google-Safety 是个例外,它完全忽略 robots.txt 规则,也不受抓取偏好设置的影响[3]。

影响的产品

针对某个特殊爬虫的用户代理令牌设置抓取偏好,影响的是它背后的产品,而不是搜索排名[3]。

比如限制 AdsBot,影响的是 Google Ads 检查网页广告质量的能力[3]。也就是说,拦下这类请求之前,要先想清楚受影响的是哪一项服务。

针对某个令牌单独写一组规则,就只会影响它背后的那一项服务。AdsBot 的 robots.txt 令牌是 AdsBot-Google:

User-agent: AdsBot-Google
Disallow: /products/

附录

参见

参考资料

官方(境外)

  1. 《Overview of Bing crawlers (user agents)》,Bing 网站管理员工具。
  2. 《About Applebot》,Apple 支持。
  3. 《Google 特殊爬虫列表》,Google 搜索中心。

外部链接

无。