SEO 百科
特殊爬虫
本页目录
特殊爬虫是 Google 在常见抓取工具之外使用的另一类爬虫,前提是被抓取的网站与 Google 产品之间就抓取过程达成了协议[3]。
触发条件
这一类爬虫由特定产品使用,而不是由搜索本身使用[3]。所以这类爬虫出现的前提,是双方有约在先。比如 AdsBot 会在广告发布商许可时,忽略 robots.txt 里的全局用户代理规则[3]。
也就是说,这类爬虫的行为可以越过一般规则,但越过有前提,不是随意发挥。
与常见爬虫的差别
正因为可能忽略 robots.txt,特殊爬虫用的 IP 范围也和常见抓取工具不同[3]。这些范围单独发布在 special-crawlers.json 里[2][3]。
验证身份的方式也不同:它的反向 DNS 掩码以 rate-limited-proxy- 开头,以 .google.com 结尾[3]。所以验证时,不能套用常见爬虫那一套。
几个例子
| 爬虫 | 用途 |
|---|---|
APIs-Google |
服务于 Google API 的推送通知 |
AdsBot、AdsBot Mobile Web |
用来检查网页广告的质量 |
Google-Safety |
处理针对滥用行为的抓取,比如在公开发布的链接里发现恶意软件 |
Mediapartners-Google |
与广告发布相关 |
其中 Google-Safety 是个例外,它完全忽略 robots.txt 规则,也不受抓取偏好设置的影响[3]。
影响的产品
针对某个特殊爬虫的用户代理令牌设置抓取偏好,影响的是它背后的产品,而不是搜索排名[3]。
比如限制 AdsBot,影响的是 Google Ads 检查网页广告质量的能力[3]。也就是说,拦下这类请求之前,要先想清楚受影响的是哪一项服务。
针对某个令牌单独写一组规则,就只会影响它背后的那一项服务。AdsBot 的 robots.txt 令牌是 AdsBot-Google:
User-agent: AdsBot-Google
Disallow: /products/
附录
参见
参考资料
官方(境外)
- 《Overview of Bing crawlers (user agents)》,Bing 网站管理员工具。
- 《About Applebot》,Apple 支持。
- 《Google 特殊爬虫列表》,Google 搜索中心。
外部链接
无。