SEO 百科
常用爬虫(Googlebot)
本页目录
Googlebot 是 Google 搜索使用的两种网页抓取工具的通用名称,一个是模拟移动设备用户的智能手机版,一个是模拟桌面设备用户的桌面版[2]。
移动版与桌面版
两类抓取工具能在请求的 user-agent 标头里区分,但遵循 robots.txt 中的同一个产品令牌[2]。比如在 robots.txt 里写 User-agent: Googlebot,这一个令牌就同时管着两个版本。也就是说,网站没法在 robots.txt 里单独指定移动版或者桌面版。
在 robots.txt 里写下这一个令牌,就同时管住两个版本:
User-agent: Googlebot
Disallow: /admin/
多数抓取请求来自移动版[2]。因为对大多数网站的内容,Google 主要把移动版编入索引[2],请求的来源自然也跟着偏向移动版。
抓取的规模
对多数网站,Googlebot 的平均访问频率不会高于几秒一次,不过受延迟影响,短时间里可能略高一些[2][3]。
大小上也有具体数字。为 Google 搜索抓取时,Googlebot 对不同对象的大小上限如下[2]:
| 抓取对象 | 大小上限 |
|---|---|
| 受支持的文件类型 | 前 2MB |
PDF |
前 64MB |
渲染时,HTML 里引用的每个资源,比如 CSS 和 JavaScript,都是单独抓取的,各自受同样的大小限制[2]。达到上限以后它会停止抓取,只把已经下载的部分送去编入索引;而这些上限针对的是未压缩的数据[2]。
屏蔽与收录的区别
这两件事经常被混在一起。禁止 Googlebot 抓取某个网页,并不会阻止这个网址出现在搜索结果里[2]。
所以目的不同,手段也不同。
| 目的 | 手段 |
|---|---|
| 只想禁止抓取 | robots.txt |
| 不希望被编入索引 | noindex |
| 想完全挡住抓取工具和用户 | 密码保护这类方式 |
还有一点要留意:屏蔽 Googlebot 不只会影响 Google 搜索,还会影响 Google 图片、Google 视频和 Google 新闻等其他产品[2]。
验证真身
Googlebot 用的 user-agent 标头经常被别的抓取工具冒用[2]。所以在决定屏蔽某个请求之前,要先确认这个请求是不是真的来自 Google。
验证的办法有两个:对来源 IP 地址做 DNS 反向查找,或者把来源 IP 与 Googlebot 的 IP 地址范围做比对[1][2]。
附录
参见
参考资料
官方(境外)
- 《About Applebot》,Apple 支持。
- 《Googlebot》,Google 搜索中心。
第三方
- 《How Often Google Crawls and Indexes》,Search Engine Journal。
外部链接
无。