SEO 百科

常用爬虫(Googlebot)

本页目录

Googlebot 是 Google 搜索使用的两种网页抓取工具的通用名称,一个是模拟移动设备用户的智能手机版,一个是模拟桌面设备用户的桌面版[2]。

移动版与桌面版

两类抓取工具能在请求的 user-agent 标头里区分,但遵循 robots.txt 中的同一个产品令牌[2]。比如在 robots.txt 里写 User-agent: Googlebot,这一个令牌就同时管着两个版本。也就是说,网站没法在 robots.txt 里单独指定移动版或者桌面版。

在 robots.txt 里写下这一个令牌,就同时管住两个版本:

User-agent: Googlebot
Disallow: /admin/

多数抓取请求来自移动版[2]。因为对大多数网站的内容,Google 主要把移动版编入索引[2],请求的来源自然也跟着偏向移动版。

抓取的规模

对多数网站,Googlebot 的平均访问频率不会高于几秒一次,不过受延迟影响,短时间里可能略高一些[2][3]。

大小上也有具体数字。为 Google 搜索抓取时,Googlebot 对不同对象的大小上限如下[2]:

抓取对象 大小上限
受支持的文件类型 前 2MB
PDF 前 64MB

渲染时,HTML 里引用的每个资源,比如 CSS 和 JavaScript,都是单独抓取的,各自受同样的大小限制[2]。达到上限以后它会停止抓取,只把已经下载的部分送去编入索引;而这些上限针对的是未压缩的数据[2]。

屏蔽与收录的区别

这两件事经常被混在一起。禁止 Googlebot 抓取某个网页,并不会阻止这个网址出现在搜索结果里[2]。

所以目的不同,手段也不同。

目的 手段
只想禁止抓取 robots.txt
不希望被编入索引 noindex
想完全挡住抓取工具和用户 密码保护这类方式

还有一点要留意:屏蔽 Googlebot 不只会影响 Google 搜索,还会影响 Google 图片、Google 视频和 Google 新闻等其他产品[2]。

验证真身

Googlebot 用的 user-agent 标头经常被别的抓取工具冒用[2]。所以在决定屏蔽某个请求之前,要先确认这个请求是不是真的来自 Google。

验证的办法有两个:对来源 IP 地址做 DNS 反向查找,或者把来源 IP 与 Googlebot 的 IP 地址范围做比对[1][2]。

附录

参见

参考资料

官方(境外)

  1. 《About Applebot》,Apple 支持。
  2. 《Googlebot》,Google 搜索中心。

第三方

  1. 《How Often Google Crawls and Indexes》,Search Engine Journal。

外部链接

无。