SEO 百科

抓取

本页目录

抓取指的是搜索引擎发现网址之后,访问这个网页以了解其中内容的那一步[1][2][3]。抓取和发现是两件事:发现说明引擎知道了地址,抓取才是真的去取回内容。所以一个网址被知道,不等于被读过。

抓取工具

执行这件事的程序叫 Googlebot,也叫抓取工具、漫游器,或者常说的蜘蛛[2]。它并非单台机器在跑,而是用大量计算机一起抓取网络上的数十亿个网页[2]。

抓取的数量与节奏

抓取并不是有多少抓多少。Googlebot 会用一套算法流程,决定这几件事[2]:

  • 要抓哪些网站
  • 抓取的频率
  • 从每个网站抓多少网页

Googlebot 的抓取速度也受程序控制,不会太快,以免网站收到过多请求[2]。这个节奏会看网站的响应来调整,比如服务器返回 500 错误,等于告诉它降低抓取速度[2]。也就是说,网站的稳定程度会反过来影响它被访问的频率。

抓取的限制

除了节奏,范围也有边界。Googlebot 并不会抓取发现的每一个网页[2]。原因可以是网站把某些页面设成了禁止抓取,也可以是页面必须登录才能访问[2]。

也就是说,发现和抓取之间隔着一层筛选,而网站自己也能参与这层筛选。

网站参与这层筛选的方式,是在根目录放一份 robots.txt,用 Disallow 列出不想被抓的目录:

User-agent: *
Disallow: /admin/
Disallow: /cart/

可访问性的前提

抓取能不能进行,最终取决于抓取工具能不能访问网站[2]。常见的障碍有三类[2]:

  • 服务器在处理网站时出现问题
  • 网络本身有故障
  • robots.txt 的规则挡住了 Googlebot

这三类都不在内容层面,却都能让一个网页连第一步都过不去。

附录

参见

参考资料

官方(境外)

  1. 《Bing Webmaster Guidelines》,Bing 网站管理员工具。
  2. 《关于 Google 搜索运作方式的深度指南》,Google 搜索中心。

官方(国内)

  1. 《百度搜索的工作原理》,百度搜索资源平台。

外部链接

无。