SEO 百科
抓取
本页目录
抓取指的是搜索引擎发现网址之后,访问这个网页以了解其中内容的那一步[1][2][3]。抓取和发现是两件事:发现说明引擎知道了地址,抓取才是真的去取回内容。所以一个网址被知道,不等于被读过。
抓取工具
执行这件事的程序叫 Googlebot,也叫抓取工具、漫游器,或者常说的蜘蛛[2]。它并非单台机器在跑,而是用大量计算机一起抓取网络上的数十亿个网页[2]。
抓取的数量与节奏
抓取并不是有多少抓多少。Googlebot 会用一套算法流程,决定这几件事[2]:
- 要抓哪些网站
- 抓取的频率
- 从每个网站抓多少网页
Googlebot 的抓取速度也受程序控制,不会太快,以免网站收到过多请求[2]。这个节奏会看网站的响应来调整,比如服务器返回 500 错误,等于告诉它降低抓取速度[2]。也就是说,网站的稳定程度会反过来影响它被访问的频率。
抓取的限制
除了节奏,范围也有边界。Googlebot 并不会抓取发现的每一个网页[2]。原因可以是网站把某些页面设成了禁止抓取,也可以是页面必须登录才能访问[2]。
也就是说,发现和抓取之间隔着一层筛选,而网站自己也能参与这层筛选。
网站参与这层筛选的方式,是在根目录放一份 robots.txt,用 Disallow 列出不想被抓的目录:
User-agent: *
Disallow: /admin/
Disallow: /cart/
可访问性的前提
抓取能不能进行,最终取决于抓取工具能不能访问网站[2]。常见的障碍有三类[2]:
- 服务器在处理网站时出现问题
- 网络本身有故障
robots.txt的规则挡住了Googlebot
这三类都不在内容层面,却都能让一个网页连第一步都过不去。
附录
参见
参考资料
官方(境外)
- 《Bing Webmaster Guidelines》,Bing 网站管理员工具。
- 《关于 Google 搜索运作方式的深度指南》,Google 搜索中心。
官方(国内)
- 《百度搜索的工作原理》,百度搜索资源平台。
外部链接
无。