SEO 百科

抓取预算

本页目录

抓取预算指的是 Google 能分配在一个网站上的抓取时间和资源[2]。因为网络近乎无限,Google 探索每个公开网址的能力有限,资源就必须有所取舍[2]。

两个组成部分

抓取预算由两部分共同决定:抓取容量上限和抓取需求[2][3]。

抓取容量上限,是服务器能承受的抓取量[2]。Google 不希望抓取导致服务器过载,所以会限制同时保持的连接数量与时长的乘积[2]。每个网站的初始上限都一样,并且偏向保守,之后会随着网站的响应状况自动调整[2]。

抓取需求,则取决于网站自身的情况,比如规模、更新频率、质量,以及相对于其他网站的相关性[2]。不同抓取工具的需求也不一样,例如 AdsBot 在投放动态广告时需求更高[2]。

两者合起来,才构成所谓的抓取预算。也就是说,即使没到容量上限,只要需求低,Google 也会减少抓取[2]。

适用对象

抓取预算主要对一类网站才有意义[2]。

官方给出的范围是:

  • 独特网页超过 100 万个、且每周都有内容变化的大型网站。
  • 非重复网页超过 10000 个、且每天都有变化的中大型网站。
  • 大量网址长期停留在“已发现但未编入索引”状态的网站[2]。

如果不是这类网站,一般不必专门处理。只要保持站点地图及时更新,并定期查看索引编制报告就足够了[2]。

需求的影响因素

需求这一侧,有一个因素由网站主动控制[2]。

这个因素就是 Google 感知到的网址目录。如果没有引导,Google 会尝试抓取网站上发现的所有网址[2]。如果其中有很多是重复的,或者本就不希望被抓取,抓取时间就被白白消耗了[2]。

另外两个因素不在网站手里。热门程度会让 Google 更频繁地抓取;过时性则决定系统多快回来重抓一次[1][2]。

规模与抓取量

有一种预期容易产生,需要澄清。

网站变大,并不意味着抓取量会等比增加。抓取预算是一组 Google 可以且希望抓取的网址,同时受容量和需求两侧的限制[2]。

也就是说,真正决定效率的,不是页面的总数,而是其中有多少是值得抓取的[2]。

附录

参见

参考资料

官方(境外)

  1. 《bingbot Series: Optimizing Crawl Frequency》,Bing 网站管理员博客。
  2. 《优化抓取预算》,Google 搜索中心。

第三方

  1. 《Crawl Budget: Everything You Need to Know for SEO》,Search Engine Journal。

外部链接

无。