SEO 百科
抓取预算
本页目录
抓取预算指的是 Google 能分配在一个网站上的抓取时间和资源[2]。因为网络近乎无限,Google 探索每个公开网址的能力有限,资源就必须有所取舍[2]。
两个组成部分
抓取预算由两部分共同决定:抓取容量上限和抓取需求[2][3]。
抓取容量上限,是服务器能承受的抓取量[2]。Google 不希望抓取导致服务器过载,所以会限制同时保持的连接数量与时长的乘积[2]。每个网站的初始上限都一样,并且偏向保守,之后会随着网站的响应状况自动调整[2]。
抓取需求,则取决于网站自身的情况,比如规模、更新频率、质量,以及相对于其他网站的相关性[2]。不同抓取工具的需求也不一样,例如 AdsBot 在投放动态广告时需求更高[2]。
两者合起来,才构成所谓的抓取预算。也就是说,即使没到容量上限,只要需求低,Google 也会减少抓取[2]。
适用对象
抓取预算主要对一类网站才有意义[2]。
官方给出的范围是:
如果不是这类网站,一般不必专门处理。只要保持站点地图及时更新,并定期查看索引编制报告就足够了[2]。
需求的影响因素
需求这一侧,有一个因素由网站主动控制[2]。
这个因素就是 Google 感知到的网址目录。如果没有引导,Google 会尝试抓取网站上发现的所有网址[2]。如果其中有很多是重复的,或者本就不希望被抓取,抓取时间就被白白消耗了[2]。
另外两个因素不在网站手里。热门程度会让 Google 更频繁地抓取;过时性则决定系统多快回来重抓一次[1][2]。
规模与抓取量
有一种预期容易产生,需要澄清。
网站变大,并不意味着抓取量会等比增加。抓取预算是一组 Google 可以且希望抓取的网址,同时受容量和需求两侧的限制[2]。
也就是说,真正决定效率的,不是页面的总数,而是其中有多少是值得抓取的[2]。
附录
参见
参考资料
官方(境外)
- 《bingbot Series: Optimizing Crawl Frequency》,Bing 网站管理员博客。
- 《优化抓取预算》,Google 搜索中心。
第三方
- 《Crawl Budget: Everything You Need to Know for SEO》,Search Engine Journal。
外部链接
无。