SEO 百科
分面导航
本页目录
分面导航指的是让访问者改变内容显示方式的网站功能,比如按产品、文章或活动做筛选和排序[3]。这本身是常用又实用的功能,问题出在常见的实现方式上[3]。
网址空间的膨胀
最常见的实现是把过滤条件放进网址的查询参数里[2][3]。比如 https://www.example.com/machines?type=cnc,问号后面的 type=cnc 就是过滤条件。
这样一来,改动任何一个条件,网址就会指向一组不同的内容[3]。过滤条件的组合可以非常庞大,潜在的网址数量同样庞大[1][3]。
对抓取的影响
因为这类网址看起来是新建的,抓取工具在抓取之前,无法判断这些网址到底有没有用[3]。所以抓取工具常常先访问了大量这类网址,最后才发现没有价值[3]。
由此产生两个后果。一是过度抓取,二是发现有用新网址的时间被挤占了[3]。
收录与不收录
在做取舍之前,要先判断是否希望收录这些网址[3]。
如果不希望,可以禁止抓取。官方说明,通常没必要允许抓取过滤后的内容,因为那会消耗服务器资源,却几乎没有收益[3]。
禁止抓取写在 robots.txt 里,用通配符匹配带过滤条件的网址。以按类型、品牌、价格筛选的机床列表页为例:
user-agent: Googlebot
disallow: /*?*type=
disallow: /*?*brand=
disallow: /*?*price=
allow: /*?type=all$
只有展示全部内容的列表页会被抓取。
如果希望收录,就要遵循一套更细的做法。而且要预期到,抓取分面网址往往很消耗网站的计算资源[3]。其中一条与内容有关:当某个过滤组合没有结果时,应当返回 404,而不是重定向到一个通用的错误页[3]。
其他引导方式
还有一种实现基于网址片段。网址片段和查询参数不同,对抓取没有影响[3]。
也有人会用规范链接或链接属性来引导。官方提示,从长期看,这些方式的效果通常不如禁止抓取[3]。
也就是说,越早把不需要的网址挡在抓取之外,代价越小。
附录
参见
参考资料
官方(境外)
- 《Better than canonical; URL Normalization》,Bing 网站管理员博客。
- 《Using robots.txt》,Yandex 网站管理员。
- 《管理对分面导航网址的抓取》,Google 搜索中心。
外部链接
无。