SEO 百科
分页
本页目录
分页是把一个较长的结果列表拆成多页,让用户通过「下一页」「上一页」和页码链接逐页浏览的做法[2]。
它出现是因为完整结果太多、一页放不下,或者一次加载太慢[2]。因为内容拆到了多个网址上,搜索引擎要能全部找到,还要看懂彼此的关系[2]。也就是说,分页对人和机器都有好处,但要额外顾及抓取。
页面之间的顺序链接
为确保搜索引擎理解分页网页之间的关系,应在每个网页上用 <a href> 添加指向下一页的链接[2][3]。比如 <a href="/products?page=3">下一页</a>,指向下一组结果的网址就写在这个 href 里。
这样有助于 Googlebot 找到后续网页[2][1]。还可以考虑从集合中的各网页链接回第一页,向 Google 强调它是该集合的起始页[2]。也就是说,顺序链接把一串拆开的网页重新串成一条线。
网址的独立性
分页序列里的每个网页,都该有自己的唯一网址,例如通过 ?page=n 区分[2]。
因为 Google 会把分页序列中的网址视为不同网页[2]。同时不要把第一页当作整个序列的规范网页,每页要各自指定规范网址[2]。也不要拿网址片段(# 后面的文本)来标记页码,因为 Google 会忽略片段,看到只有片段不同的网址会以为已经检索过,从而可能不再跟踪[2]。
抓取工具对交互的限制
抓取网页时,Google 通常只抓取在 <a> 元素 href 属性里的网址[2]。
抓取工具不会「点击」按钮,通常也不会触发要用户操作才更新网页内容的 JavaScript[2]。所以「加载更多」和无限滚动这类靠脚本实现的方式,要看机器能否拿到后续内容[2]。也就是说,交互方式越依赖用户动作,越要留意可抓取性。
变体网址的收录控制
较长的结果列表往往还支持过滤和排序,同一批结果会派生出一串变体网址[2]。
为避免把同一结果列表的变体都编入索引,可以用 noindex 标记阻止收录,也可以用 robots.txt 阻止抓取特定格式的网址[2]。
附录
参见
参考资料
官方(境外)
- 《Implementing Markup For Paginated And Sequenced Content》,Bing 网站站长博客。
- 《分页和增量加载以及它们对 Google 搜索的影响》,Google 搜索中心。
第三方
- 《4 Common Pagination Pitfalls – How to Get Into & Out of Them》,Search Engine Journal。
外部链接
无。