SEO 百科
robots.txt 简介
本页目录
robots.txt 是放在网站上的一份文本文件,用来规定搜索引擎抓取工具可以访问哪些网址[3]。robots.txt 管的是抓取,管不了收录[2][3]。
抓取与收录的区别
用 robots.txt 挡住一个网页时,这个网址仍可能出现在结果里,只是结果中不会有该网页的说明[3]。
而且,屏蔽网页之后,网页里内嵌的图片、视频和 PDF 等文件也不再抓取[3]。
如果想把网页从结果里彻底隐藏,robots.txt 不是合适的工具,应当改用其他方式[3]。
常见的用途
robots.txt 的主要用途是管理抓取流量[3]。
- 网页方面,常见的情况有两类:来自抓取工具的请求会让服务器超负荷;或者网站上有不值得抓取、彼此相似的不重要网页[3]。
- 媒体文件方面,
robots.txt可以阻止图片、视频和音频出现在结果中,但不会阻止别人链接到这些文件[3]。 - 资源文件方面,是否屏蔽要谨慎。跳过不重要的图片、脚本或样式文件,通常影响不大;但如果网页缺少这些文件会更难解读,就不该屏蔽[3]。
效力上的限制
是否遵守,由抓取工具自己决定。正规的抓取工具会遵守,其他抓取工具未必[3]。也就是说,如果有人想抓取被屏蔽的内容,这份文件无法阻止这类抓取。
语法上也有差异。不同抓取工具解析规则的方式可能不同,有些命令某些抓取工具理解不了[3]。
收录仍可能发生
还有一个容易被忽略的情况[3]。
如果别的网站有链接指向被屏蔽的网址,Google 仍可能发现这个网址,并把这个网址编入索引[3]。结果里也可能会显示该网址,以及链接周围的文字[3]。
要真正阻止一个网址出现,需要做到以下几件事[3]:
- 给文件加密码保护
- 使用 noindex 标记
- 把网页彻底移除
附录
参见
参考资料
官方(境外)
- 《RFC 9309: Robots Exclusion Protocol》,RFC 编辑部。
- 《Using robots.txt》,Yandex 网站管理员。
- 《robots.txt 简介》,Google 搜索中心。
外部链接
无。