SEO 百科
noindex
本页目录
noindex 是一套规则,可以写成 meta 标记或 HTTP 响应标头,用来阻止支持它的搜索引擎把内容编入索引[3]。当抓取工具发现这个标记时,Google 会让该网页完全不出现在搜索结果中,无论有没有其他网站链接该网页[3]。
两种实现方式
noindex 有两种写法,效果相同[3]。
一种是网页里的 meta 标记,放在 head 部分,比如 <meta name="robots" content="noindex">;另一种是 HTTP 响应标头[1][3]。选哪一种,看网站更方便用哪种,以及内容属于什么类型[3]。
有一点容易混淆:robots.txt 里不能写 noindex[3]。robots.txt 管的是抓取,管不了收录。
作用范围
noindex 作用在网页一级,也就是让整个网页不进入结果[2][3]。
noindex 还可以和其他规则组合,比如同时禁止追踪页面上的链接[3]。另外需要注意,不同搜索引擎对这条规则的解读可能不完全一致,所以网页仍可能出现在别家的结果里[3]。
非 HTML 资源的处理
HTML 网页之外的资源,需要用另一种写法[3]。
PDF、视频和图片这类文件,要在 HTTP 响应里返回相应的标头,才能表达同样的意思[3]。
以阻止收录一张机床图片为例,响应标头这样写:
HTTP/1.1 200 OK
X-Robots-Tag: noindex
标头的值就是 noindex,与 meta 标记里的写法一致。
生效的前提
这条规则要生效,有一个绕不开的前提:抓取工具必须先抓到网页[3]。
如果添加之后网页仍出现在结果里,可能是这个网页还没被重新抓取,而重访可能要等上数月[3]。还有一个隐患:如果 robots.txt 挡住了这个网址,抓取工具根本看不到标记[3]。所以添加之后,应当确认抓取工具确实读到了标记[3]。
附录
参见
参考资料
官方(境外)
- 《Robots meta tags and attributes that Bing supports》,Bing 网站管理员工具。
- 《Meta tags》,Yandex 网站管理员。
- 《使用 noindex 阻止搜索引擎编入索引》,Google 搜索中心。
外部链接
无。