SEO 百科

noindex

本页目录

noindex 是一套规则,可以写成 meta 标记或 HTTP 响应标头,用来阻止支持它的搜索引擎把内容编入索引[3]。当抓取工具发现这个标记时,Google 会让该网页完全不出现在搜索结果中,无论有没有其他网站链接该网页[3]。

两种实现方式

noindex 有两种写法,效果相同[3]。

一种是网页里的 meta 标记,放在 head 部分,比如 <meta name="robots" content="noindex">;另一种是 HTTP 响应标头[1][3]。选哪一种,看网站更方便用哪种,以及内容属于什么类型[3]。

有一点容易混淆:robots.txt 里不能写 noindex[3]。robots.txt 管的是抓取,管不了收录。

作用范围

noindex 作用在网页一级,也就是让整个网页不进入结果[2][3]。

noindex 还可以和其他规则组合,比如同时禁止追踪页面上的链接[3]。另外需要注意,不同搜索引擎对这条规则的解读可能不完全一致,所以网页仍可能出现在别家的结果里[3]。

非 HTML 资源的处理

HTML 网页之外的资源,需要用另一种写法[3]。

PDF、视频和图片这类文件,要在 HTTP 响应里返回相应的标头,才能表达同样的意思[3]。

以阻止收录一张机床图片为例,响应标头这样写:

HTTP/1.1 200 OK
X-Robots-Tag: noindex

标头的值就是 noindex,与 meta 标记里的写法一致。

生效的前提

这条规则要生效,有一个绕不开的前提:抓取工具必须先抓到网页[3]。

如果添加之后网页仍出现在结果里,可能是这个网页还没被重新抓取,而重访可能要等上数月[3]。还有一个隐患:如果 robots.txt 挡住了这个网址,抓取工具根本看不到标记[3]。所以添加之后,应当确认抓取工具确实读到了标记[3]。

附录

参见

参考资料

官方(境外)

  1. 《Robots meta tags and attributes that Bing supports》,Bing 网站管理员工具。
  2. 《Meta tags》,Yandex 网站管理员。
  3. 《使用 noindex 阻止搜索引擎编入索引》,Google 搜索中心。

外部链接

无。