SEO 百科

AI 爬虫

本页目录

AI 爬虫指的是由 AI 产品运营、用来收集网页内容的抓取工具。AI 爬虫和搜索引擎的爬虫做的是同一件事,目的却不同:

  • 有的是为了训练模型
  • 有的是为了做搜索
  • 还有的是替用户去取某个网页

分清用途,是决定要不要放行的前提。

用途的三种

AI 爬虫的用途可以分成三类。

  1. 服务于模型训练。Anthropic 的 ClaudeBot 就属于这一类,收集可能对模型有用的网页内容;网站限制它,等于声明不希望未来的材料被纳入训练数据集[1]。
  2. 服务于搜索。Claude-SearchBot 会浏览网页,用来提升搜索结果的质量和准确度[1];Perplexity 的 PerplexityBot 则用来在搜索结果里呈现网站、链接网站[2]。
  3. 替用户取回内容。用户在对话里提问时,系统可能代他访问网页,比如 Claude-User 和 Perplexity-User[1][2]。

与 robots.txt 的关系

多数 AI 爬虫会遵守 robots.txt 里的指令[1]。Anthropic 明确说,它的爬虫遵循 robots.txt 中的行业标准指令,也尊重反规避技术,比如不去尝试绕开验证码[1]。

但有一类例外。由用户请求触发的抓取,通常会忽略 robots.txt 规则,Perplexity-User 就是这样[2]。也就是说,屏蔽的意愿要通过 robots.txt 表达,但对用户发起的那一类,可能表达不到。

按用途分开写规则,就能只拦下训练类,放行搜索类:

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Allow: /

命名与验证

这些爬虫一般按用途分别命名,各自对应一个独立的用户代理令牌。所以网站可以只放行搜索类,同时拦下训练类[1]。

验证来源也有现成的依据。Anthropic 和 Perplexity 都公布了自己爬虫的 IP 列表[1][2]。Perplexity 还建议,如果网站用了 Web 应用防火墙,要把这些爬虫显式放行,否则可能被一起拦住[2]。

附录

参见

参考资料

官方(境外)

  1. 《Does Anthropic crawl data from the web, and how can site owners block the crawler?》,Anthropic 帮助中心。
  2. 《Perplexity Crawlers》,Perplexity 文档。

外部链接

无。