SEO 百科
AI 爬虫
本页目录
AI 爬虫指的是由 AI 产品运营、用来收集网页内容的抓取工具。AI 爬虫和搜索引擎的爬虫做的是同一件事,目的却不同:
- 有的是为了训练模型
- 有的是为了做搜索
- 还有的是替用户去取某个网页
分清用途,是决定要不要放行的前提。
用途的三种
AI 爬虫的用途可以分成三类。
- 服务于模型训练。Anthropic 的
ClaudeBot就属于这一类,收集可能对模型有用的网页内容;网站限制它,等于声明不希望未来的材料被纳入训练数据集[1]。 - 服务于搜索。
Claude-SearchBot会浏览网页,用来提升搜索结果的质量和准确度[1];Perplexity 的PerplexityBot则用来在搜索结果里呈现网站、链接网站[2]。 - 替用户取回内容。用户在对话里提问时,系统可能代他访问网页,比如
Claude-User和Perplexity-User[1][2]。
与 robots.txt 的关系
多数 AI 爬虫会遵守 robots.txt 里的指令[1]。Anthropic 明确说,它的爬虫遵循 robots.txt 中的行业标准指令,也尊重反规避技术,比如不去尝试绕开验证码[1]。
但有一类例外。由用户请求触发的抓取,通常会忽略 robots.txt 规则,Perplexity-User 就是这样[2]。也就是说,屏蔽的意愿要通过 robots.txt 表达,但对用户发起的那一类,可能表达不到。
按用途分开写规则,就能只拦下训练类,放行搜索类:
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Allow: /
命名与验证
这些爬虫一般按用途分别命名,各自对应一个独立的用户代理令牌。所以网站可以只放行搜索类,同时拦下训练类[1]。
验证来源也有现成的依据。Anthropic 和 Perplexity 都公布了自己爬虫的 IP 列表[1][2]。Perplexity 还建议,如果网站用了 Web 应用防火墙,要把这些爬虫显式放行,否则可能被一起拦住[2]。
附录
参见
参考资料
官方(境外)
- 《Does Anthropic crawl data from the web, and how can site owners block the crawler?》,Anthropic 帮助中心。
- 《Perplexity Crawlers》,Perplexity 文档。
外部链接
无。