SEO 百科

AI 爬虫管理

本页目录

AI 爬虫管理是通过 robots.txt 一类的设置,决定各类 AI 爬虫能否访问自己网站的做法[1]。

按用途区分

OpenAI 用 OAI-SearchBot 与 GPTBot 等标签,让站长分别管理搜索类与训练类用途[1]。比如一家做数控机床的机械设备企业官网,在 robots.txt 里写上 User-agent: GPTBot,再写 Disallow: /,就能禁止训练类爬虫抓取。

各项设置彼此独立[1][2]。例如允许搜索类抓取以便出现在结果里,同时禁止训练类抓取[1][3]。

把搜索类与训练类分开设置时,网站根目录的 robots.txt 可以这样写。

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: GPTBot
Disallow: /

OAI-SearchBot 与 PerplexityBot 负责搜索类,GPTBot 负责训练类。

生效的节奏

robots.txt 更新之后,系统调整可能需要大约一天[1][3]。

也就是说,即便是同一家平台的爬虫,也要留出生效的时间。

与结果的关系

如果站点同时允许两类爬虫,平台可能会复用同一次抓取的结果来满足两种用途,避免重复抓取[1]。

所以这层设置既影响内容能不能被使用,也影响抓取的负担[1]。

与其他控制手段的关系

robots.txt 管访问,如果想控制收录,则要用 noindex 一类的规则[2]。

对策略的影响

不同用途的开关可以分开,让站点在参与搜索与保护内容之间找平衡[1]。

与平台差异的关系

不同平台使用的爬虫名称和用途划分并不一致[1][2]。

所以要按平台逐一确认,而不是把同一份规则照搬过去[1]。这也让站点可以按平台分别表态。

附录

参见

参考资料

官方(境外)

  1. 《Overview of OpenAI Crawlers》,OpenAI。
  2. 《Perplexity Crawlers》,Perplexity。
  3. 《About AmazonBot》,Amazon。

外部链接

无。