SEO 百科
AI 爬虫管理
本页目录
AI 爬虫管理是通过 robots.txt 一类的设置,决定各类 AI 爬虫能否访问自己网站的做法[1]。
按用途区分
OpenAI 用 OAI-SearchBot 与 GPTBot 等标签,让站长分别管理搜索类与训练类用途[1]。比如一家做数控机床的机械设备企业官网,在 robots.txt 里写上 User-agent: GPTBot,再写 Disallow: /,就能禁止训练类爬虫抓取。
各项设置彼此独立[1][2]。例如允许搜索类抓取以便出现在结果里,同时禁止训练类抓取[1][3]。
把搜索类与训练类分开设置时,网站根目录的 robots.txt 可以这样写。
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
Disallow: /
OAI-SearchBot 与 PerplexityBot 负责搜索类,GPTBot 负责训练类。
生效的节奏
robots.txt 更新之后,系统调整可能需要大约一天[1][3]。
也就是说,即便是同一家平台的爬虫,也要留出生效的时间。
与结果的关系
如果站点同时允许两类爬虫,平台可能会复用同一次抓取的结果来满足两种用途,避免重复抓取[1]。
所以这层设置既影响内容能不能被使用,也影响抓取的负担[1]。
与其他控制手段的关系
robots.txt 管访问,如果想控制收录,则要用 noindex 一类的规则[2]。
对策略的影响
不同用途的开关可以分开,让站点在参与搜索与保护内容之间找平衡[1]。
与平台差异的关系
所以要按平台逐一确认,而不是把同一份规则照搬过去[1]。这也让站点可以按平台分别表态。
附录
参见
参考资料
官方(境外)
- 《Overview of OpenAI Crawlers》,OpenAI。
- 《Perplexity Crawlers》,Perplexity。
- 《About AmazonBot》,Amazon。
外部链接
无。