SEO 百科

训练数据

本页目录

训练数据是被用来训练生成式 AI 基础模型的内容[1]。

与检索数据的区别

爬取内容用于训练,与内容用于搜索类呈现,是两件可以分别控制的事[1]。

允许搜索类抓取、禁止训练类抓取,是常见的组合[1][2]。

控制的方式

站点可以通过对应的 robots.txt 标签,表明爬取到的内容是否可用于训练[1][2]。

也就是说,训练用途是一道单独的开关,可以和其他用途分开设置。

禁止训练用途时,网站根目录的 robots.txt 可以这样写。

User-agent: GPTBot
Disallow: /

User-agent: Applebot-Extended
Disallow: /

两个令牌分别对应 OpenAI 与 Apple 的训练用途。

与许可的关系

技术上的开关表达的是态度,更细的使用条件通常要落到授权安排里[1][3]。

两者配合,才构成完整的内容使用边界[1]。

与其他用途的并列

同一批内容可能同时涉及训练、搜索呈现等多种用途[1]。

每种用途对应各自的开关,互不牵连[1]。

对站点的意味

明确训练用途的态度,是内容策略里越来越常见的一步[1]。

与站点内容的关系

以内容为产品的站点,训练用途关系到内容本身的价值归属[1]。

这也是越来越多站点单独设置这道开关的原因[1]。也就是说,拒绝训练并不影响内容参与搜索。

附录

参见

参考资料

官方(境外)

  1. 《Overview of OpenAI Crawlers》,OpenAI。
  2. 《About Applebot》,Apple。
  3. 《Can I use my Outputs to train an AI model?》,Anthropic。

外部链接

无。