SEO 百科
训练数据
本页目录
训练数据是被用来训练生成式 AI 基础模型的内容[1]。
与检索数据的区别
爬取内容用于训练,与内容用于搜索类呈现,是两件可以分别控制的事[1]。
控制的方式
站点可以通过对应的 robots.txt 标签,表明爬取到的内容是否可用于训练[1][2]。
也就是说,训练用途是一道单独的开关,可以和其他用途分开设置。
禁止训练用途时,网站根目录的 robots.txt 可以这样写。
User-agent: GPTBot
Disallow: /
User-agent: Applebot-Extended
Disallow: /
两个令牌分别对应 OpenAI 与 Apple 的训练用途。
与许可的关系
技术上的开关表达的是态度,更细的使用条件通常要落到授权安排里[1][3]。
两者配合,才构成完整的内容使用边界[1]。
与其他用途的并列
同一批内容可能同时涉及训练、搜索呈现等多种用途[1]。
每种用途对应各自的开关,互不牵连[1]。
对站点的意味
与站点内容的关系
以内容为产品的站点,训练用途关系到内容本身的价值归属[1]。
这也是越来越多站点单独设置这道开关的原因[1]。也就是说,拒绝训练并不影响内容参与搜索。
附录
参见
参考资料
官方(境外)
- 《Overview of OpenAI Crawlers》,OpenAI。
- 《About Applebot》,Apple。
- 《Can I use my Outputs to train an AI model?》,Anthropic。
外部链接
无。