SEO 百科
用户触发的抓取器
本页目录
用户触发的抓取器是由用户启动、在 Google 产品里执行抓取功能的那类工具[3]。和前面两类不同,它不是引擎自己按计划去扫网页,而是某个人在某个产品里发起了动作,它才出发[2]。
启动方式
触发这类工具的,是产品里的具体动作。比如网站验证工具会按用户的请求去访问目标网址[3];再比如托管在 Google Cloud 上的网站,如果允许访客检索外部 RSS Feed,这类检索也会由抓取器代劳[3]。
也就是说,每一次请求背后,都有一个具体的用户意图。
与 robots.txt 的关系
正因为是用户请求的抓取,这类工具通常会忽略 robots.txt 规则[1][3]。
这一点容易引起误会。网站看到日志里有陌生请求,会先去看 robots.txt 有没有生效;但在这个类别上,屏蔽规则本来就管不到这类请求。因为它代表的是用户自己去取这个地址,而不是搜索引擎在收录网页。
几个例子
列表里能看到的例子有几类[3]。
| 爬虫 | 用途 |
|---|---|
| Chrome 应用商店的抓取工具 | 会请求开发者在扩展和主题的元数据里提供的网址 |
Feedfetcher |
为 Google 新闻和 WebSub 抓取订阅源 |
| Gemini Notebook | 会请求用户作为项目来源提供的个别网址 |
Google-Agent |
由托管在 Google 基础架构上的代理使用,按用户请求浏览网页并执行操作 |
识别方式
这一类工具的 IP 范围公布在几个独立的对象里,各自对应不同的使用者[3]。
| 归属 | 反向 DNS 掩码 |
|---|---|
| 由 Google 拥有 | 掩码以 gae.googleusercontent.com 结尾 |
| 由用户拥有 | 掩码以 google-proxy- 开头、以 .google.com 结尾 |
也就是说,判断来源时,要先分清这一次抓取属于谁。
附录
参见
参考资料
官方(境外)
- 《About AmazonBot》,Amazon 开发者。
- 《Overview of OpenAI Crawlers》,OpenAI。
- 《Google 用户触发的抓取工具列表》,Google 搜索中心。
外部链接
无。