SEO 百科

抓取 · 索引 · 服务:三个阶段

本页目录

搜索引擎的工作流程分为三个阶段:抓取、索引编制,以及服务搜索结果[3]。三个阶段各解决一个问题:

  • 把网页找回来
  • 把网页读懂
  • 把答案给出去

顺序不能颠倒,因为后一步都要用前一步的结果。

抓取

第一阶段要解决的是:网络上有哪些网页[3]。因为没有一份收录全部网页的总表,引擎只能不断去发现。外链是发现网页最主要的途径,从一个已知网页沿着链接走到下一个网页;站点地图是另一条,由网站主动交出一批网页[1]。

站点地图是一个列出网页地址的文件,写成 XML,放在网站根目录下。每个 <url> 列一个页面,<loc> 是该页面的完整地址:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
  <url>
    <loc>https://www.example.com/</loc>
    <lastmod>2025-09-01</lastmod>
  </url>
  <url>
    <loc>https://www.example.com/about</loc>
  </url>
</urlset>

拿到网址之后,抓取工具就去下载页面,取回其中的文字、图片和视频。执行这件事的程序叫 Googlebot,也就是常说的蜘蛛。抓取不是无限的,Googlebot 会用一套算法决定:

  • 抓哪些站
  • 多久抓一次
  • 每个站抓多少页[2][3]

Googlebot 的抓取速度也有限制,以免把网站压垮。

下载时会顺带渲染,像浏览器那样把页面跑一遍,执行其中的 JavaScript。少了这一步,脚本生成的内容就看不到[3]。

索引编制

抓回来之后,引擎要弄懂这个网页讲的是什么[3]。分析的对象既有正文文字,也有关键标记,比如 title 元素和图片的 alt 属性。像 <title>数控机床厂家</title> 里的 title,<img src="cnc.jpg" alt="数控机床"> 里的 alt,都算这类标记。

这一步还要回答一个问题:这个网页是不是别处的重复,谁才是规范版本。做法是:

  1. 先把内容相近的网页聚成一组
  2. 再从组里挑出最有代表性的那一个,作为规范网页,放进搜索结果[3]

这一步还会收集一批信号,比如网页语言、面向的国家和地区,留给下一阶段使用。

编入索引并不是必然的。能不能进入索引取决于内容和元数据,被引擎处理过的网页,也有相当一部分进不了索引。

服务搜索结果

用户在搜索框里敲下查询,机器就在索引中找匹配的网页,按相关度排出结果[3]。相关度由数百个因素决定,其中包含用户的位置、语言和设备。所以同一个查询,在不同地方会给出不同结果。

结果页上出现哪些功能,也随查询而变。搜「自行车维修店」,出的可能是本地结果;搜「现代自行车」,更可能出图片结果[3]。

三个阶段的关系

三个阶段各自要解决的事不同:

阶段 主要工作
抓取 发现网页、下载页面,并顺带渲染
索引编制 读懂网页讲的是什么,挑出规范网页
服务搜索结果 在索引中找匹配网页,按相关度排出结果

三个阶段是串联的关口,并不是每个网页都能依次经过这三个阶段[3]。抓取决定引擎能不能见到这个页面,索引决定它进不进候选池,服务决定它对某个查询排不排得上。也就是说,前一关没过,后面无从谈起。所以排查问题时,要顺着这三个关口从前往后看。

有一件事贯穿全程:引擎不会因为付费而提高抓取频率或排名[3]。

附录

参见

参考资料

官方(境外)

  1. 《Bing Webmaster Guidelines》,Bing 网站管理员工具。
  2. 《Overview of Bing crawlers (user agents)》,Bing 网站管理员工具。
  3. 《关于 Google 搜索运作方式的深度指南》,Google 搜索中心。

外部链接

无。