SEO 百科
抓取 · 索引 · 服务:三个阶段
本页目录
搜索引擎的工作流程分为三个阶段:抓取、索引编制,以及服务搜索结果[3]。三个阶段各解决一个问题:
- 把网页找回来
- 把网页读懂
- 把答案给出去
顺序不能颠倒,因为后一步都要用前一步的结果。
抓取
第一阶段要解决的是:网络上有哪些网页[3]。因为没有一份收录全部网页的总表,引擎只能不断去发现。外链是发现网页最主要的途径,从一个已知网页沿着链接走到下一个网页;站点地图是另一条,由网站主动交出一批网页[1]。
站点地图是一个列出网页地址的文件,写成 XML,放在网站根目录下。每个 <url> 列一个页面,<loc> 是该页面的完整地址:
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://www.example.com/</loc>
<lastmod>2025-09-01</lastmod>
</url>
<url>
<loc>https://www.example.com/about</loc>
</url>
</urlset>
拿到网址之后,抓取工具就去下载页面,取回其中的文字、图片和视频。执行这件事的程序叫 Googlebot,也就是常说的蜘蛛。抓取不是无限的,Googlebot 会用一套算法决定:
Googlebot 的抓取速度也有限制,以免把网站压垮。
下载时会顺带渲染,像浏览器那样把页面跑一遍,执行其中的 JavaScript。少了这一步,脚本生成的内容就看不到[3]。
索引编制
抓回来之后,引擎要弄懂这个网页讲的是什么[3]。分析的对象既有正文文字,也有关键标记,比如 title 元素和图片的 alt 属性。像 <title>数控机床厂家</title> 里的 title,<img src="cnc.jpg" alt="数控机床"> 里的 alt,都算这类标记。
这一步还要回答一个问题:这个网页是不是别处的重复,谁才是规范版本。做法是:
- 先把内容相近的网页聚成一组
- 再从组里挑出最有代表性的那一个,作为规范网页,放进搜索结果[3]
这一步还会收集一批信号,比如网页语言、面向的国家和地区,留给下一阶段使用。
编入索引并不是必然的。能不能进入索引取决于内容和元数据,被引擎处理过的网页,也有相当一部分进不了索引。
服务搜索结果
用户在搜索框里敲下查询,机器就在索引中找匹配的网页,按相关度排出结果[3]。相关度由数百个因素决定,其中包含用户的位置、语言和设备。所以同一个查询,在不同地方会给出不同结果。
结果页上出现哪些功能,也随查询而变。搜「自行车维修店」,出的可能是本地结果;搜「现代自行车」,更可能出图片结果[3]。
三个阶段的关系
三个阶段各自要解决的事不同:
| 阶段 | 主要工作 |
|---|---|
| 抓取 | 发现网页、下载页面,并顺带渲染 |
| 索引编制 | 读懂网页讲的是什么,挑出规范网页 |
| 服务搜索结果 | 在索引中找匹配网页,按相关度排出结果 |
三个阶段是串联的关口,并不是每个网页都能依次经过这三个阶段[3]。抓取决定引擎能不能见到这个页面,索引决定它进不进候选池,服务决定它对某个查询排不排得上。也就是说,前一关没过,后面无从谈起。所以排查问题时,要顺着这三个关口从前往后看。
有一件事贯穿全程:引擎不会因为付费而提高抓取频率或排名[3]。
附录
参见
参考资料
官方(境外)
- 《Bing Webmaster Guidelines》,Bing 网站管理员工具。
- 《Overview of Bing crawlers (user agents)》,Bing 网站管理员工具。
- 《关于 Google 搜索运作方式的深度指南》,Google 搜索中心。
外部链接
无。