SEO 百科

索引存储的内容

本页目录

索引存储的内容,指的是搜索引擎在索引里保存下来的那批记录,它决定了后面呈现结果时能拿出什么、能判断什么。抓取负责把网页下载下来,真正被反复取用的却是索引里的记录。这些记录大体分成两部分,一部分描述网页自身,一部分是引擎在编入索引过程中积累的判断依据[3]。

两类记录

第一类记录描述网页自身[3]。哪个网址对应哪篇内容,这篇内容讲的是什么,又归在哪个网页群组里,都写在其中。第二类记录是信号,不是网页原文,而是引擎判断出来的属性,例如网页使用什么语言、内容面向哪个国家和地区、网页好不好用[3]。

存进去的东西已经过加工。引擎在编入索引阶段会分析文字,也会分析关键的内容标记和属性,例如标题元素、Alt 属性、图片和视频[3]。官方把这一步描述成把信息存入索引,而不是把整页文件原样存档[3]。

网页群组与规范网页

内容相近的网页会被聚成一组,再从组里挑出最有代表性的那一个,作为规范网页[3]。规范网页是可能出现在搜索结果里的版本,组里的其他网页则作为备用版本,留待不同情况使用,例如用户在移动设备上搜索时[3]。

重复内容的来源不止一种。官方列出过几类常见情形[4]:

  • 区域变体
  • 设备变体
  • 协议变体
  • 网站函数
  • 意外变体

区域变体是同一语言的内容,挂在不同地区的网址上,设备变体是同一页存在移动版和桌面版,协议变体是 HTTP 与 HTTPS 两个版本[4]。

挑哪一个当代表,由引擎按编入索引时收集的信号判断,标准是对搜索用户而言最完整、最实用[4]。站主可以用重定向、rel="canonical" 注释和站点地图提示首选网址,但这些只是提示,引擎仍可能另选一个[4]。这样做还有一个副作用,引擎会经常抓取规范网页,而较少抓取重复网页[4]。

归并的作用是集中信号。指向各个重复网址的链接、以及各自积累的判断,会汇总到选中的网址上[5]。所以索引里存的不是一个网址对应一篇内容,而是一组网页对应一个代表[3]。

判断信号

信号是留给下一阶段使用的判断依据[3]。等到有人查询时,引擎不必重新判断一篇网页面向哪里、使用什么语言,直接取用即可。

信号和内容记录一起存放,两者结合之后,才决定某次查询能拿出哪些候选。官方说信号可能会在呈现网页时用到,所以索引不只是存放内容的位置,还预先备好了一批判断依据[3]。

存储方式与规模

这些记录都存放在索引里。索引是一个大型数据库,托管在数千台计算机上[3]。

之所以需要这么多机器,是因为要收的网页以数十亿计,而且每一条都要能被随时查出来。有研究把网页结构的规模量到 10 的 10 次方这个量级,并指出这样的计算必须依赖分布式内存机器[7]。网页也不是一个静态集合,搜索引擎的引擎属于一套跨数据中心的分布式计算系统,它的索引由自动爬虫持续更新[6]。

收不进来的内容

抓取工具不会抓取它发现的全部网页[3]。有些网页被站主设为禁止抓取,有些必须登录网站才能访问,这两类都取不到内容[3]。

除这两类,还有一些内容对抓取工具不可见,例如存放在服务器文件和数据库里的数据[6]。取不到,就写不进索引,也就谈不上在查询里被取用。

与抓取和收录的分工

三个阶段各有各的产物。抓取把网页下载下来,编入索引负责生成记录,收录决定一篇网页的记录要不要留在其中[2]。

但被编入索引并不等于会被展示。官方不保证一定会抓取网页、将其编入索引或显示出来,也不保证处理过的每个网页都会编入索引[3]。另一家引擎把话说得更直接,网页数量近乎无限,网站上的页面不可能全被选中[1]。

因此,索引里存的两类内容,回答的是已经存了什么,而不是网页会不会被用上。

附录

参见

参考资料

官方(境外)

  1. 《Why is my site not in the index?》,Bing 网站管理员工具。
  2. 《How can I add a site to search?》,Yandex 网站管理员文档。
  3. 《关于 Google 搜索运作方式的深度指南》,Google 搜索中心。
  4. 《什么是规范化》,Google 搜索中心。

第三方

  1. 《Canonical Tag: Definition, Examples & Best Practices》,Moz。
  2. 《Search engine》,Wikipedia。
  3. 《Asynchronous iterative computations with Web information retrieval structures: The PageRank case》,arXiv。

外部链接

无。