SEO 百科

实体与知识图谱

本页目录

实体指的是搜索引擎能识别、归类和相互关联的“事物”[5]。人物、地点、组织和物品都可以是实体[1]。把这些实体以及彼此之间的关系连成一张网,就是知识图谱[3]。

实体的含义

实体把事物当成一个整体来看,而不是一串字词[5]。也就是说,搜索引擎要判断一个词指的是哪个人、哪个地方,或者哪件物品。

每个实体都带一个类型。常见的类型有这几类[6]:

  • 人物
  • 组织
  • 事件
  • 地点
  • 国家

都不属于这些的,一般归为“事物”[6]。

这一步并不轻松。同一个名字可能指向多个事物,比如“苹果”既是一种水果,也是一家公司[9]。反过来,几种不同的写法也可能指向同一个事物。所以只看字面不够,还要看语境和词语出现的位置。

在知识图谱里,每个实体带一个唯一标识,用来把同名的实体区分开[9]。有了标识,机器在遇到“苹果”时才知道该取哪一个。

知识图谱

知识图谱是一个知识库,用语义检索从多种来源收集信息,用来提高搜索质量[3]。这个功能在 2012 年加入 Google 搜索[3]。

一张知识图谱由三种成分搭起来[9]。

成分 代表
节点 实体
边 实体之间的关系
属性 实体的具体信息

图谱的模式则规定用什么样的语言和结构来描述它们[9]。

知识图谱和普通结果有一处不同。普通结果给的是一串网页链接,知识图谱还额外给出关于某个主题的结构化信息[3]。知识图谱的目标是让用户直接用这些信息解决问题,不必再点开网站自己汇总[3]。

知识图谱的规模增长很快。

时间 规模
发布七个月后 数据量增至三倍,覆盖约 5.7 亿个实体和 180 亿条事实[4]
2020 年 5 月 已经积累了 5000 亿条事实,覆盖 50 亿个实体[4]

知识图谱和知识面板不是同一样东西。图谱是底层的记录,面板只是里面一部分数据在结果页上的可视化[6]。这张底层的库最早是从维基百科、CIA 世界概况这类公开数据集搭起来的[6]。

实体的识别

知识图谱里的信息来自网络上多种来源,并且由系统自动生成[1]。也就是说,这些信息并不是有人一条条手工录入的。Google 有时会与数据伙伴合作,用它们提供的权威数据补充电影、音乐这类特定主题[1]。

结构化数据是其中一个来源。Google 用它来了解网页内容,并收集关于网络和世界的一般信息,比如标记里提到的人物、图书或公司[2]。Schema.org 提供了这套词汇表,类型按层级排列,属性带自己的定义域和值域[8]。当前这套词汇表包含 826 个类型和 1540 个属性[7]。

这套词汇表由多家搜索引擎在 2011 年共同发起,本意是覆盖引擎能给出特殊呈现的那些实体类型,并不是一套包罗世界的完整本体[8]。

实体自身也能提供线索。知识面板收录的人物或组织,可以认领自己的面板并提交修改[1]。官方把这类实体看作自身具有权威,并给它们留出了直接反馈的渠道[1]。

网络上的真人讨论也在起作用。评价、论坛甚至播客里的提及,都会被系统读出来,归入实体之间的关系[5]。系统还会从音视频里提取信息,把语音转成文字后,找出其中提到的实体和它们的关系[5]。

实体与搜索结果

实体进入知识图谱后,会在搜索结果里有对应的呈现,最典型的是知识面板[1]。知识面板是用户搜索某个实体时出现的信息框[1]。面板由系统自动生成,信息来源是网络上的多种渠道[1]。

这些呈现还依赖网页给出的线索。以组织为例,加上结构化数据能帮 Google 更清楚地了解组织的资料,并把它和其他同名组织区分开[2]。这类数据还会影响结果里显示哪个图标[1]。

以一家机械设备企业为例,这段 JSON-LD 放在网站首页的 <head> 里,就向 Google 说明了它是谁:

{
  "@context": "https://schema.org",
  "@type": "Organization",
  "name": "示例机械有限公司",
  "url": "https://www.example.com",
  "logo": "https://www.example.com/images/logo.png",
  "description": "生产数控机床的机械设备企业",
  "telephone": "+86-21-1234-5678"
}

实体也影响到图片结果。同一个主题的图片有时会围绕一个知名人物或地点聚在一起,这是图谱把非网页来源的资料一并收纳的表现[6]。

区分这一步很关键。因为查询常常只给出一个模糊的名字,如果实体认错了,后面匹配到的内容也就偏了。所以实体理解是查询理解的基础。

实体与 AI 搜索

实体在生成式搜索里的作用更重。大型语言模型给出的答案,不只是从网页里挑关键词,而是提取出实体,把它们放进一个按含义排布的向量空间,再选出最能回答问题的那些[5]。品牌、产品、人物和主题都以实体的形式进入模型的理解。

Google 的生成式模型就建立在知识图谱之上,所以一个实体在库里被怎样记录,会影响到它在 AI 回答里如何被提到[9]。这也是实体资料值得维护的原因:记录准确,机器引用时才不容易出错。

实体之间的关系还带来了新的可见路径。一个查询会被拆成多个相关的检索,品牌可以从其中任何一条路径出现,哪怕没有为原查询做过优化[5]。提到的渠道因此从页面扩展到论坛、视频和播客[5]。

附录

参见

参考资料

官方(境外)

  1. 《About knowledge panels》,Google 知识面板帮助。
  2. 《Google 搜索中的结构化数据标记简介》,Google 搜索中心。

第三方

  1. 《Google知识图谱》,维基百科。
  2. 《Knowledge Graph (Google)》,维基百科。
  3. 《Entity SEO: How to Build Digital Brand Visibility in AI Search》,Backlinko。
  4. 《Google Knowledge Graph and How it Works》,Search Engine Journal。
  5. 《Schemas》,Schema.org。
  6. 《Data model》,Schema.org。
  7. 《Google Knowledge Graph: What it is & why it matters》,Semrush。

外部链接

无。