SEO 百科
实体与知识图谱
本页目录
实体指的是搜索引擎能识别、归类和相互关联的“事物”[5]。人物、地点、组织和物品都可以是实体[1]。把这些实体以及彼此之间的关系连成一张网,就是知识图谱[3]。
实体的含义
实体把事物当成一个整体来看,而不是一串字词[5]。也就是说,搜索引擎要判断一个词指的是哪个人、哪个地方,或者哪件物品。
每个实体都带一个类型。常见的类型有这几类[6]:
- 人物
- 组织
- 事件
- 地点
- 国家
都不属于这些的,一般归为“事物”[6]。
这一步并不轻松。同一个名字可能指向多个事物,比如“苹果”既是一种水果,也是一家公司[9]。反过来,几种不同的写法也可能指向同一个事物。所以只看字面不够,还要看语境和词语出现的位置。
在知识图谱里,每个实体带一个唯一标识,用来把同名的实体区分开[9]。有了标识,机器在遇到“苹果”时才知道该取哪一个。
知识图谱
知识图谱是一个知识库,用语义检索从多种来源收集信息,用来提高搜索质量[3]。这个功能在 2012 年加入 Google 搜索[3]。
一张知识图谱由三种成分搭起来[9]。
| 成分 | 代表 |
|---|---|
| 节点 | 实体 |
| 边 | 实体之间的关系 |
| 属性 | 实体的具体信息 |
图谱的模式则规定用什么样的语言和结构来描述它们[9]。
知识图谱和普通结果有一处不同。普通结果给的是一串网页链接,知识图谱还额外给出关于某个主题的结构化信息[3]。知识图谱的目标是让用户直接用这些信息解决问题,不必再点开网站自己汇总[3]。
知识图谱的规模增长很快。
| 时间 | 规模 |
|---|---|
| 发布七个月后 | 数据量增至三倍,覆盖约 5.7 亿个实体和 180 亿条事实[4] |
| 2020 年 5 月 | 已经积累了 5000 亿条事实,覆盖 50 亿个实体[4] |
知识图谱和知识面板不是同一样东西。图谱是底层的记录,面板只是里面一部分数据在结果页上的可视化[6]。这张底层的库最早是从维基百科、CIA 世界概况这类公开数据集搭起来的[6]。
实体的识别
知识图谱里的信息来自网络上多种来源,并且由系统自动生成[1]。也就是说,这些信息并不是有人一条条手工录入的。Google 有时会与数据伙伴合作,用它们提供的权威数据补充电影、音乐这类特定主题[1]。
结构化数据是其中一个来源。Google 用它来了解网页内容,并收集关于网络和世界的一般信息,比如标记里提到的人物、图书或公司[2]。Schema.org 提供了这套词汇表,类型按层级排列,属性带自己的定义域和值域[8]。当前这套词汇表包含 826 个类型和 1540 个属性[7]。
这套词汇表由多家搜索引擎在 2011 年共同发起,本意是覆盖引擎能给出特殊呈现的那些实体类型,并不是一套包罗世界的完整本体[8]。
实体自身也能提供线索。知识面板收录的人物或组织,可以认领自己的面板并提交修改[1]。官方把这类实体看作自身具有权威,并给它们留出了直接反馈的渠道[1]。
网络上的真人讨论也在起作用。评价、论坛甚至播客里的提及,都会被系统读出来,归入实体之间的关系[5]。系统还会从音视频里提取信息,把语音转成文字后,找出其中提到的实体和它们的关系[5]。
实体与搜索结果
实体进入知识图谱后,会在搜索结果里有对应的呈现,最典型的是知识面板[1]。知识面板是用户搜索某个实体时出现的信息框[1]。面板由系统自动生成,信息来源是网络上的多种渠道[1]。
这些呈现还依赖网页给出的线索。以组织为例,加上结构化数据能帮 Google 更清楚地了解组织的资料,并把它和其他同名组织区分开[2]。这类数据还会影响结果里显示哪个图标[1]。
以一家机械设备企业为例,这段 JSON-LD 放在网站首页的 <head> 里,就向 Google 说明了它是谁:
{
"@context": "https://schema.org",
"@type": "Organization",
"name": "示例机械有限公司",
"url": "https://www.example.com",
"logo": "https://www.example.com/images/logo.png",
"description": "生产数控机床的机械设备企业",
"telephone": "+86-21-1234-5678"
}
实体也影响到图片结果。同一个主题的图片有时会围绕一个知名人物或地点聚在一起,这是图谱把非网页来源的资料一并收纳的表现[6]。
区分这一步很关键。因为查询常常只给出一个模糊的名字,如果实体认错了,后面匹配到的内容也就偏了。所以实体理解是查询理解的基础。
实体与 AI 搜索
实体在生成式搜索里的作用更重。大型语言模型给出的答案,不只是从网页里挑关键词,而是提取出实体,把它们放进一个按含义排布的向量空间,再选出最能回答问题的那些[5]。品牌、产品、人物和主题都以实体的形式进入模型的理解。
Google 的生成式模型就建立在知识图谱之上,所以一个实体在库里被怎样记录,会影响到它在 AI 回答里如何被提到[9]。这也是实体资料值得维护的原因:记录准确,机器引用时才不容易出错。
实体之间的关系还带来了新的可见路径。一个查询会被拆成多个相关的检索,品牌可以从其中任何一条路径出现,哪怕没有为原查询做过优化[5]。提到的渠道因此从页面扩展到论坛、视频和播客[5]。
附录
参见
参考资料
官方(境外)
- 《About knowledge panels》,Google 知识面板帮助。
- 《Google 搜索中的结构化数据标记简介》,Google 搜索中心。
第三方
- 《Google知识图谱》,维基百科。
- 《Knowledge Graph (Google)》,维基百科。
- 《Entity SEO: How to Build Digital Brand Visibility in AI Search》,Backlinko。
- 《Google Knowledge Graph and How it Works》,Search Engine Journal。
- 《Schemas》,Schema.org。
- 《Data model》,Schema.org。
- 《Google Knowledge Graph: What it is & why it matters》,Semrush。
外部链接
无。