跳至主要内容

什么是知识图谱?

以图结构组织世界知识,让机器理解实体之间的语义关系

什么是知识图谱?

知识图谱(Knowledge Graph)是一种以图结构存储和表示知识的技术,将现实世界中的实体(人、地点、事物、概念)表示为节点,将实体之间的关系表示为边,形成一个语义丰富的知识网络。知识图谱让机器能够像人类一样理解事物之间的关联,支撑智能搜索、问答和推理等应用。

知识图谱的核心是"三元组"结构:(主体, 关系, 客体),例如("北京", "是...的首都", "中国")。通过大量三元组的组合,知识图谱可以表达复杂的世界知识,并支持多跳推理——从已知事实推导出新的结论。例如,从"张三在 A 公司工作"和"A 公司总部位于北京"这两个事实,可以推导出"张三可能在北京工作"。

知识图谱的概念最早由谷歌在 2012 年提出,用于增强搜索引擎的理解能力。如今,知识图谱已广泛应用于搜索引擎、推荐系统、智能客服、金融风控、医疗健康和供应链管理等领域,是连接数据与智能的桥梁。随着生成式 AI的发展,知识图谱作为结构化知识源与大语言模型的结合(GraphRAG)正在成为提升 AI 可靠性的重要方向。

为什么知识图谱很重要?

为 AI 提供结构化世界知识

大语言模型通过文本学习知识,但缺乏明确的事实表示。知识图谱为 AI 提供可查询、可验证的结构化事实,增强回答的准确性和可信度。在 GraphRAG 架构中,知识图谱作为结构化知识源,帮助大语言模型生成更准确和可追溯的回答。

实现语义级数据集成

企业数据分散在多个系统中,格式各异。知识图谱通过统一的语义模型将异构数据连接起来,打破数据孤岛。无论数据来自 CRM、ERP 还是文档管理系统,知识图谱都能以统一的实体和关系视角呈现信息,使不同部门的数据可以互联互通。

支撑复杂推理

知识图谱支持基于关系的多跳推理,例如从"张三在 A 公司工作"和"A 公司位于北京"推导出"张三在北京工作"。这种推理能力对于发现隐性关联(如金融欺诈中的关系网络)至关重要。

增强搜索和发现

知识图谱使搜索引擎能够理解查询意图并返回结构化答案(如搜索"北京人口"直接显示数字),而不仅是网页链接列表。知识面板、实体卡片等富搜索结果均依赖知识图谱的支持。

提供可解释的 AI 决策

与黑盒深度学习模型不同,知识图谱中的推理路径是可追溯和可解释的。当系统给出推荐或预测时,可以展示推理所依据的实体和关系链条,增强用户信任。

知识图谱由哪些部分组成?

实体(节点)

表示现实世界中的具体事物或抽象概念,如人物、组织、地点、产品、事件等。每个实体有唯一标识,并通过类型系统归类。

关系(边)

表示实体之间的语义联系,如"隶属于""位于""生产""参与"等。关系是有方向的,从主体指向客体,并且关系本身也可以附带属性(如关系的时间、置信度)。

属性

描述实体的特征信息,如人物的"出生日期"、公司的"成立时间"、产品的"价格"等。属性使实体不仅仅是一个标识符,而是携带丰富信息的知识载体。

本体(Schema)

定义知识图谱中的类型体系和关系约束,规范哪些类型的实体可以通过哪些关系相连。本体是知识图谱的"蓝图",确保数据的一致性和语义正确性。常用的本体语言包括 OWL 和 RDFS。

推理规则

基于已有知识推导新知识的逻辑规则,扩展知识图谱的覆盖范围。推理可以是基于本体的(如子类继承)或基于自定义规则的(如传递性关系推理)。

知识图谱有哪些主要类型?

通用知识图谱

覆盖广泛领域的通用知识,如 Wikidata、DBpedia 等。包含数亿实体和数十亿三元组,适合通用搜索和问答。

领域知识图谱

针对特定行业或领域构建,如医疗知识图谱(疾病-症状-药物)、金融知识图谱(企业-股权-担保)和学术知识图谱(论文-作者-机构)。领域图谱的数据更精准,推理规则更专业。

企业知识图谱

面向单个企业的内部知识管理,整合员工、项目、文档、系统等内部数据,支持企业内部搜索、专家发现和知识共享。

事件知识图谱

以事件为核心,记录事件的参与者、时间、地点和因果关系,适合新闻分析、舆情监控和历史事件研究等时序性强的场景。

多模态知识图谱

除文本信息外,还融合图像、视频、表格等多模态数据。例如将产品图片与产品实体关联,将医学影像与诊断实体关联,使知识表示更加全面。多模态知识图谱能够支持更丰富的检索和推理能力,如通过图片识别关联实体或通过实体查找相关视觉内容。

知识图谱有哪些应用场景?

智能搜索与问答

搜索引擎利用知识图谱直接回答用户问题(如"长江有多长"),并展示相关实体卡片,提升搜索体验。企业内部搜索系统也可以利用知识图谱将分散的文档、人员和项目信息关联起来,帮助员工快速找到所需知识。

推荐系统增强

将用户、商品和属性组织为知识图谱,利用图关系发现深层关联,提升推荐的准确性和可解释性。基于图谱的推荐不仅依赖用户历史行为,还能通过实体间的语义关系发现潜在兴趣。例如,当用户购买了一本关于机器学习的书,系统可以通过作者关系、主题关系推荐相关的课程或工具。

金融风控

构建企业关联图谱,发现隐性关联关系(如担保链、实际控制人),辅助信贷审批和反欺诈分析。图遍历算法可以快速识别复杂的关系网络中的风险模式,这是传统关系型数据库难以高效完成的任务。

药物研发

构建药物-靶点-疾病-基因的知识图谱,发现潜在的药物重定位机会和新靶点。通过分析已知药物与疾病之间的路径关系,识别可能有效的新药物-疾病组合,大幅缩短药物发现周期。

企业知识管理

将企业内部的人员、项目、文档、系统等组织为知识图谱,支持智能搜索和知识发现。新员工可以通过图谱快速了解项目背景、技术栈和相关人员,减少知识传递和团队协作的成本。

网络安全威胁情报

将攻击者、漏洞、恶意软件、攻击技术和目标系统之间的关系构建为威胁情报知识图谱,帮助安全团队快速理解攻击链路、追溯威胁来源,并预测可能的下一步攻击行为。

供应链分析

将供应商、零部件、工厂之间的关系建模为图,分析供应链风险和替代方案。当某个供应商出现问题时,可以快速追溯影响范围并找到备选供应路径。

GraphRAG 增强生成

将知识图谱与检索增强生成(RAG)相结合,利用图结构提供更精确和完整的上下文。相比纯向量检索,GraphRAG 能够通过图遍历捕获实体间的结构化关系,生成更准确和更具关联性的回答。

知识图谱是如何构建的?

  1. 本体设计 - 定义知识图谱的类型体系、关系类型和约束规则。好的本体设计需要领域专家参与,确保覆盖业务需求并具有足够的扩展性。设计时需要平衡表达力与复杂度,过于精细的本体会增加维护成本
  2. 数据采集 - 从结构化数据库、半结构化文档和非结构化文本中采集原始数据。数据来源可能包括内部系统、公开数据集和网页抓取
  3. 信息抽取 - 使用自然语言处理技术从文本中提取实体、关系和属性。命名实体识别、关系抽取和事件检测是核心技术手段
  4. 知识融合 - 对来自不同来源的同一实体进行对齐和合并,消除冗余和冲突。实体消歧和实体链接是这一步的关键挑战
  5. 质量验证 - 通过规则检查和人工审核确保知识的准确性。可以使用一致性检查规则自动发现矛盾事实
  6. 存储与索引 - 将知识图谱存入图数据库,建立高效的查询索引。选择合适的图模型(属性图或 RDF)和查询语言
  7. 持续更新 - 建立知识图谱的自动更新机制,保持数据时效性。增量更新比全量重建更高效,但需要处理冲突检测

知识图谱与关系型数据库相比如何?

关系型数据库

  • 基于表格结构(行和列)
  • 适合固定 Schema 的结构化数据
  • 多表关联查询(JOIN)性能随深度下降
  • 模式变更成本高
  • 事务支持完善(ACID)

知识图谱(图数据库)

  • 基于节点和边的图结构
  • Schema 灵活,可随时扩展新类型和关系
  • 多跳关系查询天然高效
  • 适合表达复杂的关联关系
  • 可视化探索直观,便于发现隐性关联

互补使用

实际系统中通常将关系型数据库(处理事务性业务数据)和知识图谱(处理关联分析和语义查询)配合使用。关系型数据库处理日常业务操作,知识图谱提供关系洞察和智能分析能力,两者互相补充。

知识图谱面临哪些挑战?

知识获取成本

高质量知识图谱的构建需要大量领域专家参与和人工标注,自动化抽取的准确率仍有提升空间。尽管大语言模型可以辅助知识抽取,但仍需要人工验证关键事实的准确性。

知识时效性

现实世界持续变化,知识图谱需要及时更新以保持准确性,但大规模更新的自动化难度大。组织需要建立持续的知识更新流程,平衡更新频率与验证成本。

不完整性

任何知识图谱都无法覆盖所有事实,开放世界假设下的推理需要处理知识缺失问题。系统需要区分"不知道"和"不存在"两种情况。

规模与性能

数十亿级三元组的图数据库在复杂查询(如多跳路径)下的性能优化是技术难点。图分区、索引策略和查询优化器的设计直接影响大规模图谱的可用性。

多语言与跨领域

不同语言和领域的知识融合、对齐是构建通用知识图谱的核心挑战。同一概念在不同语言和文化背景下可能有不同的表述和分类方式。

与大语言模型的协作

如何高效地将知识图谱中的结构化知识注入大语言模型的推理过程,以及如何利用大语言模型自动扩充和验证知识图谱内容,是当前研究的热点方向。两者的深度协作可以同时发挥大语言模型的语言理解能力和知识图谱的事实准确性。

AWS 如何为您的知识图谱需求提供支持?

Amazon Web Services (AWS) 提供从图数据库存储到 AI 驱动的知识应用的完整支持。

Amazon Neptune 是一项完全托管的图数据库服务,支持 Property Graph(使用 openCypher 和 Gremlin 查询)和 RDF(使用 SPARQL 查询)两种图模型,提供毫秒级图查询性能。Neptune 可存储和查询数十亿个关系,支持跨数千个并发查询的高吞吐量,适用于推荐引擎、欺诈检测、知识图谱和药物发现等场景。Neptune Analytics 进一步提供图分析和向量搜索功能,支持在同一服务中执行图算法和向量相似度搜索。

Amazon Bedrock Knowledge Bases 提供完全托管的 GraphRAG 功能,将 Amazon Neptune Analytics 的图数据与生成式 AI 相结合。GraphRAG 将向量搜索与图数据的快速分析能力结合,使 RAG 应用能够利用知识图谱中的结构化关系生成更精确和更有上下文关联的回答。

Amazon OpenSearch 提供全文搜索和向量搜索能力,与知识图谱配合实现混合检索,支持从关键词搜索到图谱探索的无缝体验。

Amazon SageMaker 是一项完全托管的机器学习平台,支持训练知识图谱嵌入模型和链接预测模型,自动发现知识图谱中的缺失关系,持续丰富图谱内容。

通过将 Neptune 的图存储与 Bedrock 的生成式 AI 能力结合,企业可以构建端到端的知识图谱解决方案,从自动化知识抽取和图谱构建到基于图谱的智能问答和分析报告生成,全流程在 AWS 托管服务上完成。

立即创建 AWS 账户,开始在 AWS 上构建您的知识图谱应用。

浏览所有云计算定义主题

在此处查看所有云计算定义页面

正在加载
正在加载
正在加载
正在加载
正在加载