Skip to content

知识图谱

知识图谱是煎蛋平台知识库的高级功能。与传统 RAG 仅依赖文本块的语义匹配不同,知识图谱将文档中的信息结构化为实体—关系—实体的三元组网络,使 AI 能够理解概念之间的逻辑关联,从而支持总结性问答、多跳推理等复杂场景。

为什么需要知识图谱

传统 RAG 的工作方式是将用户问题转化为向量,在向量空间中查找与之语义相近的文本块,然后将这些文本块作为上下文提供给大模型生成回答。这种方式在事实类问答中效果良好,但在以下场景存在局限:

  • 总结性问题:如"本文档涉及哪些核心技术?"——这类问题需要跨多个文本块聚合信息,向量检索难以覆盖全局
  • 多跳推理:如"A 技术由哪个团队在哪个项目中首次应用?"——需要串联多个分散的事实
  • 关系理解:如"A 和 B 之间是什么关系?"——需要预先建立概念间的关联

知识图谱正是为解决这些场景而生。它将文档内容预先结构化为图网络,在检索时不仅返回匹配的文本块,还能带回相关的关联节点,让大模型获得更完整的上下文。

知识图谱如何构建

煎蛋平台支持两种知识图谱构建模式:

基于词法的自动提取

在此模式下,大模型直接阅读文档内容,自动识别其中的实体(概念、人物、组织、技术等)和它们之间的关系,并以三元组(头实体、关系、尾实体)的形式输出。这种方式无需人工干预,适合快速探索未知领域的文档。

大模型在提取时会综合考虑:

  • 词频与共现:高频共现的术语更可能构成关系
  • 语义角色:识别主语、谓语、宾语的语义结构
  • 上下文消歧:结合上下文区分同一术语在不同语境中的含义

基于专家定义的领域知识图谱

对于专业领域,AI 自动提取的实体和关系可能不够精准,或者遗漏行业特定的关键概念。平台允许领域专家预先定义:

  • 实体类型:例如在医学领域,定义"疾病"、"药物"、"症状"、"检查指标"等实体类别
  • 关系类型:例如"药物—治疗—疾病"、"症状—提示—疾病"、"检查—发现—指标异常"

定义好数据模型后,大模型将按照专家设定的框架进行三元组抽取。这相当于给 AI 配备了一副"领域眼镜",让它用专家的视角去理解文档,大幅提升抽取的准确性和专业性。

同义词表

同义词表用于规范化术语。在实际文档中,同一概念可能以多种方式出现,例如"机器学习"、"Machine Learning"、"ML"。通过预设同义词表,告知大模型在提取到这些变体时统一使用标准术语,避免图谱中出现大量重复节点。

停用词表

停用词表用于过滤掉不需要作为实体出现的词汇。例如在技术文档中,"系统"、"功能"、"模块"等通用词频繁出现但对其单独建节点意义不大。将它们加入停用词表后,大模型在提取时将自动忽略这些词汇。

知识图谱的编辑与维护

大模型自动生成的知识图谱通常需要人工审核和优化,这是一个"AI 生成 + 人工精修"的协作过程。

节点编辑

  • 修改属性:调整实体名称、类型、重要性权重
  • 删除冗余节点:去除无意义或错误的实体
  • 合并节点:将本质相同的多个节点合并为一个,保持图谱简洁

关系编辑

  • 修改关系标签:纠正不准确的关系描述
  • 删除错误关系:去除 AI 误判的关联
  • 添加遗漏关系:补充专家知识中的重要关联

撤销与重做

编辑过程中支持撤销和重做,方便尝试不同的组织方式。

图谱的可视化展示

知识图谱支持多种可视化布局,适用于不同的分析视角:

  • 力导向图:节点根据关联紧密程度自然聚拢,适合全局概览。关联密集的区域一目了然,便于发现核心知识簇。
  • 思维导图:以选定节点为根向右展开,适合沿着某个概念进行深度探索,查看其所有直接和间接关联。
  • 层次图:从上向下展示层级结构,适合呈现分类体系和从属关系。

此外,可以通过重要性过滤来隐藏次要节点,聚焦核心知识。

挂载到智能体作为 RAG 知识库

知识图谱创建后,可以挂载到智能体,作为 RAG 检索的增强数据源。当用户向智能体提问时:

  1. 系统同时执行向量检索和知识图谱检索
  2. 图谱返回的内容不仅包含匹配的节点,还包含其关联的邻居节点
  3. 大模型获得的不再是孤立的文本块,而是一个带有关系网络的知识片段

这种机制特别适合回答"总结全文要点"、"[实体A] 和 [实体B] 之间有什么关系"这类需要跨越多个段落进行综合判断的问题。在多跳推理场景中,知识图谱可以显著减少大模型的"幻觉"现象。

共享知识图谱

知识图谱可以对外共享,生成只读链接。共享后的图谱保留了当前的布局状态和可见范围,外部用户无需登录平台即可浏览。

共享知识图谱的典型用途包括:

  • 将某个领域的知识结构分享给团队或客户
  • 作为教学材料,可视化展示复杂概念体系
  • 嵌入外部页面,提供交互式知识浏览体验

注意事项

  • 知识图谱的抽取质量高度依赖源文档的结构化程度。逻辑清晰、层级分明的文档通常能获得更好的效果。
  • 对于专业领域,强烈建议使用专家定义的数据模型,这将大幅提升抽取质量并减少后期编辑工作量。
  • 图谱编辑会直接影响知识库数据,合并节点和删除关系时请确认该操作不会导致信息丢失。

Last updated: