GraphRAG(Graph-based Retrieval-Augmented Generation,基于图的检索增强生成)是微软研究院在2024年提出、2025-2026年快速成熟的新一代RAG技术,核心思想是在传统向量检索基础上引入知识图谱,将文档中的实体、关系、事件提取为结构化的图结构,在图上进行检索和多跳推理,显著提升复杂查询的回答质量,也为GEO带来了基于实体和关系优化的全新范式。
核心概念
传统RAG将文档切分为文本块(chunks),通过向量相似度进行检索,本质上是"词袋模型"的神经网络升级版,无法捕捉文档中实体之间的复杂关系和全局结构。当用户的问题需要跨多个文档块进行多跳推理时(如"A产品的竞争对手有哪些,它们的定价策略有什么差异"),传统向量检索往往只能召回局部相关文本块,无法生成完整准确的答案。
GraphRAG的解决思路是:首先使用大模型从所有文档中提取实体(人、组织、产品、概念等)、关系(实体之间的关联)和声明(关于实体的事实陈述),构建成一个知识图谱;然后在检索时,不仅进行向量相似度匹配,还利用知识图谱进行图遍历和社区发现,找到与查询相关的实体子图和社区摘要,为生成阶段提供更全面、更结构化的上下文。
这一技术对GEO的启示是革命性的:AI搜索引擎正在从"匹配页面"转向"理解实体和关系",品牌GEO不能仅优化文本内容,还需要优化品牌实体在AI知识图谱中的节点属性和关系连接。
主要特点
- 实体中心检索:检索的基本单元从文本块升级为实体和关系,品牌作为核心实体需要被准确识别和丰富标注
- 多跳推理能力:通过知识图谱的边遍历,可以实现"产品→所属公司→竞争对手→竞争对手产品"这类跨实体的多跳推理
- 全局上下文理解:通过社区检测算法(如Leiden算法)将知识图谱划分为主题社区,生成社区摘要,为全局性问题(如"这个行业的主要玩家有哪些")提供答案
- 关系可解释性:图谱中的每一条边都代表一个明确的关系和来源出处,推理过程可追溯、可解释
- 增量更新机制:新增内容可以增量式地提取实体和关系,更新现有知识图谱,无需重新处理全部文档
2025-2026年,除了微软的GraphRAG,学术界和工业界还涌现出VDGR-RAG(向量检索+目录驱动推理+图遍历+迭代反思的统一框架)、TopoRAG(拓扑感知的近似最近邻图检索)等多种图增强RAG方案,图检索正在成为RAG的标配组件。
工作原理
GraphRAG的完整工作流分为索引构建和查询推理两个阶段:
索引构建阶段
- 文档分块与实体抽取:将源文档切分为适当大小的文本块,使用LLM从每个块中提取实体(名称、类型、描述)和关系(源实体、目标实体、关系类型、描述)
- 实体消歧与合并:将不同文本块中指向同一现实对象的实体进行合并,建立统一的实体节点,解决"同名不同人""同人不同名"的歧义问题
- 图谱构建:以实体为节点、关系为边,构建知识图谱,每条边附带来源文本引用
- 社区检测:使用社区发现算法将图谱划分为若干主题社区,每个社区内的实体连接紧密
- 社区摘要生成:为每个社区生成多层次的摘要(局部摘要、全局摘要),概括社区内的核心实体和关系
查询推理阶段
- 查询实体链接:识别用户查询中的核心实体,将其链接到知识图谱中的对应节点
- 图遍历扩展:从查询实体出发,按照关系边进行广度或深度优先遍历,收集相关的实体子图
- 社区匹配:找到与查询主题最相关的社区,使用预先生成的社区摘要作为全局上下文
- 上下文组装:将向量检索得到的相关文本块、图遍历得到的实体关系、社区摘要进行整合,形成结构化的上下文
- 答案生成:LLM基于结构化上下文生成最终答案,并可以引用具体的实体关系和来源
GEO优化方法
实体优化
品牌作为核心实体,需要确保:
- 实体名称统一:在所有渠道使用一致的品牌全称、简称、英文名,避免实体分裂
- 实体类型明确:明确标注品牌的类型(公司/产品/服务/技术)、所属行业、总部地点等基础属性
- 实体描述清晰:提供一段准确、简洁、权威的品牌描述,包含核心定位、成立时间、核心产品等关键信息
- 实体消歧:在内容中明确区分本品牌与同名或相似名称的其他实体,避免被错误合并
关系优化
主动声明品牌与其他实体的关系:
- 产品关系:明确品牌与旗下产品的关系("XX公司推出了YY产品")
- 竞争关系:客观提及主要竞争对手,反而有助于在对比类查询中被召回
- 合作关系:声明合作伙伴、客户、投资方等关系,拓展图谱中的连接
- 概念关系:将品牌与核心技术概念、行业术语建立关联("XX是GEO领域的领先服务商")
内容组织
- 每个段落聚焦单一实体或关系,避免多个主题混杂
- 在内容开头明确定义实体和核心关系,降低LLM抽取难度
- 使用规范的表述模式声明关系(如"A是B的...""A推出了B""A与B合作..."),便于关系抽取
- 提供结构化数据(JSON-LD)辅助实体识别,特别是Organization、Product、Person等Schema类型
应用场景
场景一:品牌知识图谱建设
企业可以主动构建品牌知识图谱,将企业信息、产品矩阵、技术能力、客户案例、合作伙伴等内容组织为结构化的实体-关系网络,通过官网、百科、新闻稿等多渠道发布,帮助AI搜索引擎建立完整准确的品牌知识图谱表示。
场景二:竞争情报GEO
在GraphRAG架构下,当用户询问"XX行业有哪些主要厂商""A产品和B产品哪个好"这类对比问题时,AI会通过图谱遍历找到相关竞品。主动在内容中客观进行竞品对比(而非单纯自夸),反而能提高品牌在对比场景中的出现概率和推荐权重。
场景三:复杂B2B解决方案
B2B解决方案通常涉及多个产品模块、多个应用场景、多个技术组件的组合关系。GraphRAG擅长处理这类复杂关系网络,企业需要将解决方案中的实体关系清晰表达,让AI能够理解"XX方案包含A模块和B模块,适用于C场景,解决D问题"这类组合关系。
发展趋势
随着GraphRAG技术的成熟和普及,2026年GEO正在经历从"页面优化"到"实体优化"的范式转变:
- 知识图谱成为GEO核心资产:品牌知识图谱的完整性、准确性、丰富度将直接影响AI推荐质量
- Schema标记从可选变为必需:标准Schema.org标记是AI抽取实体关系的重要辅助信号
- 第三方图谱数据源重要性提升:Wikidata、百度百科、行业数据库等开放知识图谱是AI构建实体关系的重要来源,品牌需要维护在这些平台的信息准确性
- 多模态图谱扩展:知识图谱正在从纯文本扩展到包含图片、视频、音频节点的多模态图谱,多模态内容的实体标注将成为新的优化点