什么是 GraphRAG?
GraphRAG(Graph Retrieval-Augmented Generation)是一类将实体和关系表示为图谱,并联合检索图谱与文本证据来回答需要关联上下文问题的 RAG 方法。
快速了解
| 全称 | 基于图谱的检索增强生成 |
|---|---|
| 创建时间 | 近年来随着 LLM 架构演进逐渐普及 |
工作原理
GraphRAG 在文档分块和向量检索之外,引入由实体、关系以及社区摘要构成的图谱。典型流程是在入库时抽取实体关系三元组、进行实体消歧和连边、聚合相关节点,并在查询时检索局部图邻域或更高层的摘要。它适合多跳问题、关系探索和语料级综合,但必须与更简单的 RAG 基线比较实体抽取质量、更新成本、图谱检索策略和端到端效果。GraphRAG 本身不能保证回答真实,也不能替代来源引用与答案忠实度校验。
主要特点
- 带有来源片段、置信度和版本的实体与关系候选
- 根据查询和运行负载选择图存储与遍历方式
- 可选的社区摘要必须保留到原始证据的链接
- 在相同访问约束下联合文本、向量和图谱检索
- 只在评测证明有效的多跳和语料综合切片中获得收益
- 相对向量基线额外承担抽取、消歧、刷新、删除和治理成本
常见用途
- 与向量基线对照评测的多跳关联问题
- 保留来源链接、证据不足时可拒答的语料综合
- 关系链可供人工复核而非自动决策的风险调查
- 带来源与人工验证的科研发现辅助
- 具备租户、对象、留存期和删除控制的企业知识检索
示例
Loading code...常见问题
GraphRAG 和 Naive RAG 有什么区别?
切块加向量的基线按词法或 Embedding 相似度检索文本;GraphRAG 还索引实体和关系,可沿关联证据或摘要扩展检索。只有当它在多跳或语料综合等具体问题切片上带来可度量收益时才值得引入,简单事实查询中,抽取误差、更新、权限与运维成本可能超过收益。
构建 GraphRAG 的成本高吗?
它可能高于向量 RAG 成本,因为实体抽取、消歧、图存储、摘要生成、刷新和删除血缘都需要额外工作。实际成本取决于语料规模、模型、批处理、缓存命中率、变更频率和查询流量。采用前应与向量基线比较入库成本、查询延迟、证据覆盖、答案忠实度和维护负担。
什么是 GraphRAG 中的混合检索(Hybrid Search)?
GraphRAG 中的混合检索可并行获取关键词或向量文本候选,以及图邻域、路径或摘要,再校验、去重并引用底层证据。融合前所有检索路径都必须执行租户、对象、用途、新鲜度和留存期控制;图谱生成的摘要只是检索辅助,不是独立证明。
如何评测 GraphRAG 是否值得采用?
使用版本化的向量或混合检索基线,对单跳事实、多跳关系、语料摘要、实体歧义、更新、删除和越权内容等标注问题切片进行比较。分别度量检索召回与精度、引用覆盖、答案忠实度、拒答、抽取与消歧错误、延迟、成本和故障恢复能力。