GraphRAG 是把知识图谱与检索增强生成结合起来的方法。它先从一组文档中提取实体、关系和事件,形成可连接的图,再按图中的社区与层级生成摘要。面对“整个资料库有哪些主要主题、不同组织如何关联”这类跨文档问题时,它比只找若干相似文本块的传统 RAG 更容易看到整体结构。
传统 RAG 容易漏掉怎样的问题
普通 RAG 会把查询转成向量,召回最相近的片段,再交给模型回答。这很适合定位明确事实,例如某份合同的终止日期;但全局问题的证据可能分散在几十份文档里,没有任何单个片段与问题高度相似。只取排名靠前的少量片段,容易把局部高频内容误当成总体结论。
GraphRAG 的典型索引过程更重:
- 将原始文档切分并提取人物、机构、地点、概念及其关系。
- 把实体与关系组成图,通过社区发现识别联系紧密的群组。
- 为不同层级的社区预先生成摘要,保留局部事实与全局主题。
- 查询时选择相关实体、社区或摘要,再汇总成最终回答。
它不是取消向量检索,而是为传统 RAG 的片段召回增加关系和层级视角。
什么时候值得付出建图成本
政策档案、研究资料、客户访谈和调查报告等文档集合,常包含跨文件关系、主题演变与群体模式,适合用 GraphRAG 做全局归纳。若用户只问单个产品参数、精确条款或最新记录,普通关键词与向量检索通常更直接,也更便宜。
图谱质量取决于实体消歧和关系抽取。同名人物没有合并、同一机构被拆成多个节点,或模型臆造了关系,后续社区摘要就会放大错误。索引还需要额外的模型调用、存储和更新流程;文档频繁变化时,重新建图可能成为主要成本。
它也不能替代原文证据
社区摘要是对资料的压缩,不是原始事实本身。可靠系统仍应保留节点到文档片段的出处映射,让用户能回到原文核验;对数字、日期和合规判断,还应优先检索精确片段。
选择 GraphRAG 的标准不是“图谱听起来更高级”,而是问题是否真的需要跨文档关系和全局主题。先用代表性问题比较传统 RAG 与 GraphRAG 的覆盖率、证据可追溯性、索引成本和更新时间,再决定是否引入复杂管线。