RAG 是 Retrieval-Augmented Generation,中文常叫检索增强生成。它的核心不是让模型记住所有资料,而是在回答前先从外部知识库找相关内容,再让大模型基于这些内容生成答案。
它解决的是什么问题
普通大模型只依赖训练时学到的知识和当前输入,遇到公司制度、产品文档、合同条款、最新资料时容易答错。RAG 把“找资料”和“写答案”分开:检索系统负责把相关文档片段找出来,模型负责整理、解释和表达。
RAG 的基本流程
- 把文档切成较小片段,保留标题、来源、权限等元数据。
- 用 Embedding 模型把问题和文档片段转成向量。
- 通过向量数据库或搜索引擎找出最相关的片段。
- 把片段放进提示词,让模型基于证据回答。
- 必要时返回引用来源,方便人工核对。
RAG 不等于不会幻觉
RAG 只能降低幻觉,不会自动消灭幻觉。检索不到、切片太差、权限过滤错误、片段过旧、提示词要求不清,都会让答案偏掉。很多知识库问答失败,并不是模型太差,而是检索和文档治理没有做好。
适合什么场景
RAG 适合企业知识库、客服问答、政策检索、论文资料整理、产品手册助手。它不适合需要模型凭空创造、复杂数学推理或没有可靠资料源的任务。判断一个项目要不要用 RAG,可以问一句:答案是否必须来自一批可追溯的外部资料?如果是,RAG 通常比单纯提示词更稳。