GraphRAG 是什么?它为什么更擅长回答跨文档的全局问题
GraphRAG 是把知识图谱与检索增强生成结合起来的方法。它先从一组文档中提取实体、关系和事件,形成可连接的图,再按图中的社区与层级生成摘要。面对“整个资料库有哪些主要主题、不同组织如何关联”这类跨文档问题时,它比只找若干相似文本块的传统 RAG 更容易看到整体结构。 传统 RAG 容易漏掉怎样的...
GraphRAG 是把知识图谱与检索增强生成结合起来的方法。它先从一组文档中提取实体、关系和事件,形成可连接的图,再按图中的社区与层级生成摘要。面对“整个资料库有哪些主要主题、不同组织如何关联”这类跨文档问题时,它比只找若干相似文本块的传统 RAG 更容易看到整体结构。 传统 RAG 容易漏掉怎样的...
AI Guardrails 通常译作 AI 护栏,指围绕模型输入、上下文、工具调用和输出建立的约束与检测机制。它不等于一段禁止事项的系统提示词;真正可用的护栏要分层工作,并在被绕过时限制影响。 系统提示词为什么不是安全边界 提示词能告诉模型应当如何行动,却仍和用户输入、网页内容、文件文本处在同一套自...
DPO(Direct Preference Optimization,直接偏好优化)是一种模型对齐方法。训练数据不是单个标准答案,而是同一提示下的一对回答:哪个更符合偏好、哪个相对较差。DPO 直接提高模型生成偏好回答的相对概率,不需要先单独训练奖励模型,再用 PPO 进行强化学习优化。 一条偏好数...
连续批处理(Continuous Batching)是大模型服务端的一种动态调度方式:系统不必等同一批请求全部生成完才换下一批,而是在每个生成步结束后移出已完成请求、补入新请求。它主要提高 GPU 利用率和整体吞吐量,面向的是多人同时调用模型时的服务效率。 静态批处理为何容易空等 传统批处理会先凑齐...
推测解码(Speculative Decoding)是一种大模型推理加速方法:先让更轻、更快的草稿模型连续提出几个候选 Token,再由目标大模型一次并行检查。候选被接受时,目标模型一次前向计算就能推进多个位置;不合格的部分则由目标模型纠正。它优化的是生成等待时间,不是把两个模型的答案简单拼接。 慢...
AI Evals 指的是对大模型或 AI 应用进行系统评测。它不是随便问几个问题看看感觉,而是把真实任务变成测试集、评分标准和回归检查,用来判断模型或应用是否真的可上线。 为什么聊天体验不能代表质量 大模型回答很会“看起来合理”,但线上应用关心的是稳定性:客服是否引用正确政策,知识库是否拒答未知问题...
LoRA 是 Low-Rank Adaptation,中文常叫低秩适配。它是一种参数高效微调方法:不直接改动大模型全部参数,而是在部分层旁边增加较小的可训练矩阵,让模型学会新任务或新风格。 为什么它能省成本 全量微调就像重新训练一整台复杂机器,显存、数据和工程成本都很高。LoRA 更像给机器外挂一组...
向量数据库是专门存储、索引和查询向量数据的数据库。普通数据库擅长按字段精确查询,比如订单号等于多少;向量数据库擅长按相似度查询,比如哪几段文档和这个问题最接近。 为什么 AI 应用需要它 大模型应用经常要处理非结构化内容:文档、网页、客服记录、图片、音频。Embedding 模型会把这些内容转成高维...