传统RAG的架构通常被概括为索引、检索、生成三阶段。资料指出,它存在检索数据质量不足、模型选择不当等缺点,这些缺点在真实业务中会以四种典型瓶颈的形式暴露出来。理解这四种瓶颈,比记住四个范式名词更有助于选型。

瓶颈一:流程刚性——检索与否无法由模型自主决定

传统RAG的流程是固定的:无论问题是否需要外部知识,都会先检索再生成。这带来两个问题:对常识性问题引入无关噪声,对需要多跳推理的问题又只检索一次。

Self-RAG针对的正是这一瓶颈。资料显示,Self-RAG通过反思token实现LLM自主检索决策。也就是说,模型在生成过程中可以判断“是否需要检索”“检索结果是否相关”“生成内容是否被支持”,把检索从固定前置步骤变成可被模型调控的动作。

适用前提:你的团队已经能稳定运行基础RAG,且主要痛点是“检索被滥用或漏用”,而非知识库本身质量差。取舍在于,反思token会引入额外的推理开销和训练/微调成本,如果业务对延迟极度敏感,需要谨慎评估。

瓶颈二:检索容错——检索失败后没有兜底

传统RAG默认检索结果可用。一旦召回文档不相关或知识库覆盖不足,生成阶段只能基于错误上下文作答,幻觉反而被“有据可依”地放大。

CRAG在检索后引入质量评估与网络搜索兜底。资料明确指出,CRAG的核心动作是评估检索结果质量,并在质量不足时转向网络搜索等外部来源。这相当于在检索与生成之间加了一个质量闸门。

适用前提:知识库存在明确覆盖边界,且允许引入外部检索源。取舍在于,网络搜索兜底会带来可控性下降和合规风险,评估器的准确率直接决定系统上限;如果评估器本身不可靠,兜底可能变成新的错误来源。

瓶颈三:全局建模——局部片段拼不出整体答案

传统RAG基于向量相似度召回片段,擅长回答“某一点是什么”,但面对“整体趋势如何”“多个实体之间是什么关系”这类全局性问题时,片段拼接往往丢失结构。

GraphRAG利用知识图谱与社区摘要支持全局理解。资料将其定位为通过图谱结构和社区摘要来支撑全局性问题的范式。它把知识组织从扁平片段升级为实体—关系—社区的多层结构。

适用前提:领域知识具有明确的实体关系结构,且业务问题确实需要全局视角。取舍在于,图谱构建与社区摘要的维护成本显著高于向量索引,知识更新链路更长;如果业务问题大多是局部事实查询,GraphRAG的投入产出比可能不划算。

瓶颈四:复杂推理——单轮检索无法支撑多步任务

当问题需要多轮检索、工具调用和中间决策时,传统RAG的单次检索—生成循环就不够用了。

Agentic RAG将RAG嵌入Agent循环,支持多轮动态检索。资料指出,Agentic RAG让RAG从静态流程走向具有理解、推理、决策能力的形态,并涉及AI Agent的基本构成与多种核心模式。它把检索当作Agent可调用的工具之一,而非固定阶段。

适用前提:任务本身具有多步性,且系统允许Agent自主规划。取舍在于,Agent循环会放大延迟和成本,错误也可能在多轮中累积;可观测性和终止条件的设计比单轮RAG复杂得多。

选型决策框架

把上述对应关系整理成可执行的判断顺序:

  1. 先确认瓶颈是否真实存在。如果基础RAG的召回质量本身不达标,优先做检索优化,而不是直接上进阶范式。
  2. 若痛点是“该检索时不检索、不该检索时乱检索”,评估Self-RAG。
  3. 若痛点是“检索错了没人管”,评估CRAG。
  4. 若痛点是“局部片段答不了全局问题”,评估GraphRAG。
  5. 若痛点是“单轮检索撑不起多步任务”,评估Agentic RAG。

这四种范式并非互斥。资料中提到的RAG四大模式——Naive RAG、Advanced RAG、Modular RAG与Agentic RAG——本身也说明演进是叠加而非替代。工程上更常见的做法是:用CRAG的质量评估思路加固检索层,用Self-RAG的反思机制控制检索触发,在需要全局理解的领域引入GraphRAG,最后用Agentic RAG编排多步流程。

选型的关键不是比较名词优劣,而是先定位当前系统最痛的瓶颈,再选择对应范式,并接受它带来的成本、延迟和复杂度代价。