GEOZ

本文整理并对比了20多种RAG优化方法,包括标准RAG、Gr

2026/9/8
本文整理并对比了20多种RAG优化方法,包括标准RAG、Gr

AIAI Summary (BLUF)

本文整理并对比了20多种RAG优化方法,包括标准RAG、GraphRAG、Modular RAG、AgenticRAG等,涵盖其核心创新点、优缺点,并展望了多模态融合、动态推理与轻量化部署等未来趋势。

核心洞察

先说结论:RAG 早就不是“检索 + 提示词”那么简单了。下面这 20 多种方案,有一半在做检索源和检索路径的精细化,另一半在把控制权交给模型自己判断。如果你想做技术选型,先看 0 到 3 理解基础,再往后挑适合自己场景的变体。原文最后那段“如何学大模型”的课程推广跟盘点无关,我删掉了。

核心结论

  1. RAG 已从“检索 + 提示词”扩展为 20 多种具体方案;按技术重心看,约一半在把检索源和检索路径精细化(如 GraphRAG、Multimodal RAG、HtmlRAG),另一半在把是否检索、何时检索的决策权交给模型(如 Agentic RAG、Self-RAG、Auto-RAG)。

  2. FastRAG 的官方数据显示,其方案可使处理时间减少约 90%、成本减少约 85%;但预置模式和脚本覆盖有限,遇到未见过的问法容易失效。

  3. 标准 RAG 不改模型参数、落地门槛低,但检索结果缺乏噪声过滤;Advanced RAG 通过检索前查询改写/拆解和检索后重排来减少噪声,同时会明显增加耗时。

  4. RETRO 将检索机制放入预训练阶段,可以提高知识密度、减少幻觉,但预训练成本极高;RA-DIT 用双指令调整增强任务适配性,但需要大量训练数据,微调成本高。

  5. Self-RAG、Agentic RAG、Auto-RAG 这类方案让模型自主判断检索需求和深度,能按问题难度调整检索次数,但普遍增加系统复杂度与资源消耗。

方法逐一拆解

0. 标准 RAG

  • 做法:查询先转成向量,去文档库捞相关文本块,再把这些文本块拼进提示词,交给大模型做回答。
  • 长板:不用改模型参数,落地门槛低,外部知识想用随时接进来。
  • 短板:检索结果里的噪声缺乏过滤机制。无关文本一多,模型只能自己在上下文里挑重点,答案质量容易跟着波动。

1. GraphRAG

  • 做法:在向量检索之外引入知识图谱。实体之间的关系被建模成图结构,遇到复杂查询时不只做相似度匹配,还能沿着图谱做多跳推理。
  • 长板:回答知识密集型问题时更有逻辑,适合医学、法律这类对准确性要求高的问答。
  • 短板:图谱构建成本高。实体和关系要靠人工整理或自动抽取,抽错了后面全错,多模态数据想融合进图谱更费劲。

2. Modular RAG

  • 做法:把检索、重排、生成、答案整合这些环节拆成独立组件。需要多轮对话就加记忆模块,需要多文档问答就挂摘要模块,按需组装。
  • 长板:扩展性最强,不同业务场景能攒出不同管道。
  • 短板:组件一多,整体优化就难。每个模块都有各自的误差,排查问题时得从头到尾看一遍。

3. Advanced RAG

  • 做法:在标准流程前后各加一道工序。检索前先做查询改写或拆解,让问题更好匹配文档库;检索后再做一趟重排,把真正有用的片段顶到前面。
  • 长板:能明显减少上游噪声传给大模型,回答质量更稳。
  • 短板:查询改写和重排都会增加耗时,对实时性要求高的场景要掂量一下。

4. TRAQ

  • 做法:把共形预测和贝叶斯优化塞进 RAG 流程,让模型在回答时不只是给文本,还能给出一套统计上的置信判断。
  • 长板:少数能把“可信度”落到实处的 RAG 框架,对开放域问答尤其有用。
  • 短板:这套保证依赖检索器和生成模型本身的性能假设。模型太弱,统计框架也救不回来。

5. ColBERT

  • 做法:一种偏检索层的语义模型。它把查询和文档的交互放到排序阶段做,再用近似计算撑起大规模实时查询。
  • 长板:检索效率高,百亿级语料也能跑实时召回。
  • 短板:预计算开销和存储需求都不小,起步成本比裸的向量检索高。

6. Agentic RAG

  • 做法:给 RAG 套上一个 Agent 控制循环。具体什么时候检索、要不要追问、怎么结合多轮对话里的旧信息,全由智能体自己调度。
  • 长板:系统自主性强,能应对比较动态的需求。
  • 短板:Agent 循环的上下文管理和资源消耗都很重,不能当轻量工具用。

7. Multimodal RAG

  • 做法:把图像、音频这类非文本数据也纳入检索和生成,常见做法是用 CLIP、BLIP 这类多模态模型做跨模态编码。
  • 长板:能处理图文混合场景,交互丰富度更高。
  • 短板:不同模态之间的语义对齐依旧不成熟,计算成本也要翻着跟头涨。

8. HyDE

  • 做法:不直接用问题原文做向量检索,而是先让大模型根据问题写一份假设性回答,再用这段假设文本去库里捞真实文档。把“问题不好查”变成“答案好查”。
  • 长板:零样本场景下检索命中率提升明显。
  • 短板:假设内容一旦编得离谱,整个检索方向就会被带偏,属于成也生成模型、败也生成模型。

9. RARE

  • 做法:把复杂问题主动拆成多个子查询,然后一边检索一边迭代。上一轮结果会影响下一轮查询,模仿人做研究时的推理过程。
  • 长板:处理多跳推理更可靠,不用指望一次检索就把所有知识凑齐。
  • 短板:回答一个问题要跑好几轮检索,延迟增长很直接。

10. RA-DIT

  • 做法:把微调和检索增强放在一起做。通过双指令调整,让模型既懂怎么利用检索回来的片段,也懂怎么把输出格式对齐到具体任务上。
  • 长板:任务适配性强,做领域定制有优势。
  • 短板:需要的训练数据量大,微调成本不是所有团队都愿意承担。

11. DSP

  • 做法:把推理过程拆成示范、搜索、预测三个阶段。先让语言模型生成示例或中间推理,再根据这些去检索,最后汇总生成答案。
  • 长板:流程可控,不同任务可以灵活调整中间步骤。
  • 短板:示例选得好不好对最终效果影响很大,选偏了检索也跟着偏。

12. RETRO

  • 做法:不在推理阶段才做检索,而是直接把检索机制写进预训练过程。模型训练时就从外部语料库里取相关片段做参考。
  • 长板:生成内容的知识密度更高,幻觉明显减少。
  • 短板:预训练成本极高,普通实验室和公司基本跑不动。

13. Self-RAG

  • 做法:模型自己判断该不该检索。生成过程中如果觉得知识不够,就触发检索;如果拿到的证据不足,还能自己批判并决定要不要再查一次。
  • 长板:检索次数跟着问题难度走,简单问题不折腾,复杂问题查得更深。
  • 短板:需要复杂的提示设计来做控制,工程实现比常规 RAG 麻烦不少。

14. KG2RAG

  • 做法:把普通文档检索和知识图谱查询融合起来。知识图谱直接充当一个带拓扑结构的检索源,查询时既走文本排序,也走图遍历找实体关系。
  • 长板:结构化知识的利用率更高,适合实体关联密集的场景。
  • 短板:图谱更新和维护是长期负担,过期图谱会让回答“一本正经地错”。

15. CoRAG

  • 做法:关注检索块和块之间的相关性。用蒙特卡洛树搜索去评估“再加入一个块到底有没有帮助”,而不是把相关片段一股脑全塞进去。系统里还配上代理来适配不同查询类型。
  • 长板:减少冗余拼接,检索结果的增量信息利用得更充分。
  • 短板:系统集成复杂度高,多个代理的协同本身就需要调试。

16. Auto-RAG

  • 做法:让大模型通过多轮对话持续优化查询。它自己判断当前信息够不够,不够就继续规划下一轮检索,直到收集齐证据再回答。
  • 长板:能根据问题难度自动调整深度,难题多查一遍,简单题少走弯路。
  • 短板:多轮对话把整体流程拖长,实现和排查都比单轮复杂。

17. MemoRAG

  • 做法:双系统配合。轻量级模型先通读整个文档库,建立一份“全局记忆”,再生成一个粗略草稿来指引检索位置;重量级模型拿到检索结果后负责写最终答案。
  • 长板:对弱关联信息更敏感,不会只盯着和查询字面最像的那几段。
  • 短板:要维护两套模型,部署和推理链路都更重。

18. HtmlRAG

  • 做法:不把网页转成纯文本,而是直接保留 HTML 结构。标题、列表、表格这些语义信息都会留着,再通过清理和修剪技术去掉广告、脚本等噪声。
  • 长板:结构信息不丢,生成质量更高,尤其是表格类内容。
  • 短板:HTML 的清洗和压缩本身是个麻烦活,处理不好反而带进更多脏数据。

19. FastRAG

  • 做法:不什么请求都让模型扛。用文本检索配合知识图谱查询,再预先写清模式和脚本,把大量简单请求在轻量阶段消化掉。
  • 长板:官方数据是处理时间减少约 90%,成本减少约 85%。
  • 短板:模式和脚本能覆盖的范围有限,碰到没见过的问法就容易露馅。

20. 其他值得知道的方法

  • FLARE:先生成一版答案草稿,再根据草稿里的低置信区域触发新一轮检索,动态扩展上下文。
  • RePlug:把检索器接到预训练语言模型上,用多任务方式让模型学会调用外部知识。
  • Atlas:基于稠密检索的大规模知识增强模型,适合做知识密集型任务。
  • FiD:在解码阶段融合多路检索结果,让生成器从不同片段里综合信息,减少单一文档带偏。
  • RAGFlow:更偏工程侧的集成方案。自带文档解析模块,处理扫描件、复杂版式的内容时比硬切文本省心不少。

后面看什么

上面这些方法拆开看,其实就两个方向。

第一个方向是把检索源头做得更厚。从纯文本到知识图谱、多模态、HTML 结构,都是为了拿到质量更高的证据。

第二个方向是让流程控制变得更活。查询改写、Agent 判断、自我反思、多轮对话,都是想让系统自己决定什么时候该查、查多少、查到什么程度就停。

下一步的看点多模态数据会继续往 RAG 里挤,检索和模型的配合也会越来越动态。轻量化那边,成本和延迟问题还得有人持续解决。

常见问题(FAQ)

RAG优化方法有哪些?怎么选型?

RAG优化有20多种,如GraphRAG、Modular RAG、Advanced RAG、Agentic RAG等。选型先看0到3理解基础,再按场景挑:复杂推理用GraphRAG,动态需求用Agentic RAG,多模态用Multimodal RAG,低成本可看FastRAG。

GraphRAG和标准RAG有什么区别?

标准RAG只做向量检索,直接拼文本块进提示词,简单但噪声多;GraphRAG额外建知识图谱,支持多跳推理,回答知识密集型问题更有逻辑,但图谱构建成本高、维护难。

Agentic RAG适合什么场景?

Agentic RAG给RAG套上Agent控制循环,能自主判断何时检索、要不要追问,适合需求动态、需要多轮交互的场景。但资源消耗重、上下文管理复杂,不适合轻量任务。

Roger深圳
本文由 Roger 审核,最后更新于 2026年9月8日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。