本文整理并对比了20多种RAG优化方法,包括标准RAG、Gr
AIAI Summary (BLUF)
本文整理并对比了20多种RAG优化方法,包括标准RAG、GraphRAG、Modular RAG、AgenticRAG等,涵盖其核心创新点、优缺点,并展望了多模态融合、动态推理与轻量化部署等未来趋势。
核心洞察
先说结论:RAGRetrieval-Augmented Generation - an AI framework that combines information retrieval with language generation to produce more accurate and contextually relevant responses. 早就不是“检索 + 提示词”那么简单了。下面这 20 多种方案,有一半在做检索源和检索路径的精细化,另一半在把控制权交给模型自己判断。如果你想做技术选型,先看 0 到 3 理解基础,再往后挑适合自己场景的变体。原文最后那段“如何学大模型”的课程推广跟盘点无关,我删掉了。
核心结论
RAG 已从“检索 + 提示词”扩展为 20 多种具体方案;按技术重心看,约一半在把检索源和检索路径精细化(如 GraphRAGRAG方法的高级变体,引入图结构数据,将信息表示为实体和关系的互联网络,以提高检索的完整性和准确性。、Multimodal RAG、HtmlRAG),另一半在把是否检索、何时检索的决策权交给模型(如 Agentic RAG、Self-RAG在 RAG 流程中设置四个自省检查点(是否需要检索、文档相关、答案有据、答案有用),动态调整策略以减少幻觉。、Auto-RAG)。
FastRAG 的官方数据显示,其方案可使处理时间减少约 90%、成本减少约 85%;但预置模式和脚本覆盖有限,遇到未见过的问法容易失效。
标准 RAG 不改模型参数、落地门槛低,但检索结果缺乏噪声过滤;Advanced RAG 通过检索前查询改写/拆解和检索后重排来减少噪声,同时会明显增加耗时。
RETRO 将检索机制放入预训练阶段,可以提高知识密度、减少幻觉,但预训练成本极高;RA-DIT 用双指令调整增强任务适配性,但需要大量训练数据,微调成本高。
Self-RAG、Agentic RAG、Auto-RAG 这类方案让模型自主判断检索需求和深度,能按问题难度调整检索次数,但普遍增加系统复杂度与资源消耗。
方法逐一拆解
0. 标准 RAG
- 做法:查询先转成向量,去文档库捞相关文本块,再把这些文本块拼进提示词,交给大模型做回答。
- 长板:不用改模型参数,落地门槛低,外部知识想用随时接进来。
- 短板:检索结果里的噪声缺乏过滤机制。无关文本一多,模型只能自己在上下文里挑重点,答案质量容易跟着波动。
1. GraphRAG
- 做法:在向量检索之外引入知识图谱。实体之间的关系被建模成图结构,遇到复杂查询时不只做相似度匹配,还能沿着图谱做多跳推理。
- 长板:回答知识密集型问题时更有逻辑,适合医学、法律这类对准确性要求高的问答。
- 短板:图谱构建成本高。实体和关系要靠人工整理或自动抽取,抽错了后面全错,多模态数据想融合进图谱更费劲。
2. Modular RAG
- 做法:把检索、重排、生成、答案整合这些环节拆成独立组件。需要多轮对话就加记忆模块,需要多文档问答就挂摘要模块,按需组装。
- 长板:扩展性最强,不同业务场景能攒出不同管道。
- 短板:组件一多,整体优化就难。每个模块都有各自的误差,排查问题时得从头到尾看一遍。
3. Advanced RAG
- 做法:在标准流程前后各加一道工序。检索前先做查询改写或拆解,让问题更好匹配文档库;检索后再做一趟重排,把真正有用的片段顶到前面。
- 长板:能明显减少上游噪声传给大模型,回答质量更稳。
- 短板:查询改写和重排都会增加耗时,对实时性要求高的场景要掂量一下。
4. TRAQ
- 做法:把共形预测和贝叶斯优化塞进 RAG 流程,让模型在回答时不只是给文本,还能给出一套统计上的置信判断。
- 长板:少数能把“可信度”落到实处的 RAG 框架,对开放域问答尤其有用。
- 短板:这套保证依赖检索器和生成模型本身的性能假设。模型太弱,统计框架也救不回来。
5. ColBERT一种神经IR方法,避免池化操作,更有效地保留查询和文档嵌入信号,可以自动识别多句子片段。
- 做法:一种偏检索层的语义模型。它把查询和文档的交互放到排序阶段做,再用近似计算撑起大规模实时查询。
- 长板:检索效率高,百亿级语料也能跑实时召回。
- 短板:预计算开销和存储需求都不小,起步成本比裸的向量检索高。
6. Agentic RAG
- 做法:给 RAG 套上一个 Agent 控制循环。具体什么时候检索、要不要追问、怎么结合多轮对话里的旧信息,全由智能体自己调度。
- 长板:系统自主性强,能应对比较动态的需求。
- 短板:Agent 循环的上下文管理和资源消耗都很重,不能当轻量工具用。
7. Multimodal RAG
- 做法:把图像、音频这类非文本数据也纳入检索和生成,常见做法是用 CLIP、BLIP 这类多模态模型做跨模态编码。
- 长板:能处理图文混合场景,交互丰富度更高。
- 短板:不同模态之间的语义对齐依旧不成熟,计算成本也要翻着跟头涨。
8. HyDEA technique that generates hypothetical answers to improve query matching in retrieval systems.
- 做法:不直接用问题原文做向量检索,而是先让大模型根据问题写一份假设性回答,再用这段假设文本去库里捞真实文档。把“问题不好查”变成“答案好查”。
- 长板:零样本场景下检索命中率提升明显。
- 短板:假设内容一旦编得离谱,整个检索方向就会被带偏,属于成也生成模型、败也生成模型。
9. RARE
- 做法:把复杂问题主动拆成多个子查询,然后一边检索一边迭代。上一轮结果会影响下一轮查询,模仿人做研究时的推理过程。
- 长板:处理多跳推理更可靠,不用指望一次检索就把所有知识凑齐。
- 短板:回答一个问题要跑好几轮检索,延迟增长很直接。
10. RA-DIT
- 做法:把微调和检索增强放在一起做。通过双指令调整,让模型既懂怎么利用检索回来的片段,也懂怎么把输出格式对齐到具体任务上。
- 长板:任务适配性强,做领域定制有优势。
- 短板:需要的训练数据量大,微调成本不是所有团队都愿意承担。
11. DSP
- 做法:把推理过程拆成示范、搜索、预测三个阶段。先让语言模型生成示例或中间推理,再根据这些去检索,最后汇总生成答案。
- 长板:流程可控,不同任务可以灵活调整中间步骤。
- 短板:示例选得好不好对最终效果影响很大,选偏了检索也跟着偏。
12. RETRO
- 做法:不在推理阶段才做检索,而是直接把检索机制写进预训练过程。模型训练时就从外部语料库里取相关片段做参考。
- 长板:生成内容的知识密度更高,幻觉明显减少。
- 短板:预训练成本极高,普通实验室和公司基本跑不动。
13. Self-RAG
- 做法:模型自己判断该不该检索。生成过程中如果觉得知识不够,就触发检索;如果拿到的证据不足,还能自己批判并决定要不要再查一次。
- 长板:检索次数跟着问题难度走,简单问题不折腾,复杂问题查得更深。
- 短板:需要复杂的提示设计来做控制,工程实现比常规 RAG 麻烦不少。
14. KG2RAG
- 做法:把普通文档检索和知识图谱查询融合起来。知识图谱直接充当一个带拓扑结构的检索源,查询时既走文本排序,也走图遍历找实体关系。
- 长板:结构化知识的利用率更高,适合实体关联密集的场景。
- 短板:图谱更新和维护是长期负担,过期图谱会让回答“一本正经地错”。
15. CoRAG
- 做法:关注检索块和块之间的相关性。用蒙特卡洛树搜索去评估“再加入一个块到底有没有帮助”,而不是把相关片段一股脑全塞进去。系统里还配上代理来适配不同查询类型。
- 长板:减少冗余拼接,检索结果的增量信息利用得更充分。
- 短板:系统集成复杂度高,多个代理的协同本身就需要调试。
16. Auto-RAG
- 做法:让大模型通过多轮对话持续优化查询。它自己判断当前信息够不够,不够就继续规划下一轮检索,直到收集齐证据再回答。
- 长板:能根据问题难度自动调整深度,难题多查一遍,简单题少走弯路。
- 短板:多轮对话把整体流程拖长,实现和排查都比单轮复杂。
17. MemoRAG
- 做法:双系统配合。轻量级模型先通读整个文档库,建立一份“全局记忆”,再生成一个粗略草稿来指引检索位置;重量级模型拿到检索结果后负责写最终答案。
- 长板:对弱关联信息更敏感,不会只盯着和查询字面最像的那几段。
- 短板:要维护两套模型,部署和推理链路都更重。
18. HtmlRAG
- 做法:不把网页转成纯文本,而是直接保留 HTML 结构。标题、列表、表格这些语义信息都会留着,再通过清理和修剪技术去掉广告、脚本等噪声。
- 长板:结构信息不丢,生成质量更高,尤其是表格类内容。
- 短板:HTML 的清洗和压缩本身是个麻烦活,处理不好反而带进更多脏数据。
19. FastRAG
- 做法:不什么请求都让模型扛。用文本检索配合知识图谱查询,再预先写清模式和脚本,把大量简单请求在轻量阶段消化掉。
- 长板:官方数据是处理时间减少约 90%,成本减少约 85%。
- 短板:模式和脚本能覆盖的范围有限,碰到没见过的问法就容易露馅。
20. 其他值得知道的方法
- FLARE:先生成一版答案草稿,再根据草稿里的低置信区域触发新一轮检索,动态扩展上下文。
- RePlug:把检索器接到预训练语言模型上,用多任务方式让模型学会调用外部知识。
- Atlas:基于稠密检索的大规模知识增强模型,适合做知识密集型任务。
- FiD:在解码阶段融合多路检索结果,让生成器从不同片段里综合信息,减少单一文档带偏。
- RAGFlow:更偏工程侧的集成方案。自带文档解析模块,处理扫描件、复杂版式的内容时比硬切文本省心不少。
后面看什么
上面这些方法拆开看,其实就两个方向。
第一个方向是把检索源头做得更厚。从纯文本到知识图谱、多模态、HTML 结构,都是为了拿到质量更高的证据。
第二个方向是让流程控制变得更活。查询改写、Agent 判断、自我反思、多轮对话,都是想让系统自己决定什么时候该查、查多少、查到什么程度就停。
下一步的看点多模态数据会继续往 RAG 里挤,检索和模型的配合也会越来越动态。轻量化那边,成本和延迟问题还得有人持续解决。
常见问题(FAQ)
RAG优化方法有哪些?怎么选型?
RAG优化有20多种,如GraphRAG、Modular RAG、Advanced RAG、Agentic RAG等。选型先看0到3理解基础,再按场景挑:复杂推理用GraphRAG,动态需求用Agentic RAG,多模态用Multimodal RAG,低成本可看FastRAG。
GraphRAG和标准RAG有什么区别?
标准RAG只做向量检索,直接拼文本块进提示词,简单但噪声多;GraphRAG额外建知识图谱,支持多跳推理,回答知识密集型问题更有逻辑,但图谱构建成本高、维护难。
Agentic RAG适合什么场景?
Agentic RAG给RAG套上Agent控制循环,能自主判断何时检索、要不要追问,适合需求动态、需要多轮交互的场景。但资源消耗重、上下文管理复杂,不适合轻量任务。
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。



