封面图

  • 系列:AI 论文盘点 / 技术趋势
  • 日期:2026-06-23
  • 适合读者:研究生、科研读者、LLM 应用工程师、知识库与搜索系统开发者
  • 检索范围:重点覆盖 2025-06 至 2026-06 公开论文与项目资料;为保持脉络,保留 2020-2024 的必要基础工作。

摘要

过去一年,RAG(Retrieval-Augmented Generation)的研究重点正在从“把相关文档塞进上下文”转向“构建可诊断、可组合、能推理的知识系统”。早期 RAG 关心检索器和生成器如何联合工作;2024 年之后,GraphRAG、LightRAG、RAPTOR、Self-RAG、CRAG 等工作把问题拆成了结构化索引、查询改写、递归摘要、自我反思与错误修正。到 2025-2026 年,论文重心继续外扩:表格和多源文档的结构化检索、SQL 与工具调用式检索、面向复杂任务的推理式搜索、细粒度评测,以及在长上下文模型时代重新定义“什么时候需要检索”。

本文不做榜单式 SOTA 罗列,而是按路线拆解 RAG 的研究脉络:检索前处理、索引组织、迭代推理、生成后校验、评测与安全。工程上的核心启发是:RAG 已经不是一个向量数据库加提示词模板,而是一套“查询规划 + 证据管理 + 上下文预算 + 结果归因 + 失败诊断”的系统工程。

目录

  1. 研究背景:RAG 为什么还没有被长上下文替代
  2. 近一年路线图:五条主线
  3. 代表论文分组解读
  4. 方法对比表
  5. 关键技术趋势
  6. 工程落地启发
  7. 局限与争议
  8. 接下来值得关注的问题
  9. 参考资料

研究背景:RAG 为什么还没有被长上下文替代

RAG 的经典定义来自 2020 年 Lewis 等人的论文:模型在生成答案前检索外部知识,以减少纯参数记忆带来的过时和幻觉问题。今天的大模型上下文窗口已经明显变长,但 RAG 没有消失,原因主要有三点。

第一,长上下文解决的是“能放进去”,不等于“能用好”。研究和工程实践都反复显示,模型在长文档中的定位、跨段证据聚合、冲突证据处理上仍会出错。RAG 通过检索、重排、摘要、引用和校验,把原本隐式的注意力分配变成显式管线。

第二,企业知识库不是一篇长文档,而是持续变化的异构系统:PDF、网页、表格、数据库、代码仓库、工单、邮件、API 文档同时存在。直接拼上下文既昂贵,也难以保证权限、版本和可追溯性。

第三,可靠 AI 应用需要诊断面。用户问错、检索召回错、切块错、重排错、生成器误读证据,都会造成错误答案。没有 RAG 管线,就很难定位失败发生在哪一层。

因此,近一年的 RAG 研究不是被长上下文吞并,而是转向与长上下文、工具调用、知识图谱和评测框架协同。

近一年路线图:五条主线

RAG 路线图

1. 从向量召回到查询规划

传统 RAG 把用户问题编码后做向量相似度检索。新工作更关心“检索前应该问什么”。RAG-Fusion 使用多查询和倒排融合缓解单一查询表达不足;Self-RAG 让模型学习何时检索、何时批判生成内容;CRAG 引入检索评估器,在检索质量不够时触发纠错和补充搜索。到 2025 年之后,ReSearch 一类工作把搜索过程进一步变成可学习的推理循环:模型不只拿文档,而是围绕中间结论继续生成搜索请求。

工程启发是:复杂业务问题不要只做一次 embedding search。至少需要查询改写、子问题拆解、召回融合和失败回退策略。

2. 从平铺切块到层级与图结构索引

RAPTOR 将文档组织成树形摘要结构,使系统能在不同粒度上检索;GraphRAG 把文档中的实体、关系和社区摘要组织成图,强调全局问题的回答;LightRAG 则试图用更轻量的图结构和双层检索降低 GraphRAG 的成本。HippoRAG 借鉴海马体记忆机制,把开放知识图谱与个性化 PageRank 风格检索结合,用于多跳问题。

这条线的共同点是反对“固定 chunk 是唯一索引单元”。当问题需要跨文档聚合、比较和归纳时,文档片段本身不够,系统需要中间知识层:实体、关系、摘要节点、主题社区或时间线。

3. 从文本 RAG 到结构化数据 RAG

2025-2026 年值得关注的增量之一,是表格、数据库和结构化文档。2024 年的 TableRAG 讨论百万 token 表格理解中的 schema 与 cell retrieval;2025 年另一篇 TableRAG 进一步面向文本与表格混合文档,使用查询分解、文本检索、SQL 编程与执行、中间答案组合来处理异构文档推理。这里不宜只把表格转成 Markdown chunk,因为表格问题往往需要过滤、聚合、排序和连接操作。

工程上,结构化 RAG 应优先保留数据类型和操作语义:日期、金额、枚举、主外键、列描述、聚合规则都应进入检索和生成约束,而不只是作为自然语言片段。

4. 从一次生成到推理式搜索

复杂问题常常不是“找一段证据就回答”,而是需要多步推理:先识别缺口,再查资料,再修正假设。ReSearch 等工作把 search operation 作为 reasoning chain 的一部分,并用强化学习训练模型在推理中决定何时搜索、如何搜索。与普通 agent 不同,RAG 场景中的 agentic 行为应围绕证据链:每一次检索都要说明为什么查、查到什么、是否足以支持下一步。

这也是 RAG 和 Tool Learning 的交叉地带。检索器不再只是工具之一,而成为模型推理过程中的外部记忆和事实检查器。

5. 从整体分数到细粒度诊断

RAG 评测正在从“答案对不对”转向“哪一层错了”。RAGChecker 将 RAG 输出拆成 claim 级别,区分检索器是否找到足够证据、生成器是否忠实使用证据、答案是否完整。CRAG、RAGChecker、TREC RAG Track 等工作也在推动更贴近真实检索和答案生成的评测。

工程启发是:只看最终准确率会掩盖问题。生产系统至少要记录 query、检索候选、重排结果、上下文片段、引用来源、生成答案和用户反馈,才能做可复现诊断。

代表论文分组解读

基础线:RAG、Self-RAG、CRAG

Lewis 等人的 RAG 论文奠定了“参数知识 + 非参数知识”的范式。Self-RAG 的贡献在于把检索和自我批判变成可学习行为,让模型在需要时检索并评估自身输出。CRAG 则更工程化:如果检索结果质量不足,系统应主动纠错,而不是把低质量片段硬塞给生成器。

这类工作的价值不在于某个固定模块,而在于提出了一个原则:RAG 系统必须知道自己什么时候证据不足。

索引线:RAPTOR、GraphRAG、LightRAG、HippoRAG

RAPTOR 的树形摘要适合长文档和层级主题;GraphRAG 强调实体关系和社区摘要,适合“全局概览”“跨文档归因”类问题;LightRAG 试图减少图构建与检索成本;HippoRAG 更偏认知启发和多跳检索。它们说明,RAG 的核心瓶颈往往不是向量库性能,而是知识组织形式是否匹配问题类型。

对工程团队来说,可以按问题类型选索引:FAQ 与事实查找用 dense + sparse 混合检索即可;制度、合同、论文综述可加入层级摘要;跨业务实体、供应链、项目依赖等问题更适合图结构。

长上下文线:LongRAG 与上下文预算

LongRAG 等工作提出一个现实问题:既然模型上下文变长,是否可以少切块、多放上下文?答案不是简单的“是”。更长的上下文降低了切块导致的信息断裂,但增加了成本和注意力噪声。合理策略是把 RAG 看成上下文预算管理:先用检索确定候选,再用长上下文容纳更完整的局部证据,而不是盲目扩大 top-k。

结构化线:TableRAG 与 SQL 化检索

表格 RAG 的难点是答案经常依赖计算,而不只是语义相似。TableRAG 系列工作反映出一个趋势:RAG 正在从“文本搜索增强生成”扩展成“数据访问增强推理”。其中 2025 年 TableRAG 论文页面显示其版本在 2025-09-30 修订,并标注 accepted by EMNLP 2025;具体 benchmark 数字建议读者以论文与仓库为准,本文不转述未经复核的实验数值。

评测线:RAGChecker、TREC RAG Track

RAGChecker 的 claim-level 诊断值得工程系统借鉴:不要只问最终答案是否正确,还要问每个事实断言是否有证据支持。TREC RAG Track 则体现了评测社区对真实检索场景的持续关注。对于企业系统,评测集应包含领域内高频问题、长尾问题、过期文档问题、权限边界问题和冲突证据问题。

方法对比表

路线 代表工作 解决的问题 适合场景 工程代价
多查询 / 查询改写 RAG-Fusion、Self-RAG 用户问题表达不足、召回不稳 开放问答、客服知识库 中等,需要重排与去重
纠错式 RAG CRAG 检索结果质量差仍被生成器误用 高风险问答、事实核验 中等,需要检索质量评估器
层级摘要 RAPTOR 长文档跨层级信息聚合 论文、报告、政策文档 中高,需要离线摘要构建
图 RAG GraphRAG、LightRAG、HippoRAG 跨实体、跨文档、多跳关系 企业知识图谱、综述、调查分析 高,需要抽取、消歧、图维护
长上下文 RAG LongRAG chunk 断裂和上下文不足 长报告、代码仓库、法律材料 中高,推理成本上升
结构化 RAG TableRAG 表格过滤、聚合、SQL 访问 BI、金融、科研数据问答 高,需要 schema 与权限治理
细粒度评测 RAGChecker、TREC RAG Track 无法定位 RAG 失败层 生产监控、模型迭代 中高,需要日志和标注体系

关键技术趋势

第一,RAG 的边界正在扩大。检索对象不再只是文本 chunk,而是实体、关系、表格、SQL 查询结果、网页、工具返回值和历史交互记忆。

第二,索引会越来越任务化。同一批文档可以同时拥有向量索引、关键词索引、层级摘要索引和图索引,运行时按问题选择组合。

第三,评测会从离线准确率走向在线诊断。真正有价值的指标包括:证据召回率、引用忠实度、无答案拒答率、过期知识识别率、权限违规率、延迟和成本。

第四,长上下文不会替代 RAG,而会改变 RAG 的最佳实践。过去工程师需要切得很碎以适配窗口;未来更重要的是“少而准地检索,再给模型完整证据”。

第五,agentic RAG 会成为复杂任务入口,但必须克制。每多一次检索和工具调用,系统就多一个失败点。没有可观测性和预算控制的 agentic RAG,很容易变成慢且不可靠的循环。

工程落地启发

  1. 先建立失败分类,再选论文方法。很多团队直接上 GraphRAG,但真实瓶颈可能只是 query rewrite 或 metadata filter 没做好。

  2. 混合检索仍然是强基线。dense retrieval 对语义相似友好,BM25 对术语、编号、代码、法律条款更稳。没有强理由时,不要只依赖一种召回。

  3. chunk 策略要和引用策略一起设计。若最终答案需要可点击引用,chunk 不能只为 embedding 效果服务,还要保留章节、页码、表格行列和版本信息。

  4. 图 RAG 适合“关系密集型问题”,不适合所有知识库。若文档中的实体关系抽取质量不稳定,图会放大噪声。

  5. 表格和数据库场景应尽量走结构化查询。把 CSV 或 SQL 表转成文本再向量化,通常会丢失类型、约束和聚合语义。

  6. 评测集要包含“检索不到”的问题。可靠系统不只会回答,还要会拒答、追问和标注证据不足。

  7. 生产日志必须能回放。至少保存用户问题、改写后的查询、召回文档 ID、重排分数、进入上下文的片段、模型答案、引用和最终反馈。

局限与争议

RAG 论文的最大争议之一,是实验设置与真实系统差距很大。许多论文在公开 QA 数据集上验证,但企业知识库中的文档版本、权限、噪声 OCR、重复内容和用户模糊问题更复杂。另一个问题是成本:GraphRAG、层级摘要和 agentic RAG 往往需要离线构建、在线多轮调用和额外评测器,未必适合低延迟场景。

此外,RAG 并不能自动解决幻觉。若检索证据错误、过时或被提示注入污染,生成器仍可能给出看似有引用的错误答案。Prompt Injection 与 Agent Security 将是本系列第 5 篇重点讨论的话题。

接下来值得关注的问题

  1. 长上下文模型下,RAG 的最优粒度会如何变化?
  2. 图 RAG 的实体抽取、消歧和增量更新能否形成稳定工程范式?
  3. 评测能否从 answer-level 走向 claim-level、source-level 和 workflow-level?
  4. Agentic RAG 如何设置调用预算、停止条件和安全边界?
  5. 多模态 RAG 如何处理图片、表格、视频和版面结构?
  6. 企业知识库中的权限控制和引用溯源如何与 RAG 管线深度结合?

总结

近一年 RAG 的主线不是“更大的向量库”或“更多 top-k 文档”,而是从单次检索走向证据驱动的推理系统。基础检索仍然重要,但真正的差异开始来自索引结构、查询规划、工具化数据访问、细粒度评测和安全治理。对工程团队而言,最稳妥的路线是:先把混合检索、引用、日志和评测做扎实;再按问题复杂度逐步引入层级摘要、图索引、结构化查询和 agentic loop。RAG 的未来形态,更像一个带记忆、带审计、带预算的研究助理,而不是一个简单的提示词模板。

参考资料

检索日期:2026-06-23。以下链接优先选择论文、官方项目页、官方文档或评测项目页。预印本论文的机构、代码状态和实验数字可能更新,使用前建议再次核对。

  1. Patrick Lewis et al., “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks”, arXiv, 2020. https://arxiv.org/abs/2005.11401
  2. Akari Asai et al., “Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection”, arXiv / ICLR 2024. https://arxiv.org/abs/2310.11511
  3. Yanfei Yu et al., “Generate rather than Retrieve: Large Language Models are Strong Context Generators”, arXiv, 2022. https://arxiv.org/abs/2209.10063
  4. Shao Zhang et al., “Corrective Retrieval Augmented Generation”, arXiv, 2024. https://arxiv.org/abs/2401.15884
  5. Parth Sarthi et al., “RAPTOR: Recursive Abstractive Processing for Tree-Organized Retrieval”, arXiv, 2024. https://arxiv.org/abs/2401.18059
  6. Darren Edge et al., “From Local to Global: A Graph RAG Approach to Query-Focused Summarization”, arXiv, 2024. https://arxiv.org/abs/2404.16130
  7. Microsoft GraphRAG project documentation / repository. https://github.com/microsoft/graphrag
  8. Zihan Zhao et al., “LightRAG: Simple and Fast Retrieval-Augmented Generation”, arXiv, 2024. https://arxiv.org/abs/2410.05779
  9. HKUDS LightRAG repository. https://github.com/HKUDS/LightRAG
  10. Gabriele Gutierrez et al., “HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models”, arXiv, 2024. https://arxiv.org/abs/2405.14831
  11. Wei Liu et al., “LongRAG: Enhancing Retrieval-Augmented Generation with Long-context LLMs”, arXiv, 2024. https://arxiv.org/abs/2406.15319
  12. Yixuan Su et al., “RAG-Fusion: A New Take on Retrieval-Augmented Generation”, project / paper reference. https://github.com/Raudaschl/rag-fusion
  13. Xiang Chen et al., “RAGChecker: A Fine-grained Framework for Diagnosing Retrieval-Augmented Generation”, arXiv, 2024. https://arxiv.org/abs/2408.08067
  14. RAGChecker project repository. https://github.com/amazon-science/RAGChecker
  15. Luyu Gao et al., “Retrieval-Augmented Generation for Large Language Models: A Survey”, arXiv, 2023/2024. https://arxiv.org/abs/2312.10997
  16. Si-An Chen et al., “TableRAG: Million-Token Table Understanding with Language Models”, arXiv, 2024. https://arxiv.org/abs/2410.04739
  17. Xiaohan Yu et al., “TableRAG: A Retrieval Augmented Generation Framework for Heterogeneous Document Reasoning”, arXiv, 2025. https://arxiv.org/abs/2506.10380
  18. Jinheon Baek et al., “Knowledge-Augmented Language Model Prompting for Zero-Shot Knowledge Graph Question Answering”, arXiv, 2023. https://arxiv.org/abs/2306.04136
  19. Mingyang Chen et al., “ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning”, arXiv, 2025. https://arxiv.org/abs/2503.19470
  20. TREC RAG Track official page, NIST. https://trec-rag.github.io/
  21. LangChain RAG tutorial documentation. https://python.langchain.com/docs/tutorials/rag/
  22. LlamaIndex documentation. https://docs.llamaindex.ai/
  23. OpenAI File Search tool documentation. https://platform.openai.com/docs/guides/tools-file-search