
- 系列:AI 论文盘点 / 技术趋势
- 日期:2026-06-23
- 适合读者:研究生、科研读者、LLM 应用工程师、知识库与搜索系统开发者
- 检索范围:重点覆盖 2025-06 至 2026-06 公开论文与项目资料;为保持脉络,保留 2020-2024 的必要基础工作。
摘要
过去一年,RAG(Retrieval-Augmented Generation)的研究重点正在从“把相关文档塞进上下文”转向“构建可诊断、可组合、能推理的知识系统”。早期 RAG 关心检索器和生成器如何联合工作;2024 年之后,GraphRAG、LightRAG、RAPTOR、Self-RAG、CRAG 等工作把问题拆成了结构化索引、查询改写、递归摘要、自我反思与错误修正。到 2025-2026 年,论文重心继续外扩:表格和多源文档的结构化检索、SQL 与工具调用式检索、面向复杂任务的推理式搜索、细粒度评测,以及在长上下文模型时代重新定义“什么时候需要检索”。
本文不做榜单式 SOTA 罗列,而是按路线拆解 RAG 的研究脉络:检索前处理、索引组织、迭代推理、生成后校验、评测与安全。工程上的核心启发是:RAG 已经不是一个向量数据库加提示词模板,而是一套“查询规划 + 证据管理 + 上下文预算 + 结果归因 + 失败诊断”的系统工程。
目录
- 研究背景:RAG 为什么还没有被长上下文替代
- 近一年路线图:五条主线
- 代表论文分组解读
- 方法对比表
- 关键技术趋势
- 工程落地启发
- 局限与争议
- 接下来值得关注的问题
- 参考资料
研究背景:RAG 为什么还没有被长上下文替代
RAG 的经典定义来自 2020 年 Lewis 等人的论文:模型在生成答案前检索外部知识,以减少纯参数记忆带来的过时和幻觉问题。今天的大模型上下文窗口已经明显变长,但 RAG 没有消失,原因主要有三点。
第一,长上下文解决的是“能放进去”,不等于“能用好”。研究和工程实践都反复显示,模型在长文档中的定位、跨段证据聚合、冲突证据处理上仍会出错。RAG 通过检索、重排、摘要、引用和校验,把原本隐式的注意力分配变成显式管线。
第二,企业知识库不是一篇长文档,而是持续变化的异构系统:PDF、网页、表格、数据库、代码仓库、工单、邮件、API 文档同时存在。直接拼上下文既昂贵,也难以保证权限、版本和可追溯性。
第三,可靠 AI 应用需要诊断面。用户问错、检索召回错、切块错、重排错、生成器误读证据,都会造成错误答案。没有 RAG 管线,就很难定位失败发生在哪一层。
因此,近一年的 RAG 研究不是被长上下文吞并,而是转向与长上下文、工具调用、知识图谱和评测框架协同。
近一年路线图:五条主线

1. 从向量召回到查询规划
传统 RAG 把用户问题编码后做向量相似度检索。新工作更关心“检索前应该问什么”。RAG-Fusion 使用多查询和倒排融合缓解单一查询表达不足;Self-RAG 让模型学习何时检索、何时批判生成内容;CRAG 引入检索评估器,在检索质量不够时触发纠错和补充搜索。到 2025 年之后,ReSearch 一类工作把搜索过程进一步变成可学习的推理循环:模型不只拿文档,而是围绕中间结论继续生成搜索请求。
工程启发是:复杂业务问题不要只做一次 embedding search。至少需要查询改写、子问题拆解、召回融合和失败回退策略。
2. 从平铺切块到层级与图结构索引
RAPTOR 将文档组织成树形摘要结构,使系统能在不同粒度上检索;GraphRAG 把文档中的实体、关系和社区摘要组织成图,强调全局问题的回答;LightRAG 则试图用更轻量的图结构和双层检索降低 GraphRAG 的成本。HippoRAG 借鉴海马体记忆机制,把开放知识图谱与个性化 PageRank 风格检索结合,用于多跳问题。
这条线的共同点是反对“固定 chunk 是唯一索引单元”。当问题需要跨文档聚合、比较和归纳时,文档片段本身不够,系统需要中间知识层:实体、关系、摘要节点、主题社区或时间线。
3. 从文本 RAG 到结构化数据 RAG
2025-2026 年值得关注的增量之一,是表格、数据库和结构化文档。2024 年的 TableRAG 讨论百万 token 表格理解中的 schema 与 cell retrieval;2025 年另一篇 TableRAG 进一步面向文本与表格混合文档,使用查询分解、文本检索、SQL 编程与执行、中间答案组合来处理异构文档推理。这里不宜只把表格转成 Markdown chunk,因为表格问题往往需要过滤、聚合、排序和连接操作。
工程上,结构化 RAG 应优先保留数据类型和操作语义:日期、金额、枚举、主外键、列描述、聚合规则都应进入检索和生成约束,而不只是作为自然语言片段。
4. 从一次生成到推理式搜索
复杂问题常常不是“找一段证据就回答”,而是需要多步推理:先识别缺口,再查资料,再修正假设。ReSearch 等工作把 search operation 作为 reasoning chain 的一部分,并用强化学习训练模型在推理中决定何时搜索、如何搜索。与普通 agent 不同,RAG 场景中的 agentic 行为应围绕证据链:每一次检索都要说明为什么查、查到什么、是否足以支持下一步。
这也是 RAG 和 Tool Learning 的交叉地带。检索器不再只是工具之一,而成为模型推理过程中的外部记忆和事实检查器。
5. 从整体分数到细粒度诊断
RAG 评测正在从“答案对不对”转向“哪一层错了”。RAGChecker 将 RAG 输出拆成 claim 级别,区分检索器是否找到足够证据、生成器是否忠实使用证据、答案是否完整。CRAG、RAGChecker、TREC RAG Track 等工作也在推动更贴近真实检索和答案生成的评测。
工程启发是:只看最终准确率会掩盖问题。生产系统至少要记录 query、检索候选、重排结果、上下文片段、引用来源、生成答案和用户反馈,才能做可复现诊断。
代表论文分组解读
基础线:RAG、Self-RAG、CRAG
Lewis 等人的 RAG 论文奠定了“参数知识 + 非参数知识”的范式。Self-RAG 的贡献在于把检索和自我批判变成可学习行为,让模型在需要时检索并评估自身输出。CRAG 则更工程化:如果检索结果质量不足,系统应主动纠错,而不是把低质量片段硬塞给生成器。
这类工作的价值不在于某个固定模块,而在于提出了一个原则:RAG 系统必须知道自己什么时候证据不足。
索引线:RAPTOR、GraphRAG、LightRAG、HippoRAG
RAPTOR 的树形摘要适合长文档和层级主题;GraphRAG 强调实体关系和社区摘要,适合“全局概览”“跨文档归因”类问题;LightRAG 试图减少图构建与检索成本;HippoRAG 更偏认知启发和多跳检索。它们说明,RAG 的核心瓶颈往往不是向量库性能,而是知识组织形式是否匹配问题类型。
对工程团队来说,可以按问题类型选索引:FAQ 与事实查找用 dense + sparse 混合检索即可;制度、合同、论文综述可加入层级摘要;跨业务实体、供应链、项目依赖等问题更适合图结构。
长上下文线:LongRAG 与上下文预算
LongRAG 等工作提出一个现实问题:既然模型上下文变长,是否可以少切块、多放上下文?答案不是简单的“是”。更长的上下文降低了切块导致的信息断裂,但增加了成本和注意力噪声。合理策略是把 RAG 看成上下文预算管理:先用检索确定候选,再用长上下文容纳更完整的局部证据,而不是盲目扩大 top-k。
结构化线:TableRAG 与 SQL 化检索
表格 RAG 的难点是答案经常依赖计算,而不只是语义相似。TableRAG 系列工作反映出一个趋势:RAG 正在从“文本搜索增强生成”扩展成“数据访问增强推理”。其中 2025 年 TableRAG 论文页面显示其版本在 2025-09-30 修订,并标注 accepted by EMNLP 2025;具体 benchmark 数字建议读者以论文与仓库为准,本文不转述未经复核的实验数值。
评测线:RAGChecker、TREC RAG Track
RAGChecker 的 claim-level 诊断值得工程系统借鉴:不要只问最终答案是否正确,还要问每个事实断言是否有证据支持。TREC RAG Track 则体现了评测社区对真实检索场景的持续关注。对于企业系统,评测集应包含领域内高频问题、长尾问题、过期文档问题、权限边界问题和冲突证据问题。
方法对比表
| 路线 | 代表工作 | 解决的问题 | 适合场景 | 工程代价 |
|---|---|---|---|---|
| 多查询 / 查询改写 | RAG-Fusion、Self-RAG | 用户问题表达不足、召回不稳 | 开放问答、客服知识库 | 中等,需要重排与去重 |
| 纠错式 RAG | CRAG | 检索结果质量差仍被生成器误用 | 高风险问答、事实核验 | 中等,需要检索质量评估器 |
| 层级摘要 | RAPTOR | 长文档跨层级信息聚合 | 论文、报告、政策文档 | 中高,需要离线摘要构建 |
| 图 RAG | GraphRAG、LightRAG、HippoRAG | 跨实体、跨文档、多跳关系 | 企业知识图谱、综述、调查分析 | 高,需要抽取、消歧、图维护 |
| 长上下文 RAG | LongRAG | chunk 断裂和上下文不足 | 长报告、代码仓库、法律材料 | 中高,推理成本上升 |
| 结构化 RAG | TableRAG | 表格过滤、聚合、SQL 访问 | BI、金融、科研数据问答 | 高,需要 schema 与权限治理 |
| 细粒度评测 | RAGChecker、TREC RAG Track | 无法定位 RAG 失败层 | 生产监控、模型迭代 | 中高,需要日志和标注体系 |
关键技术趋势
第一,RAG 的边界正在扩大。检索对象不再只是文本 chunk,而是实体、关系、表格、SQL 查询结果、网页、工具返回值和历史交互记忆。
第二,索引会越来越任务化。同一批文档可以同时拥有向量索引、关键词索引、层级摘要索引和图索引,运行时按问题选择组合。
第三,评测会从离线准确率走向在线诊断。真正有价值的指标包括:证据召回率、引用忠实度、无答案拒答率、过期知识识别率、权限违规率、延迟和成本。
第四,长上下文不会替代 RAG,而会改变 RAG 的最佳实践。过去工程师需要切得很碎以适配窗口;未来更重要的是“少而准地检索,再给模型完整证据”。
第五,agentic RAG 会成为复杂任务入口,但必须克制。每多一次检索和工具调用,系统就多一个失败点。没有可观测性和预算控制的 agentic RAG,很容易变成慢且不可靠的循环。
工程落地启发
先建立失败分类,再选论文方法。很多团队直接上 GraphRAG,但真实瓶颈可能只是 query rewrite 或 metadata filter 没做好。
混合检索仍然是强基线。dense retrieval 对语义相似友好,BM25 对术语、编号、代码、法律条款更稳。没有强理由时,不要只依赖一种召回。
chunk 策略要和引用策略一起设计。若最终答案需要可点击引用,chunk 不能只为 embedding 效果服务,还要保留章节、页码、表格行列和版本信息。
图 RAG 适合“关系密集型问题”,不适合所有知识库。若文档中的实体关系抽取质量不稳定,图会放大噪声。
表格和数据库场景应尽量走结构化查询。把 CSV 或 SQL 表转成文本再向量化,通常会丢失类型、约束和聚合语义。
评测集要包含“检索不到”的问题。可靠系统不只会回答,还要会拒答、追问和标注证据不足。
生产日志必须能回放。至少保存用户问题、改写后的查询、召回文档 ID、重排分数、进入上下文的片段、模型答案、引用和最终反馈。
局限与争议
RAG 论文的最大争议之一,是实验设置与真实系统差距很大。许多论文在公开 QA 数据集上验证,但企业知识库中的文档版本、权限、噪声 OCR、重复内容和用户模糊问题更复杂。另一个问题是成本:GraphRAG、层级摘要和 agentic RAG 往往需要离线构建、在线多轮调用和额外评测器,未必适合低延迟场景。
此外,RAG 并不能自动解决幻觉。若检索证据错误、过时或被提示注入污染,生成器仍可能给出看似有引用的错误答案。Prompt Injection 与 Agent Security 将是本系列第 5 篇重点讨论的话题。
接下来值得关注的问题
- 长上下文模型下,RAG 的最优粒度会如何变化?
- 图 RAG 的实体抽取、消歧和增量更新能否形成稳定工程范式?
- 评测能否从 answer-level 走向 claim-level、source-level 和 workflow-level?
- Agentic RAG 如何设置调用预算、停止条件和安全边界?
- 多模态 RAG 如何处理图片、表格、视频和版面结构?
- 企业知识库中的权限控制和引用溯源如何与 RAG 管线深度结合?
总结
近一年 RAG 的主线不是“更大的向量库”或“更多 top-k 文档”,而是从单次检索走向证据驱动的推理系统。基础检索仍然重要,但真正的差异开始来自索引结构、查询规划、工具化数据访问、细粒度评测和安全治理。对工程团队而言,最稳妥的路线是:先把混合检索、引用、日志和评测做扎实;再按问题复杂度逐步引入层级摘要、图索引、结构化查询和 agentic loop。RAG 的未来形态,更像一个带记忆、带审计、带预算的研究助理,而不是一个简单的提示词模板。
参考资料
检索日期:2026-06-23。以下链接优先选择论文、官方项目页、官方文档或评测项目页。预印本论文的机构、代码状态和实验数字可能更新,使用前建议再次核对。
- Patrick Lewis et al., “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks”, arXiv, 2020. https://arxiv.org/abs/2005.11401
- Akari Asai et al., “Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection”, arXiv / ICLR 2024. https://arxiv.org/abs/2310.11511
- Yanfei Yu et al., “Generate rather than Retrieve: Large Language Models are Strong Context Generators”, arXiv, 2022. https://arxiv.org/abs/2209.10063
- Shao Zhang et al., “Corrective Retrieval Augmented Generation”, arXiv, 2024. https://arxiv.org/abs/2401.15884
- Parth Sarthi et al., “RAPTOR: Recursive Abstractive Processing for Tree-Organized Retrieval”, arXiv, 2024. https://arxiv.org/abs/2401.18059
- Darren Edge et al., “From Local to Global: A Graph RAG Approach to Query-Focused Summarization”, arXiv, 2024. https://arxiv.org/abs/2404.16130
- Microsoft GraphRAG project documentation / repository. https://github.com/microsoft/graphrag
- Zihan Zhao et al., “LightRAG: Simple and Fast Retrieval-Augmented Generation”, arXiv, 2024. https://arxiv.org/abs/2410.05779
- HKUDS LightRAG repository. https://github.com/HKUDS/LightRAG
- Gabriele Gutierrez et al., “HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models”, arXiv, 2024. https://arxiv.org/abs/2405.14831
- Wei Liu et al., “LongRAG: Enhancing Retrieval-Augmented Generation with Long-context LLMs”, arXiv, 2024. https://arxiv.org/abs/2406.15319
- Yixuan Su et al., “RAG-Fusion: A New Take on Retrieval-Augmented Generation”, project / paper reference. https://github.com/Raudaschl/rag-fusion
- Xiang Chen et al., “RAGChecker: A Fine-grained Framework for Diagnosing Retrieval-Augmented Generation”, arXiv, 2024. https://arxiv.org/abs/2408.08067
- RAGChecker project repository. https://github.com/amazon-science/RAGChecker
- Luyu Gao et al., “Retrieval-Augmented Generation for Large Language Models: A Survey”, arXiv, 2023/2024. https://arxiv.org/abs/2312.10997
- Si-An Chen et al., “TableRAG: Million-Token Table Understanding with Language Models”, arXiv, 2024. https://arxiv.org/abs/2410.04739
- Xiaohan Yu et al., “TableRAG: A Retrieval Augmented Generation Framework for Heterogeneous Document Reasoning”, arXiv, 2025. https://arxiv.org/abs/2506.10380
- Jinheon Baek et al., “Knowledge-Augmented Language Model Prompting for Zero-Shot Knowledge Graph Question Answering”, arXiv, 2023. https://arxiv.org/abs/2306.04136
- Mingyang Chen et al., “ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning”, arXiv, 2025. https://arxiv.org/abs/2503.19470
- TREC RAG Track official page, NIST. https://trec-rag.github.io/
- LangChain RAG tutorial documentation. https://python.langchain.com/docs/tutorials/rag/
- LlamaIndex documentation. https://docs.llamaindex.ai/
- OpenAI File Search tool documentation. https://platform.openai.com/docs/guides/tools-file-search