封面图

系列:AI 论文精读与复现训练营
日期:2026-08-05
适合读者:已经了解 Transformer、向量检索和基础 RAG 工程流程,想把检索增强从“应用技巧”读成“学习范式”的研究生、科研新人和工程背景读者。

摘要

Retrieval-Augmented Learning 不是简单地“给 LLM 接一个向量库”。从 REALM、RAG、RETRO、Atlas 到 Self-RAG、Adaptive-RAG、GraphRAG、Agentic RAG 和 Memory-Augmented Generation,这条路线的核心问题一直在变化:知识应该存进参数,还是存进外部记忆;检索应该发生在预训练、微调还是推理时;模型应该被动接收 top-k 文档,还是主动判断何时检索、如何改写查询、如何维护长期记忆。本文给出一条论文精读路线,把经典 RAG 与 2025-2026 年的多轮、跨语言、文本表格、多模态、安全和 agentic memory 研究串起来,并给出可复现的小实验设计。

目录

  1. 为什么这个主题重要
  2. 核心阅读方法:把 RAG 拆成学习系统
  3. 代表论文路线图
  4. 关键论文精读
  5. 方法与实验对比表
  6. 复现建议
  7. 常见误区
  8. 适合研究生继续做的选题
  9. 总结
  10. 参考资料

为什么这个主题重要

很多读者第一次接触 RAG,是从“embedding + vector database + top-k chunks + prompt”开始的。这个工程模板有用,但它会遮住更根本的研究问题:LLM 的知识并不只有参数记忆一种形态。外部文档、向量索引、知识图谱、对话历史、用户偏好、实验日志和工具调用轨迹,都可以成为模型推理时可访问的非参数记忆。

2025-2026 年的论文已经不再满足于“RAG 比闭卷模型少幻觉”。研究问题变得更细:长上下文模型出现后,RAG 是否仍有必要;多轮问题不自包含时如何检索;跨语言、文本表格和多模态文档中错误来自检索、推理还是生成;agentic RAG 多次检索、写入记忆和调用工具后,错误会不会沿循环放大。读这个方向,要把 RAG 从“应用组件”读成“学习系统”:何时查、查什么、如何融合、如何更新、如何验证。

核心阅读方法:把 RAG 拆成学习系统

Retrieval-Augmented Learning 路线图

精读这一方向,可以按五个问题做笔记。

检索发生在什么时候。 REALM 把检索放进预训练;RAG 在生成任务中结合 parametric memory 与 dense index;RETRO 在自回归语言建模中用大规模 token 数据库;Atlas 研究 few-shot 知识密集任务中的可更新索引。到 Self-RAG、Adaptive-RAG 和 Agentic RAG,检索变成推理控制问题。

外部记忆是什么。 早期工作多用 Wikipedia 或网页文本;后续系统纳入表格、图像、版面、多轮对话、图结构和长期用户记忆。笔记中要记录 corpus snapshot、chunk 粒度、embedding 模型、索引更新方式和 provenance。

检索结果如何进入模型。 直接拼接 top-k passage、reranker、Fusion-in-Decoder、cross-attention、graph context、memory hierarchy 都是不同假设。这个差异通常比“用了哪个向量库”更重要。

评测是否能定位失败来源。 RAG 错误可能来自检索不到、排序错、上下文太长、生成误读、judge 偏置或数据污染。MIRAGE、MTRAG、XRAG、T^2-RAGBench 和 LaRA 的共同价值,是让失败更可归因。

记忆是否有生命周期。 Memory-augmented models 不只是旧聊天记录向量化。MemGPT 和 MemOS 把记忆管理提升为系统问题,因此要关注写入、遗忘、冲突解决、访问控制和可追踪性。

代表论文路线图

阶段 代表工作 精读抓手
检索增强预训练 REALM, RAG retriever 是否被训练,非参数记忆如何进目标函数
大规模显式记忆 RETRO 数据库规模、chunked cross-attention、参数与外部数据的关系
少样本知识密集学习 Atlas 索引是否可更新,收益来自模型、检索器还是知识覆盖
自适应 RAG Self-RAG, CRAG, Adaptive-RAG 何时检索、如何判定证据质量、如何纠错
结构化和多模态 RAG GRAG, T^2-RAGBench, ACL 2026 survey 图、表格、版面和多模态对象如何融合
RAG vs long context LaRA 什么时候全文上下文更好,什么时候检索更好
agentic memory Generative Agents, MemGPT, MemOS, Agentic RAG SoK 写入、检索、反思、规划和工具调用闭环

关键论文精读

REALM 与 RAG。 REALM 的关键是让检索器在预训练阶段获得学习信号,用 masked language modeling 驱动 latent knowledge retriever。RAG 则把预训练 seq2seq 模型和 Wikipedia dense vector index 结合,提出 sequence-level 和 token-level formulation。读这两篇,要写清楚 retriever、latent documents、generator 和 provenance 的关系。

RETRO 与 Atlas。 RETRO 在自回归语言建模中使用 2 trillion token retrieval database,通过 frozen BERT retriever、encoder 和 chunked cross-attention 将近邻文本用于预测。Atlas 研究 retrieval-augmented model 在少样本知识密集任务中的表现。读这两篇,要区分“架构级 retrieval”和“推理时 prompt RAG”。

Self-RAG / CRAG / Adaptive-RAG。 Self-RAG 通过 reflection tokens 学习何时检索和评价证据;CRAG 增加 retrieval evaluator,在检索质量不足时触发补救;Adaptive-RAG 用问题复杂度选择 no-retrieval、single-step 或 iterative retrieval。共同结论是:检索不是越多越好。

2025-2026 benchmarks。 MTRAG 指向多轮对话中的非自包含问题;MIRAGE 分解检索与生成组件;XRAG 检查跨语言回答语言和推理;T^2-RAGBench 关注文本表格和数值推理;LaRA 比较 long-context LLM 与 RAG。这些 benchmark 适合训练错误归因能力。

Memory-Augmented Models。 Generative Agents 展示 memory stream、reflection 和 planning;MemGPT 将上下文管理类比为操作系统虚拟内存;MemOS 把 memory 提升为一等资源。这里的问题不再只是“检索到什么”,而是“系统应该记住什么、何时忘记、谁能读取、如何追责”。

方法与实验对比表

方法类型 优势 风险 小实验
固定 top-k RAG 简单、可控 噪声污染生成 改 k、chunk、reranker,记录 recall 与 faithfulness
Fusion / cross-attention 细粒度融合证据 成本高,依赖实现 比较 prompt 拼接与融合式 reader
自适应 RAG 支持复杂问题路由 控制器可能误判 构造 simple / multi-hop / unanswerable 问题
Graph / multimodal RAG 适合结构关系和版面 数据构建重 用引用图或财报表格做 hybrid retrieval
Memory-augmented agents 支持长期交互 记忆污染和隐私风险 设计多轮对话,测试写入、召回、冲突和遗忘

复现建议

不建议一开始复现完整 RETRO 或大规模 Atlas。更好的训练路径是做一个小而可诊断的 RAG lab。

  1. 固定语料库:选择 200-1000 篇论文摘要、课程讲义或公开文档,记录版本、清洗脚本和 chunk 策略。
  2. 建立三层指标:retrieval 层看 recall@k、MRR;context 层看有效证据和噪声;generation 层看事实核查、引用准确性和不可回答识别。
  3. 做最小 ablation:比较 BM25、dense embedding、hybrid retrieval、reranker、query rewriting、answer citation,并给失败案例归因。
  4. 加入 memory 变量:把一次性 QA 改成多轮任务,比较窗口历史、summary memory、vector recall memory 和显式 profile memory。
  5. 控制长上下文基线:至少加入“直接放全文或长摘要”的基线,避免夸大检索收益。

常见误区

  1. 把 retrieval recall 当成最终答案质量。检索命中只是必要条件,模型仍可能忽略或误读证据。
  2. 只调 embedding,不看 chunk。边界、标题、表格转写、元数据过滤经常更关键。
  3. 没有不可回答问题。缺少 unanswerable set 会鼓励模型强答。
  4. 把 memory 写入当作无害优化。长期记忆会引入隐私、污染、冲突和陈旧问题。
  5. 用 LLM judge 直接替代证据核查。judge 可辅助筛选,但不能替代 retrieval log、原文证据和可复现实验脚本。

适合研究生继续做的选题

  1. RAG 与 long-context 路由器。 根据问题、文档长度、检索置信度和预算选择全文、检索或混合策略。
  2. 多轮 RAG 查询改写失败诊断。 研究后续轮次如何继承实体、约束和否定信息。
  3. 文本表格混合 RAG。 检查系统是否找到正确表格区域,并能完成数值推理。
  4. 长期记忆冲突解决。 当新旧偏好冲突,系统如何更新、保留版本和解释来源。
  5. RAG 安全与记忆污染。 研究 poisoning、prompt injection 文档、隐私泄露和访问控制。

总结

Retrieval-Augmented Learning 的主线是:把知识从“只能靠参数记住”扩展为“可检索、可更新、可治理、可验证的外部记忆”。早期论文教我们如何把检索接入预训练和生成;最新论文把问题推向多轮、跨语言、多模态、结构化数据、agentic control 和长期记忆治理。读这条路线,关键不是背系统名,而是画出证据流:问题从哪里来,知识从哪里来,检索如何选择,证据如何融合,错误如何定位,记忆如何更新。

参考资料

检索日期:2026-08-05。

  1. Kelvin Guu et al. “REALM: Retrieval-Augmented Language Model Pre-Training.” arXiv, 2020. https://arxiv.org/abs/2002.08909
  2. Patrick Lewis et al. “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks.” NeurIPS 2020 / arXiv. https://arxiv.org/abs/2005.11401
  3. Sebastian Borgeaud et al. “Improving language models by retrieving from trillions of tokens.” arXiv, 2021, revised 2022. https://arxiv.org/abs/2112.04426
  4. Gautier Izacard et al. “Atlas: Few-shot Learning with Retrieval Augmented Language Models.” arXiv, 2022. https://arxiv.org/abs/2208.03299
  5. Joon Sung Park et al. “Generative Agents: Interactive Simulacra of Human Behavior.” arXiv, 2023. https://arxiv.org/abs/2304.03442
  6. Charles Packer et al. “MemGPT: Towards LLMs as Operating Systems.” arXiv, 2023, revised 2024. https://arxiv.org/abs/2310.08560
  7. Akari Asai et al. “Self-RAG: Learning to Retrieve, Generate, and Critique Through Self-Reflection.” ICLR 2024. https://mlanthology.org/iclr/2024/asai2024iclr-selfrag/
  8. Shi-Qi Yan et al. “Corrective Retrieval Augmented Generation.” arXiv, 2024, revised 2024. https://arxiv.org/abs/2401.15884
  9. Soyeong Jeong et al. “Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity.” NAACL 2024 / arXiv. https://arxiv.org/abs/2403.14403
  10. Yuntong Hu et al. “GRAG: Graph Retrieval-Augmented Generation.” arXiv, 2024, revised 2025. https://arxiv.org/abs/2405.16506
  11. Yannis Katsis et al. “MTRAG: A Multi-Turn Conversational Benchmark for Evaluating Retrieval-Augmented Generation Systems.” arXiv, 2025. https://arxiv.org/abs/2501.03468
  12. Kuan Li et al. “LaRA: Benchmarking Retrieval-Augmented Generation and Long-Context LLMs.” arXiv, 2025. https://arxiv.org/abs/2502.09977
  13. Chanhee Park et al. “MIRAGE: A Metric-Intensive Benchmark for Retrieval-Augmented Generation Evaluation.” NAACL Findings 2025 / arXiv. https://arxiv.org/abs/2504.17137
  14. Yaxiong Wu et al. “From Human Memory to AI Memory: A Survey on Memory Mechanisms in the Era of LLMs.” arXiv, 2025. https://arxiv.org/abs/2504.15965
  15. Wei Liu et al. “XRAG: Cross-lingual Retrieval-Augmented Generation.” arXiv, 2025. https://arxiv.org/abs/2505.10089
  16. Zhiyu Li et al. “MemOS: An Operating System for Memory-Augmented Generation (MAG) in Large Language Models.” arXiv, 2025. https://arxiv.org/abs/2505.22101
  17. Jan Strich et al. “T^2-RAGBench: Text-and-Table Benchmark for Evaluating Retrieval-Augmented Generation.” EACL 2026 / arXiv. https://arxiv.org/abs/2506.12071
  18. Saroj Mishra et al. “SoK: Agentic Retrieval-Augmented Generation (RAG): Taxonomy, Architectures, Evaluation, and Research Directions.” arXiv, 2026. https://arxiv.org/abs/2603.07379
  19. Sensen Gao et al. “Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding.” ACL 2026. https://aclanthology.org/2026.acl-long.204/
  20. Balamurugan Palanisamy et al. “Security and Privacy in Retrieval-Augmented Generation.” arXiv, 2026. https://arxiv.org/abs/2606.25533