封面图

系列:AI 论文盘点 / 技术趋势
日期:2026-06-24
适合读者:NLP / LLM 方向研究生、做 RAG 与 Agent 系统的工程师、关注模型服务成本的技术读者
检索日期:2026-06-24

摘要

过去两年,长上下文大模型从 32K、128K 迅速推进到百万 token 量级。问题也随之变得更清楚:上下文窗口标称长度不等于可用长上下文能力。一个模型能接收 1M token,不代表它能稳定找出中间证据、做多跳推理、理解代码仓库、生成万字级高质量输出,也不代表推理成本可接受。近一年论文的主线可以概括为四条:第一,位置编码与训练策略继续解决“短训长测”的外推问题;第二,评测从 Needle-in-a-Haystack 转向更接近真实任务的深层理解、非字面匹配和干扰检索;第三,系统侧围绕 KV cache、稀疏注意力、缓存压缩和检索式解码降低长上下文服务成本;第四,应用侧开始讨论长上下文能否部分替代 RAG、SQL、检索器与写作规划器。

这篇文章的核心判断是:Long Context LLM 正在从“上下文扩容竞赛”进入“有效上下文工程”。下一阶段的价值不在于把所有材料无脑塞进 prompt,而在于把长上下文模型、检索系统、结构化记忆、推理预算和评测协议组合起来。

目录

  1. 研究背景:为什么长上下文不是“大 prompt”
  2. 近一年路线图
  3. 代表论文分组解读
  4. 方法对比表
  5. 关键技术趋势
  6. 工程落地启发
  7. 局限与争议
  8. 接下来值得关注的问题
  9. 总结
  10. 参考资料

研究背景:为什么长上下文不是“大 prompt”

早期长上下文研究常被理解为扩大序列长度:把 Transformer 的注意力矩阵、位置编码、训练长度和显存预算一起推大。但 2023 年的 Lost in the Middle 已经提醒社区:模型对信息位置非常敏感,相关证据在开头或结尾时表现往往更好,落在中部时性能会下降。这个结论后来被大量 needle 类实验、长文档问答和代码仓库任务重复验证。

2024 年以后,商业模型与开源模型的上下文窗口快速增加。Google Gemini 1.5 技术报告把“百万级上下文”带到主流讨论;OpenAI 开发者文档在 2026 年 6 月检索时列出 GPT-5.4 / GPT-5.4 Pro 具备 1.05M context window;Anthropic 文档在 2026 年 6 月检索时列出 Claude Fable 5、Mythos 5 为 1M token,部分 Claude 4 系列也进入 200K 到 1M 的区间;Meta Llama 4 Scout 的官方资料与模型卡讨论 10M token 级别上下文。供应商规格变化很快,具体可用长度、价格、速率限制和模型别名必须以调用当日文档为准。

学术研究的问题也随之转向:如果模型能“看见”一百万 token,它到底能不能“使用”一百万 token?如果可以,成本是多少?如果不可以,瓶颈来自位置编码、训练数据长度分布、注意力稀释、解码阶段 KV cache、还是评测任务本身太简单?

长上下文研究路线图

近一年路线图

路线一:位置编码与训练扩展。 RoPE、ALiBi、YaRN、LongLoRA 等基础工作让模型能从较短训练长度外推到更长推理长度。2025 年的 LongRoPE2 继续沿着这条线走:它提出高频 RoPE 维度训练不足会导致外推 OOD,并用 needle-driven perplexity 的搜索式重缩放与混合上下文训练,试图在扩长上下文的同时保留短上下文能力。

路线二:长上下文评测升级。 LongBench v2、NoLiMa、RULER、LOFT、ICR^2 等工作说明,简单“针藏草堆”已经不够。真正难的是多文档推理、结构化表格、代码仓库理解、长对话历史、非字面匹配检索,以及有强检索器干扰项的 in-context retrieval。

路线三:推理系统与 KV cache。 只要保持自回归解码,长输入和长输出就会把 KV cache 推成服务成本核心。RocketKV、FIER、KV cache clustering、ParisKV 等 2025-2026 年工作从压缩、稀疏读取、聚类、GPU 原生检索和 CPU offload 等方向降低显存和带宽压力。具体速度提升依赖模型、硬件和任务设置,工程选型时不能只看论文摘要中的峰值数字。

路线四:长输出与应用范式。 LongWriter 与 LongWriter-Zero 把问题从“读长”扩展到“写长”。LOFT 与 ICR^2 则把问题推进到“长上下文能否替代检索系统、RAG、SQL-like 查询”。结论更像是互补而非替代:模型能直接处理大上下文,但在干扰强、结构化约束强、更新频繁或需要可审计检索链路的场景,外部检索和结构化工具仍然必要。

代表论文分组解读

1. 位置编码、训练长度与外推

RoFormer / RoPE 是当前许多 LLM 的位置建模基础。它把绝对位置映射成旋转,并在注意力里自然包含相对位置信息,因此具备一定长度外推潜力。但外推并不是免费午餐:训练阶段没有覆盖的频率维度、位置分布和长序列模式,会在推理时表现为困惑度上升、局部记忆尚可但跨段推理失效。

LongRoPE2 的价值在于把“扩上下文”拆成两个目标:目标长度上可用,原始短上下文不退化。它不是简单改变 RoPE base,而是用搜索式重缩放和混合长度训练来平衡。对工程实践的启发是:如果团队要扩展一个已有开源模型,不能只跑 NIAH;还要回测短上下文通用能力、指令遵循、代码和问答,否则可能得到一个“长了但变钝”的模型。

2. 评测:从 literal retrieval 到真实推理

LongBench v2 是 2024 年末到 2025 年长上下文评测的重要节点。它包含 503 个多选问题,覆盖单文档、多文档、长上下文 ICL、长对话、代码仓库和结构化数据等任务,输入长度可到 2M words。论文报告中,专家在 15 分钟限制下准确率约 53.7%,直接回答的最佳模型约 50.1%,带更长推理的 o1-preview 到 57.7%。这些数字的意义不是“哪个模型永久第一”,而是说明长上下文任务已经不只是检索,还需要推理预算。

NoLiMa 针对 NIAH 的弱点:如果问题和 needle 有大量字面重合,模型可能靠关键词定位而非真正理解。NoLiMa 设计低词面重合的 needle,要求模型通过隐含关联找到证据。论文在 2025 年 7 月修订版中报告,13 个声称支持至少 128K 的模型在长上下文下明显退化;例如在 32K 时,多数模型低于短上下文强基线的一半。这里最值得记住的是评测思想:不要只测“字符串定位”,要测“语义定位”。

RULER 则追问“真实可用上下文长度”而非标称长度。它通过可程序化生成的任务和不同长度控制,让评测者看到模型何时开始崩。对研发团队来说,RULER 式评测比单个固定长度 benchmark 更接近容量测试。

3. 长上下文能否替代 RAG?

LOFT 讨论了一个很有工程诱惑的问题:如果 LLM 能读入整个 corpus,是否还需要检索器、RAG、SQL 和其他工具?论文把任务扩到文本检索、视觉检索、音频检索、RAG、SQL-like 数据查询和 many-shot ICL。结果显示,长上下文模型在一些检索与 RAG 场景中具备竞争力,但在组合推理、结构化查询和提示策略敏感性上仍有明显挑战。

ICR^2 进一步指出,LOFT 一类任务可能低估真实难度,因为真实 RAG 场景里通常会有强检索器返回的相似干扰段落。ICR^2 用 confounding passages 构造更贴近实战的评测,并提出 retrieve-then-generate fine-tuning、retrieval-attention-probing、联合训练检索头等方法。工程启发很直接:长上下文不是取消检索,而是把检索从外部索引迁移到模型内部注意力和推理流程中;是否值得这样做,要看成本、可审计性和错误恢复能力。

4. 推理系统:KV cache 是真实瓶颈

长上下文推理有两个阶段:prefill 读入长输入,decode 逐 token 生成。prefill 成本通常受输入长度和注意力实现影响,decode 则会不断读取越来越大的 KV cache。RocketKV 代表了 2025 年一类训练无关方法:先做粗粒度 cache eviction,再做细粒度 top-k 稀疏注意力,目标是在较小精度损失下减少显存和带宽。FIER、Chelsea、ParisKV 等后续方向则分别探索细粒度检索、在线聚类、抗漂移检索和百万级 KV 访问。

工程上要警惕两点。第一,论文报告的 speedup 往往出现在特定 GPU、batch size、上下文长度和任务组合下;上线前必须用自己的 prompt 分布测试。第二,KV cache 策略会改变错误模式:有些方法在普通问答上无感,但在多跳引用、长代码定位、审计型问答中可能删掉关键证据。

5. 长输出:读得长不等于写得长

LongWriter 指出,一个模型即使能读 100K token,也可能难以稳定生成超过 2000 words 的输出,因为 SFT 数据中缺少长输出样本。它用 AgentWrite 构造长写作数据,并提出 LongBench-Write。LongWriter-Zero 在 2025 年 6 月提交、2026 年 4 月修订,转向强化学习:不用人工或合成长篇标注数据,从 base model 出发,用奖励模型鼓励长度控制、写作质量和结构格式。论文声称其 Qwen2.5-32B 训练版本在 WritingBench、Arena-Write 等长写作任务上优于传统 SFT 方法;具体榜单结论需随论文版本和榜单状态人工复核。

这条线对博客、报告、代码迁移和长文档生成很重要:长上下文应用不是只有“读入”,还包括“规划、分段、全局一致性、引用回填和后编辑”。

方法对比表

方向 代表工作 解决的问题 工程启发
位置编码扩展 RoPE、YaRN、LongRoPE2 短训长测、目标长度外推、短上下文保持 扩窗后必须回测短任务和真实业务任务
长上下文评测 RULER、LongBench v2、NoLiMa 标称长度与可用长度不一致 用长度扫描、位置扫描和语义检索测试替代单一 NIAH
长上下文应用 LOFT、ICR^2 长上下文是否替代 RAG / SQL / 检索器 多数场景更适合“检索 + 长上下文 + 引用校验”
KV cache 系统 RocketKV、FIER、Chelsea、ParisKV 长输入 / 长输出推理成本高 以业务 prompt 分布做 latency、显存和准确率联合评测
长输出训练 LongWriter、LongWriter-Zero 模型读得长但写不长 长文生成需要数据、奖励、规划与校验闭环

关键技术趋势

第一,评测会继续去“模板化”。NIAH 仍适合作为烟测,但不再足够。未来更有价值的是非字面证据定位、跨模态长上下文、代码仓库级修改、多轮会话记忆、带干扰项的 RAG 和结构化数据问答。

第二,长上下文会与 reasoning-time compute 绑定。LongBench v2 中带更长推理的模型表现更好,说明上下文长度和思考预算是相互耦合的。只给模型更多 token,但不允许它计划、重读、引用和校验,效果会受限。

第三,系统优化会成为核心差异。百万 token 的上下文不是“输入参数”,而是显存、带宽、调度、缓存生命周期和计费策略的组合。上下文缓存、prefix cache、分块 prefill、KV 量化、稀疏读取和 CPU/GPU 分层存储会成为服务框架的关键能力。

第四,长上下文不会消灭 RAG。更可能出现三类架构:小上下文精检索、长上下文粗读全局材料、Agent 在两者之间迭代。对于审计、合规、金融、医疗和科研检索,可追溯引用仍比“模型内部记住了”更重要。

工程落地启发

  1. 不要用上下文窗口长度选模型。至少要做四组测试:证据位置扫描、干扰项强度扫描、任务长度扫描、输出长度扫描。
  2. 对生产 RAG,不要把 top-k 无限制扩大。更稳的方案是“检索召回 + rerank + 分组摘要 + 关键原文片段 + 长上下文复核”。
  3. 对代码仓库任务,长上下文适合给全局结构、依赖图和关键文件片段,不适合把整个仓库一次性塞入然后期待完美编辑。
  4. 对长报告生成,要把输出拆成计划、章节草稿、引用校验、全局一致性检查和最终润色;不要一次 prompt 生成最终稿。
  5. 对服务成本,要单独记录 prefill latency、decode latency、KV cache 峰值、cache 命中率、每请求 token 成本,而不是只记录总延迟。

局限与争议

第一,很多论文的长上下文实验仍以英文、合成任务或少数开放模型为主,对中文长文档、跨语言资料、表格 PDF、真实企业知识库的外推有限。第二,商业模型上下文窗口、价格和限流变化很快,本文对模型规格只作为 2026-06-24 检索时的版本化记录。第三,长上下文评测容易被 prompt 策略影响:是否允许思维链、是否允许分步检索、是否提供文件名和目录结构,都会改变结果。第四,KV cache 压缩方法的“精度无损”通常是统计意义或 benchmark 意义,不能默认适用于高风险问答。

接下来值得关注的问题

最值得跟踪的不是谁发布了更长窗口,而是以下问题:模型是否能在 512K 到 1M 范围内保持多跳推理稳定性?长上下文与工具调用、代码执行、外部数据库之间如何分工?能否建立更强的可审计引用机制,让模型回答中的每个结论都回指上下文片段?服务框架能否在不牺牲关键证据的前提下自动压缩 KV cache?长输出训练能否从写作扩展到长代码迁移、长实验报告和复杂 agent 轨迹复盘?

总结

Long Context LLM 的研究已经越过“能不能装下”的阶段。真正的问题是:装进去之后,模型能不能稳定检索、推理、生成、引用和自我校验;系统能不能以可接受成本完成这些动作;评测能不能暴露真实失败模式。对研究者来说,长上下文提供了新的模型能力边界问题;对工程团队来说,它更像一组系统设计约束。下一阶段的胜负不在最大 token 数,而在有效上下文利用率。

参考资料

检索日期均为 2026-06-24。

  1. Ning Shang et al., “LongRoPE2: Near-Lossless LLM Context Window Scaling”, arXiv, 2025-02-27. https://arxiv.org/abs/2502.20082
  2. Yushi Bai et al., “LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks”, arXiv, v2 revised 2025-01-03. https://arxiv.org/abs/2412.15204
  3. Ali Modarressi et al., “NoLiMa: Long-Context Evaluation Beyond Literal Matching”, arXiv, v3 revised 2025-07-09. https://arxiv.org/abs/2502.05167
  4. Payman Behnam et al., “RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression”, arXiv, 2025-02-19. https://arxiv.org/abs/2502.14051
  5. Yuhao Wu et al., “LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning”, arXiv, v3 revised 2026-04-08. https://arxiv.org/abs/2506.18841
  6. Yifu Qiu et al., “Eliciting In-context Retrieval and Reasoning for Long-context Large Language Models”, arXiv, v3 revised 2025-06-09. https://arxiv.org/abs/2501.08248
  7. Jinhyuk Lee et al., “Can Long-Context Language Models Subsume Retrieval, RAG, SQL, and More?”, arXiv, 2024-06-19. https://arxiv.org/abs/2406.13121
  8. Cheng-Ping Hsieh et al., “RULER: What’s the Real Context Size of Your Long-Context Language Models?”, arXiv, 2024. https://arxiv.org/abs/2404.06654
  9. Nelson F. Liu et al., “Lost in the Middle: How Language Models Use Long Contexts”, arXiv / TACL, 2023. https://arxiv.org/abs/2307.03172
  10. Jianlin Su et al., “RoFormer: Enhanced Transformer with Rotary Position Embedding”, arXiv, 2021; revised 2023. https://arxiv.org/abs/2104.09864
  11. Bowen Peng et al., “YaRN: Efficient Context Window Extension of Large Language Models”, arXiv, 2023. https://arxiv.org/abs/2309.00071
  12. Yukang Chen et al., “LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models”, arXiv, 2023. https://arxiv.org/abs/2309.12307
  13. Google AI for Developers, “Gemini API Models”, last updated 2026-06-15 UTC. https://ai.google.dev/gemini-api/docs/models
  14. Meta Llama, “Llama 4 Model Cards and Prompt Formats”. https://www.llama.com/docs/model-cards-and-prompt-formats/llama4/
  15. Anthropic, “Claude models overview”, accessed 2026-06-24. https://platform.claude.com/docs/en/about-claude/models/overview
  16. OpenAI Developers, “GPT-5.4 Model”, accessed 2026-06-24. https://developers.openai.com/api/docs/models/gpt-5.4