
系列:AI 论文盘点 / 技术趋势
日期:2026-07-25
适合读者:AI、NLP、机器学习方向研究生;准备复现方法论文、写 reading note、做 ablation 或从论文局限发展选题的科研新人;希望把“看懂论文”提升为“能拆、能复现、能质疑”的工程型读者
检索日期:2026-07-25
摘要
方法论文是 AI 研究训练中最容易“读懂表面、漏掉关键”的类型。你可能看完摘要,知道作者提出了一个新模块、一个新训练目标或一个新推理流程;也可能记住了实验表格里某几个高分结果。但如果你不能回答四个问题,这篇论文其实还没有被拆开:它到底定义了什么任务,核心假设是什么,方法由哪些模块组成,训练目标如何把假设变成可优化信号。
这篇文章给出一套面向复现和选题的拆解框架。它不把论文当成一段叙事,而是当成一个可运行、可替换、可反驳的研究系统:输入、输出、约束、模块、loss、数据流、训练流程、推理流程和证据链。我们会用 Transformer、LoRA、QLoRA、DPO、Mamba、DeepSeek-R1、Kimi K2 等代表性论文和技术报告作为参照,说明怎样从论文文本、公式、算法框、实验设置和开源代码中还原方法的真实结构。重点不是背论文结论,而是训练一种科研动作:把一篇方法论文拆成可以复现的最小单元,再从这些单元里找到自己的 follow-up idea。
目录
- 为什么方法论文不能只读“方法介绍”
- 方法论文的四层骨架
- 第一步:重写任务定义
- 第二步:找出核心假设
- 第三步:画出模块边界和数据流
- 第四步:拆训练目标和优化流程
- 代表论文路线图
- 关键论文精读示例
- 方法 / 实验对比表
- 复现实操:从伪代码到最小可运行版本
- 常见误区
- 适合研究生继续做的选题
- 总结
- 参考资料
为什么方法论文不能只读“方法介绍”
很多研究生读方法论文时,会自然地把注意力放在 Method section:作者提出什么结构,公式长什么样,图里有哪些模块,算法框写了几步。这当然重要,但只读方法介绍会造成一个严重错觉:你以为论文的贡献在“新模块”,实际上贡献可能在任务定义、训练数据构造、损失函数权重、推理时搜索策略、baseline 选择或实验协议里。
方法论文通常有两套结构。第一套是作者写出来的结构:Introduction 讲问题,Related Work 讲背景,Method 讲模型,Experiments 讲结果。第二套是研究系统的结构:任务定义决定输入输出,假设决定为什么这个方法可能有效,模块决定信息如何流动,训练目标决定模型被奖励什么,评测协议决定 claim 是否被证据支撑。精读方法论文时,你要从第一套结构里还原第二套结构。
这种能力在 2025-2026 年尤其重要。当前 AI 方法论文越来越像系统工程:一个大模型技术报告可能同时包含预训练数据、MoE 架构、长上下文、强化学习、工具调用数据和安全评测;一篇 reasoning 论文可能同时改变数据、奖励、采样和验证器;一篇 efficient training 论文可能把显存优化、量化格式、低秩适配和实验配置绑在一起。如果只问“作者提出了什么模块”,很容易把多个变量混成一个贡献。
更实际地说,复现失败经常不是因为你看不懂公式,而是因为你没有拆清楚系统边界:作者是否固定 backbone,是否用了额外数据,loss 是主目标还是 auxiliary objective,训练分几阶段,推理时是否用了更高 compute budget,baseline 是否共享同样的数据和调参预算。拆方法论文的目的,就是在动手之前把这些问题显式化。

方法论文的四层骨架
拆一篇方法论文,可以从四层开始。
第一层是 任务定义。它回答“论文解决的到底是什么问题”。这里不要只抄任务名,而要写成输入、输出、约束和成功标准。例如,machine translation 不是只有“翻译”,还包括输入语言、输出语言、训练语料、解码条件和评测指标;preference optimization 不是只有“让模型更符合偏好”,还包括偏好对的来源、reference model 是否固定、是否需要 reward model、优化目标是否稳定。
第二层是 核心假设。方法论文必然暗含一个假设:某种归纳偏置、训练信号、数据组织方式或推理过程能带来更好泛化。Transformer 的关键假设之一是 attention 可以替代循环和卷积来建模序列依赖;LoRA 的关键假设是大模型适配更新存在低内在秩;DPO 的关键假设是可以把偏好学习重写为直接优化策略而不显式训练 reward model;Mamba 的关键假设是 selective state space 机制能在长序列建模中兼顾线性复杂度和内容选择能力。你要把这些假设用自己的话写出来,因为它们决定后续 ablation 应该测什么。
第三层是 模块边界。方法论文里的模块不是图上画了几个盒子,而是哪些参数被训练,哪些参数被冻结,哪些信息流可微,哪些步骤只在训练时存在,哪些步骤只在推理时存在。模块边界一旦拆错,复现就会变成“看似实现了论文,实际实现的是另一个系统”。
第四层是 训练目标。训练目标不是公式装饰,而是论文把假设转化成优化压力的地方。一个方法可能看起来是架构创新,真正起作用的是辅助 loss;也可能看起来是 RL 创新,真正敏感的是 reward normalization、KL 约束、采样数量和数据过滤。拆训练目标时,要问主 loss、辅助 loss、正则项、约束项、采样策略和训练阶段分别在优化什么。
这四层可以形成一张最小拆解表:
| 拆解层 | 你要重写的问题 | 最终产物 |
|---|---|---|
| 任务定义 | 输入是什么,输出是什么,约束是什么,成功标准是什么 | 一段形式化 problem statement |
| 核心假设 | 作者认为哪个机制会改善哪个失败模式 | 1-3 条可证伪 hypothesis |
| 模块边界 | 哪些组件产生、变换、筛选或验证信息 | 模块图和数据流图 |
| 训练目标 | 每个 loss、reward 或 objective 在压什么行为 | objective 表和训练阶段表 |
第一步:重写任务定义
拆方法论文时,第一步不是看公式,而是重写任务定义。一个好的任务定义至少包含五个元素:输入空间、输出空间、训练信号、约束条件和评测标准。
以 Transformer 为例,如果只说“做机器翻译”,粒度太粗。更有效的写法是:给定源语言 token 序列,模型通过 encoder-decoder attention 生成目标语言 token 序列;训练使用并行语料上的 next-token maximum likelihood;推理使用自回归解码;评测使用机器翻译指标和速度 / 可并行性分析。这样写之后,你会立刻看到论文的关键不只是“attention”,还有“去掉循环结构后是否仍能保持翻译质量,同时提升训练并行度”。
以 DPO 为例,任务定义也不能写成“对齐大模型”。它更具体:给定 prompt 和成对偏好回答,优化一个 policy,使其相对 reference policy 更偏向 chosen response 而远离 rejected response;它试图替代 RLHF 中先训练 reward model、再做 policy optimization 的多阶段流程。这样重写之后,后续问题就清楚了:reference model 如何选择,偏好数据来自哪里,chosen/rejected 的质量差是否足够,beta 等超参数怎样改变行为。
以 DeepSeek-R1 这类 reasoning 技术报告为例,任务定义还要区分“训练任务”和“展示任务”。论文可能在数学、代码和通用问答上展示能力,但训练中涉及 cold-start data、reinforcement learning、rejection sampling、distillation 等阶段。你不能把最终 benchmark 上的 reasoning ability 直接等同于某一个模块的贡献,而要追踪每个训练阶段面向的行为:格式稳定性、长链推理、可读性、答案正确性、对齐风格还是小模型蒸馏。
重写任务定义时可以用这个检查清单:
- 输入是否明确到数据格式、上下文长度、模态和采样来源。
- 输出是否明确到生成对象、预测标签、动作序列或检索结果。
- 训练信号是否明确到监督标签、偏好对、reward、self-play 反馈或合成数据。
- 约束是否包括计算预算、参数冻结、数据可用性、推理时间和安全限制。
- 评测标准是否真的对应论文声称解决的问题。
如果这五项写不清楚,先不要急着读公式。因为公式只是在某个任务定义内部有意义。
第二步:找出核心假设
方法论文的假设通常不会用“Hypothesis”作为标题写出来。它藏在 Introduction 的痛点、Method 的设计选择和 Ablation 的对照组里。找假设的方法是把作者的贡献句改写成因果句:
“如果我们引入 X,那么 Y 会改善,因为 Z。”
例如,LoRA 可以改写为:如果只训练低秩矩阵来近似权重更新,那么在冻结预训练模型主体的情况下仍能高效适配下游任务,因为适配过程中的权重变化具有低内在秩。这个假设直接导出复现实验:不同 rank 的表现如何,哪些层需要 LoRA,参数量和性能如何权衡,低秩更新是否在不同任务上都成立。
QLoRA 可以改写为:如果用 4-bit 量化存储冻结的大模型权重,并通过低秩适配训练少量参数,就能在有限显存上微调大模型,同时尽量保留全精度微调效果。这里要检查的不是“4-bit 很省显存”这一句,而是量化格式、paged optimizer、rank、数据质量和任务规模如何共同影响结果。
Mamba 可以改写为:如果 state space model 具备内容依赖的选择机制,就能在长序列中保留线性时间推理优势,同时改善传统 SSM 对离散 token 内容选择不足的问题。这个假设导出的问题是:优势来自 selective scan、整体架构、训练规模,还是比较对象的设置。
DPO 可以改写为:如果偏好学习目标可以从 reward modeling 推导为一个直接的分类式 objective,那么无需显式 RL 训练也能让 policy 学会偏好方向。这个假设要通过与 RLHF、PPO、IPO、KTO 等方法在同等偏好数据和 reference 设置下比较,而不是只看最终胜率。
假设拆解的关键是“可证伪”。一句“我们的方法更有效”不是假设;一句“模块 X 在长依赖场景中通过 Y 机制降低 Z 误差”才有可实验检验的形状。你在阅读时可以用三色标注:
- 绿色:论文明确验证过的假设。
- 黄色:论文部分验证,但实验设置不足以隔离变量。
- 红色:论文声称了效果,但没有直接证据或只有间接结果。
这种标注会自然变成你的 follow-up idea 来源。黄色和红色区域,往往比作者强调的亮点更适合研究生继续做。
第三步:画出模块边界和数据流
方法论文里的图通常是“讲故事的图”,不是“复现用的图”。复现需要你重画一张更朴素的系统图:数据从哪里来,经过哪些可训练模块,产生哪些中间变量,loss 回传到哪里,推理时哪些模块仍然存在。
你可以把模块分成六类。
输入处理模块:tokenizer、视觉编码器、检索器、prompt template、数据过滤器、增强器。很多论文看起来是模型创新,实际敏感点在输入构造。例如 instruction tuning 和 preference optimization 中,prompt 格式、system message、response 清洗和数据混合比例都会改变结果。
主体模型模块:encoder、decoder、attention block、SSM block、MoE layer、adapter、router、memory bank、tool policy。这里要标注哪些参数初始化自预训练模型,哪些从零训练,哪些冻结。
中间表示模块:retrieved documents、latent state、scratchpad、chain-of-thought、program、tool call、reward feature、hidden activation。中间表示是否可见、是否可监督、是否被过滤,会影响复现和解释。
训练信号模块:label、preference pair、reward model、verifier、self-consistency vote、teacher model、synthetic data generator。训练信号模块常被论文写得很短,但它决定上限。
优化与调度模块:optimizer、learning rate schedule、batching、gradient checkpointing、precision、seed、stage transition。工程实现不是论文的附属物,在大模型方法中常常是方法有效性的前提。
推理策略模块:greedy / beam / sampling、temperature、top-p、reranking、search、tool verification、majority vote、KV cache 或 speculative decoding。很多 reasoning、agent 和 code 论文的性能差异来自 inference-time compute,而不是训练结构本身。
画图时,建议每个模块旁边写三类标签:trainable / frozen / external,train-only / inference-only / both,claimed contribution / support component / evaluation component。这三个标签能帮你快速识别论文里的核心变量和辅助变量。
第四步:拆训练目标和优化流程
训练目标是方法论文最值得慢读的部分。公式不需要你一眼记住,但你要能回答它在奖励什么、惩罚什么、约束什么。
对于 supervised fine-tuning,主目标通常是 token-level maximum likelihood。但这不意味着所有 SFT 论文都一样。数据来源、样本权重、sequence packing、loss mask、assistant-only loss、multi-turn 格式和拒答样本都会改变训练压力。
对于 preference optimization,要拆 chosen/rejected pair、reference model、KL 或隐式 KL、temperature / beta、response 长度偏差和偏好数据噪声。DPO 的公式背后有一个重要研究问题:它把偏好学习变成了直接目标,但这个目标是否足以处理多轮偏好、过程偏好、verifier 反馈和分布外 prompt,需要具体实验支持。
对于 RL reasoning,要拆 reward 的可验证性和采样过程。数学和代码任务常有相对明确的答案验证器,开放式任务则困难得多。DeepSeek-R1 这类论文提示我们,reasoning 能力的训练不是单一 loss,而是数据、冷启动、RL、蒸馏和格式控制共同作用。阅读时要把每个阶段的目标写成表格,而不是把它们合并成“用了 RL”。
对于架构论文,loss 可能看似普通,但训练流程仍然关键。Transformer 原论文使用 sequence-to-sequence 翻译任务验证架构;Mamba 类论文通常会在语言建模、长序列任务和不同规模设置中验证架构假设。你要问:如果 loss 没变,为什么结构变化会带来收益;如果数据和规模也变了,实验是否能隔离架构贡献。
拆训练目标可以用这张表:
| 项目 | 阅读问题 | 复现记录方式 |
|---|---|---|
| 主目标 | 最终优化的 loss / reward 是什么 | 写出公式和代码入口 |
| 辅助目标 | 是否有 auxiliary loss、KL、entropy、router loss | 标注权重和启停阶段 |
| 数据采样 | 每个 batch 如何构成 | 记录数据混合比例和过滤规则 |
| 参数更新 | 哪些参数被更新 | 保存 trainable parameter list |
| 训练阶段 | 是否多阶段训练 | 每阶段单独记录 checkpoint |
| 推理耦合 | 训练目标是否依赖推理策略 | 固定 decoding / search 配置 |
代表论文路线图
下面不是“必读全集”,而是训练拆解能力的一条路线。每类论文都适合练习不同拆法。
| 论文类型 | 代表论文 | 适合练什么 |
|---|---|---|
| 架构方法 | Transformer、Mamba | 从模块边界和复杂度假设拆贡献 |
| 参数高效微调 | LoRA、QLoRA | 从冻结参数、低秩假设和显存预算拆贡献 |
| 偏好优化 | RLHF 系列、DPO | 从 reward / preference objective 拆训练信号 |
| 推理训练 | DeepSeek-R1 等 reasoning 技术报告 | 从多阶段训练和可验证 reward 拆系统 |
| 大模型技术报告 | Kimi K2 等 MoE / agentic LLM 报告 | 从架构、数据、后训练、评测和代码说明拆证据 |
| 复现规范 | NeurIPS、ICLR、AAAI、ACL checklist | 从实验披露要求反推论文应提供的信息 |
这条路线的重点是横向比较。不要把每篇论文孤立读完,而要问:它改变的是任务定义、模块、objective、数据,还是推理预算。相同 benchmark 上的分数只有在这些变量可比时才有解释力。
关键论文精读示例
Transformer:先拆任务,再拆架构
Transformer 最容易被读成“Attention is All You Need,所以核心就是 self-attention”。这句话没错,但精读时还要拆三个层次。
第一,任务背景是 sequence transduction,原论文主要通过机器翻译实验展示效果。第二,核心假设是 attention 机制可以替代 recurrent / convolutional 结构,并通过并行化改善训练效率。第三,模块包括 multi-head attention、position-wise feed-forward network、positional encoding、residual connection、layer normalization、encoder-decoder attention 和自回归 decoder。第四,训练目标仍是常规序列生成目标,所以架构贡献要通过与 RNN/CNN baseline、训练成本和翻译质量共同判断。
复现时,你不需要一开始就重写一个现代大模型。更好的训练是用小规模 translation 或 language modeling 任务实现 minimal Transformer,然后逐项关掉 positional encoding、multi-head、feed-forward width、residual path,观察 failure mode。这比直接跑大模型更能理解方法。
LoRA / QLoRA:模块小,变量不少
LoRA 的论文很好练“参数边界”。它的核心不是“加两个矩阵”这么简单,而是冻结预训练权重,只训练低秩更新,并把可训练参数插入到特定线性层。阅读时要记录 rank、alpha、插入层位置、dropout、任务类型、baseline、全量微调对照和训练预算。
QLoRA 则进一步提醒我们:方法论文可能由多个工程变量组成。4-bit quantization、NF4、double quantization、paged optimizer、LoRA adapter、数据集选择和指令微调设置都可能影响结果。你要把“显存可行性”和“质量保持”分开记录。前者可以通过峰值显存和 batch size 复现,后者需要同数据、同模型、同评测的对照。
DPO:公式背后的数据和 reference
DPO 的吸引力在于把偏好优化写成相对简洁的目标。但拆解时要从公式外部开始:偏好数据怎样构造,chosen/rejected 是否只差一个维度,reference policy 如何选择,beta 如何控制偏离程度,训练后是否出现长度偏差或安全行为变化。
对于研究生,DPO 的好训练不是复述推导,而是做一个小实验:固定基础模型和偏好数据,比较 SFT-only、DPO、不同 beta、不同数据噪声比例和不同 evaluation prompt。你会发现 preference optimization 的效果不只来自目标函数,还来自偏好数据的可学习性。
Mamba:复杂度 claim 要和任务 claim 分开
Mamba 类论文适合训练“不要把效率 claim 和效果 claim 混在一起”。线性时间序列建模是复杂度 claim,语言建模或长上下文表现是任务 claim,selective state space 是机制 claim。三者相关,但不是同一件事。
阅读时,先拆 selective mechanism 解决什么失败模式,再看实现是否需要特定 kernel 或硬件优化,最后看实验是否覆盖了足够任务和规模。复现时可以先跑小模型的序列任务验证功能正确,再比较吞吐和显存,最后才谈大规模结果。
DeepSeek-R1 / Kimi K2:技术报告要按阶段拆
2025 年以来,大模型技术报告越来越重要,但它们常常不是单一方法论文。DeepSeek-R1 这类 reasoning 报告涉及强化学习、冷启动数据、蒸馏和推理行为;Kimi K2 这类 MoE / agentic LLM 报告则会同时覆盖模型结构、训练系统、agentic 数据、工具调用和评测。
读这种报告时,最危险的做法是把所有结果归因到一个名字。更好的做法是按阶段拆表:预训练阶段解决什么,后训练阶段解决什么,RL 阶段优化什么,蒸馏阶段迁移什么,推理设置又额外提供了什么。对于代码仓库、模型权重、benchmark 数字和数据细节,要以论文官方页面、arXiv 版本、项目主页和仓库当前状态为准;本文检索日期为 2026-07-25,后续发表版或仓库内容可能已经变化,发表前应再次人工核验。
方法 / 实验对比表
读完一篇方法论文后,建议强制输出一张对比表。下面是一种模板。
| 维度 | 本文方法 | 关键 baseline | 需要核验的问题 |
|---|---|---|---|
| 任务定义 | 输入、输出、约束是否改变 | baseline 是否同任务 | 是否存在任务定义漂移 |
| 数据 | 训练数据、过滤、合成、偏好来源 | baseline 是否同数据 | 是否用了额外不可见数据 |
| 模型 | 新模块、冻结模块、外部模块 | baseline 参数量和架构 | 参数量或计算量是否公平 |
| Objective | 主 loss、辅助 loss、reward | baseline objective | 是否多了额外训练信号 |
| 训练预算 | steps、tokens、GPU、precision | baseline 预算 | 是否调参预算不同 |
| 推理预算 | sampling、search、tools、rerank | baseline 推理设置 | 是否用了更多 test-time compute |
| 证据 | main table、ablation、analysis | 对照实验 | 是否隔离核心变量 |
| 可复现性 | 代码、数据、配置、seed、日志 | baseline 复现实作 | 缺哪项会阻塞复现 |
这张表的作用不是整理得好看,而是暴露不可比项。只要你发现“本文方法多了额外数据”“baseline 没有同等调参”“推理时用了更多采样”“ablation 没有单独关掉核心模块”,就应该在阅读笔记里标红。
复现实操:从伪代码到最小可运行版本
方法论文复现不要一开始追求完整规模。更稳的路线是四步。
第一步,建立 paper spec。把任务定义、数据、模块、objective、训练阶段、推理设置写成一页 YAML 或 Markdown。不要写感想,只写可执行信息。凡是论文没说清楚的地方,标成“待人工核验”或“需要从代码确认”。
第二步,做 minimal implementation。只实现核心变量,使用小数据、小模型和短训练步数验证代码路径。目标不是复现论文分数,而是确认 forward、loss、mask、梯度和日志都正确。
第三步,做 single-factor ablation。一次只改一个变量:关掉模块、换 objective、改变 rank、去掉 auxiliary loss、固定推理预算、替换数据过滤规则。每个实验要有 seed、config、commit hash、硬件信息和日志路径。
第四步,做 claim-level reproduction。回到论文主 claim,判断哪些 claim 被你复现,哪些只部分复现,哪些无法复现。复现报告应按 claim 写,而不是按实验编号写。
一个实用的复现目录可以这样组织:
reproduce_paper_x/
paper_spec.md
configs/
baseline.yaml
method.yaml
ablation_no_module_x.yaml
scripts/
train.py
evaluate.py
logs/
2026-07-25_seed1_method/
notes/
implementation_questions.md
reproduction_report.md
如果论文有官方代码,不要急着魔改。先跑官方最小 demo,记录环境、依赖版本、数据下载、checkpoint、默认参数和日志格式。然后再把你自己的实验改动控制在 config 层。很多复现失败来自“还没跑通原始实现就开始重构”。
常见误区
误区一:把论文图当成实现图。 论文图常省略数据预处理、mask、loss 权重、训练阶段和推理策略。复现前必须重画数据流图。
误区二:把新名字当成新贡献。 一个模块有新名称,不代表它改变了核心机制。要追问它相对 baseline 改了什么变量。
误区三:只读 main result table。 方法论文的可信度主要在 ablation、analysis、negative case 和实验协议,而不只在最大表格。
误区四:忽略训练数据。 2025-2026 年很多模型能力差异来自数据筛选、合成、偏好标注、蒸馏和 rejection sampling。只看模型结构会误判贡献。
误区五:把 test-time compute 当成训练方法收益。 如果方法在推理时使用更多采样、搜索、工具调用或 verifier,必须单独记录推理预算。
误区六:复现时只追分数,不追机制。 分数接近不代表机制一致。你还要检查中间行为、失败案例和 ablation 是否支持同一解释。
适合研究生继续做的选题
- 方法论文拆解基准:选一个小领域,系统标注 30 篇论文的任务定义、模块、objective、数据和推理预算,分析常见不可比变量。
- Objective 敏感性复现:选择 DPO、IPO、KTO 或 GRPO 相关方法,在同一偏好数据上比较超参数、噪声和 reference model 的影响。
- 模块贡献再评估:挑一篇架构或 adapter 论文,复现实验并加入更严格的参数量、训练 tokens 和推理预算控制。
- 技术报告证据审计:以 2025-2026 年大模型技术报告为对象,比较它们披露数据、训练阶段、评测和安全限制的粒度。
- 论文到代码一致性检查:构建工具或人工协议,检查论文公式、算法框、配置文件和代码实现之间的不一致。
- Ablation report 模板研究:提出一种面向方法论文的复现报告格式,强制按 claim、变量和证据组织,而不是按实验流水账组织。
这些题目都不要求一开始训练大模型。真正有研究价值的是把变量拆清楚,把对照做干净,把结论写得可证伪。
总结
拆解方法论文的核心,不是把 Method section 翻译成中文,而是把一篇论文还原成研究系统。你要先重写任务定义,再抽出核心假设,然后画模块边界和数据流,最后拆训练目标、训练阶段和推理设置。只有这样,论文里的 claim 才会变成可复现、可质疑、可扩展的对象。
对研究生来说,最重要的训练不是“读了多少篇”,而是每读一篇都能产出四个文件:任务定义、假设清单、模块图、objective 表。一个月后,你会发现自己不再只是跟随论文叙事,而是在主动审计论文。科研选题也会从“我想改一个模块”变成“我知道哪个假设还没有被充分验证,以及怎样设计实验验证它”。
参考资料
检索日期:2026-07-25。以下链接优先选择论文、会议官方页面、arXiv、OpenReview 或项目主页。模型权重、代码仓库状态、benchmark 数字、数据集版本和会议规则可能随时间变化,正式发布前应再次人工核验。
- Vaswani et al., “Attention Is All You Need”, arXiv, 2017. https://arxiv.org/abs/1706.03762
- Hu et al., “LoRA: Low-Rank Adaptation of Large Language Models”, arXiv, 2021. https://arxiv.org/abs/2106.09685
- Dettmers et al., “QLoRA: Efficient Finetuning of Quantized LLMs”, arXiv, 2023. https://arxiv.org/abs/2305.14314
- Rafailov et al., “Direct Preference Optimization: Your Language Model is Secretly a Reward Model”, arXiv, 2023. https://arxiv.org/abs/2305.18290
- Gu and Dao, “Mamba: Linear-Time Sequence Modeling with Selective State Spaces”, arXiv, 2023. https://arxiv.org/abs/2312.00752
- DeepSeek-AI, “DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning”, arXiv, 2025. https://arxiv.org/abs/2501.12948
- Moonshot AI, “Kimi K2: Open Agentic Intelligence”, arXiv, 2025. https://arxiv.org/abs/2507.20534
- NeurIPS 2026 Reviewer Guidelines, official conference page. https://neurips.cc/Conferences/2026/ReviewerGuidelines
- ICLR 2026 Call for Papers, official conference page. https://iclr.cc/Conferences/2026/CallForPapers
- AAAI-26 Reproducibility Checklist, official conference page. https://aaai.org/conference/aaai/aaai-26/reproducibility-checklist/
- ACL 2026 Main Conference Calls and submission information, official conference page. https://2026.aclweb.org/
- OpenReview documentation and venue pages for ICLR-style peer review and paper metadata. https://openreview.net/