
系列:AI 论文精读与复现训练营
日期:2026-08-01
适合读者:研究生、准备进入 LLM 方向的科研新人、有深度学习工程背景但想系统读架构论文的读者
建议前置:理解矩阵乘法、softmax、残差连接、LayerNorm、语言模型训练目标
摘要
Transformer 不是一篇读完就结束的论文,而是一条持续扩展的架构谱系。2017 年的 Attention Is All You Need 给出了“用注意力替代循环和卷积”的核心范式;BERT、T5、GPT-3 把它分别推向表示学习、统一文本到文本任务和大规模自回归语言建模;LLaMA、PaLM、Qwen3、DeepSeek-V3、Llama 4 等技术报告又把研究重点转向 decoder-only block、归一化、位置编码、KV cache、GQA/MQA、MoE、长上下文和多模态融合。
这篇文章的目标不是把所有论文摘要翻译一遍,而是给一条可执行的精读路线:每读一篇架构论文,都要问四个问题:它改了 Transformer block 的哪一部分?它解决的是训练稳定性、表达能力、上下文长度、推理成本还是数据/规模问题?它的实验是否能隔离架构贡献?如果要复现,最小实验应该怎么设计?
目录
- 为什么 Transformer 路线值得精读
- 核心阅读方法:先找不变量,再找改动点
- 代表论文路线图
- 关键论文精读
- 方法与实验对比表
- 复现建议
- 常见误区
- 适合研究生继续做的选题
- 总结
- 参考资料
为什么这个主题重要
很多同学第一次读 Transformer,会把注意力公式、encoder-decoder 图和 BLEU 分数当成重点。但现代 LLM 的论文已经很少停留在“是否使用 Transformer”这个层面,它们默认读者知道基本 block,然后在局部做选择:用 pre-norm 还是 post-norm?用 LayerNorm、RMSNorm 还是额外 normalization?位置编码用绝对位置、相对位置还是 RoPE?注意力头是否共享 KV?FFN 是否使用 gated activation?dense FFN 是否换成 MoE?长上下文靠架构、训练数据、位置外推还是 serving 系统?
因此,Transformer 路线的真正价值是建立一套架构阅读坐标系。你以后读任何 LLM 技术报告,都可以把它拆成五层:token 与位置、attention、FFN/MoE、normalization/residual、训练目标与上下文长度。论文里的模型名会变,但这五层会反复出现。

核心阅读方法:先找不变量,再找改动点
读 Transformer 架构论文时,不建议从 benchmark 表格开始。先画一个最小 block:
- 输入 token embedding 加上位置信息。
- attention 子层混合序列内的信息。
- FFN 子层对每个位置做非线性变换。
- residual connection 保留梯度与原始表示。
- normalization 控制训练稳定性。
- decoder-only 模型还要考虑 causal mask 与 KV cache。
然后对每篇论文做“改动点标注”:
- 改 attention:可能是 multi-head、multi-query、grouped-query、latent attention、sparse/block attention、FlashAttention 这类系统友好实现。
- 改 position:可能是 sinusoidal、learned absolute、relative position、RoPE、长上下文外推。
- 改 FFN:可能是 ReLU/GELU 到 GEGLU/SwiGLU,也可能是 dense FFN 到 MoE。
- 改 norm/residual:可能是 post-norm 到 pre-norm、RMSNorm、额外 normalization 或 residual scaling。
- 改 objective:可能是 masked LM、causal LM、span corruption、text-to-text、multi-token prediction。
- 改 scale:可能是参数、数据、上下文长度、激活参数、训练精度和硬件效率的共同设计。
这样读的好处是,你不会把“模型更大”“数据更多”“调参更好”误读成“架构必然更优”。架构论文的证据强度,取决于它是否把改动点从训练配方、数据质量和推理系统中分离出来。
代表论文路线图
第一站:原始 Transformer。
Vaswani 等人在 2017 年提交的 Attention Is All You Need 提出完全基于注意力的 encoder-decoder 架构,去掉 recurrent 和 convolutional 结构,并用 multi-head attention、position-wise FFN、residual、normalization 和 positional encoding 组成可并行训练的序列转导模型。精读时不要只背公式,要重点看作者如何把序列建模问题拆成“token-to-token 信息路由”和“位置无关的逐点变换”。
第二站:预训练目标分叉。
BERT 选择 encoder-only 和 masked language modeling,强调双向表示;GPT 系列选择 decoder-only 和 causal language modeling,强调自回归生成;T5 把 NLP 任务统一为 text-to-text,并系统比较预训练目标、数据、架构和迁移策略。这里要读懂:同样基于 Transformer,为什么输入可见性、mask 方式和 fine-tuning 形式会塑造模型能力。
第三站:规模化 decoder-only。
GPT-3、PaLM、LLaMA 把研究重点转向“如何把 decoder-only LM 训练到足够大且可用”。GPT-3 证明 few-shot prompting 与规模强相关;PaLM 报告 540B dense Transformer 及 Pathways 系统训练;LLaMA 证明在公开数据与更充分 token 预算下,中小参数量模型也能有强表现。读这一段时要把 architecture、data、compute 三者一起看。
第四站:现代 block 的局部替换。
RoPE 影响了位置编码的主流选择;RMSNorm 降低归一化开销并被多种 LLM 采用;GLU/SwiGLU 改写 FFN 的非线性部分;MQA/GQA 直接面向自回归推理中的 KV cache 带宽瓶颈;FlashAttention 系列说明很多“架构可用性”实际依赖 GPU memory hierarchy 和 kernel 实现。
第五站:2025 前后的系统级架构。
DeepSeek-V3 使用 MoE、Multi-head Latent Attention、auxiliary-loss-free load balancing 和 multi-token prediction;Qwen3 同时发布 dense 与 MoE 尺寸,并强调 thinking / non-thinking 模式和长上下文支持;Llama 4 模型卡说明其使用 MoE 与 early fusion 多模态架构。现代技术报告往往不是单一创新,而是 architecture、training、data、post-training、serving 的组合包。
关键论文精读
1. Attention Is All You Need:读结构,不只读公式
这篇论文最重要的贡献不是 softmax(QK^T / sqrt(d_k)) 这个公式本身,而是把序列建模从时间步递归中解放出来。你要重点读三处:
- Multi-head attention 为什么要分头?它让模型在不同表示子空间中学习不同关系,而不是把所有关系压进一个注意力矩阵。
- Encoder-decoder attention 为什么存在?它把源序列表示作为 memory,让 decoder 在生成时查询。
- Positional encoding 为什么必要?纯注意力本身对 token 顺序不敏感,必须注入顺序信息。
精读动作:把论文图 1 重画成你自己的 block,并标注每个张量的形状。然后尝试解释为什么 self-attention 的计算复杂度与序列长度平方相关,这会为后续长上下文论文打地基。
2. BERT、T5 与 GPT-3:架构相似,目标不同
BERT 的关键是 bidirectional encoder 表示,适合做理解任务的 fine-tuning;T5 的关键是把任务统一成 text-to-text,从而能系统研究预训练目标;GPT-3 的关键是把 decoder-only causal LM 推向大规模 few-shot setting。三者都不是“谁替代谁”,而是展示了 Transformer 在不同可见性约束下的分工。
读这组论文时,建议做一个三列表:输入能看见什么、训练时预测什么、推理时怎么使用。BERT 的 masked token 预测和 GPT 的 next-token prediction 对梯度信号、数据构造和能力外显方式都有影响。T5 适合作为方法论样本,因为它系统比较多个变量,而不是只发布一个更大的模型。
3. RoPE、RMSNorm、SwiGLU:现代 LLM block 的“三个小改动”
很多 LLM 架构看起来只是 Transformer 的变体,但它们的 block 已经和 2017 版本不同。RoPE 把位置信息编码进 query/key 的旋转关系,适合与 attention 分数结合;RMSNorm 去掉 LayerNorm 的 re-centering,仅保留 RMS 级别的缩放归一化;SwiGLU/GEGLU 这类 gated FFN 让前馈层不仅是“线性-激活-线性”,而是带门控的信息筛选。
这类论文的读法不是问“提升多少分”,而是问:改动是否局部、是否容易插入已有 block、计算开销如何、是否在多个规模上稳定。研究生做复现时,可以选 100M 到 1B 级别的小模型,比较 ReLU/GELU/SwiGLU、LayerNorm/RMSNorm、absolute/RoPE 的训练 loss 曲线和下游小任务,而不必复现大模型分数。
4. MQA、GQA、FlashAttention:从训练架构读到推理瓶颈
自回归生成不是一次性并行输出,而是逐 token 解码。每生成一个 token,模型都要读历史 token 的 key/value cache。Multi-query attention 让多个 query head 共享一组 key/value,降低 KV cache 读写压力;grouped-query attention 在 MHA 与 MQA 之间折中,用多个 KV 组保留质量;FlashAttention 则不是改变数学定义,而是改变 attention 的 GPU 计算与 memory access 方式。
这一组论文训练你区分“数学架构”和“系统实现”。有些方法不改变模型函数,却显著改变可训练长度、吞吐和显存占用。读实验表时,不要只看 perplexity,也要看 throughput、memory、context length、硬件型号和 kernel 支持。
5. DeepSeek-V3、Qwen3、Llama 4:现代技术报告怎么拆
DeepSeek-V3 报告称模型为 671B total、37B activated 的 MoE,使用 MLA 和 DeepSeekMoE,并加入 auxiliary-loss-free load balancing 与 multi-token prediction。Qwen3 官方仓库显示其发布 dense 与 MoE 多尺寸模型,包括 30B-A3B、235B-A22B 等,并在 2025 年更新了长上下文与 thinking/non-thinking 形态。Meta Llama 4 模型卡写明 Scout 与 Maverick 是 auto-regressive、MoE、early-fusion multimodal 模型,发布时间为 2025-04-05。
读这些报告时要更克制:不要把开放模型的 benchmark 表直接当作架构结论。它们通常同时改了数据、tokenizer、训练配方、RL/post-training、serving kernel 和评测集合。正确做法是把报告拆成“架构声明”“训练声明”“数据声明”“评测声明”“限制声明”,并为每条声明找可复现证据。
方法与实验对比表
| 论文/资料 | 重点读什么 | 架构改动位置 | 复现最小实验 | 主要风险 |
|---|---|---|---|---|
| Attention Is All You Need | multi-head attention、encoder-decoder、positional encoding | attention 与整体 block | 小型机器翻译或复制任务,重画张量形状 | 只背公式,不理解并行化动机 |
| BERT | masked LM 与双向 encoder | objective + encoder-only | 小语料 MLM 预训练 + 分类微调 | 把理解任务结论泛化到生成模型 |
| T5 | text-to-text 统一框架与消融 | objective + transfer setup | 用同一模型格式跑分类/摘要小任务 | 忽略数据清洗和任务模板 |
| GPT-3 | decoder-only + few-shot scaling | scale + prompting interface | 小 decoder LM 的 in-context 学习探针 | 把规模效应误判为单一架构创新 |
| RoPE / RMSNorm / SwiGLU | 局部 block 替换 | position、norm、FFN | 同规模小模型训练曲线对比 | 只看最终分数,不看稳定性 |
| MQA / GQA / FlashAttention | KV cache、吞吐、显存 | attention 与 kernel | 固定模型比较 prefill/decode latency | 混淆算法复杂度和实际硬件效率 |
| DeepSeek-V3 / Qwen3 / Llama 4 | MoE、长上下文、多模态/推理形态 | system-level architecture | 复现子模块或配置解析,不复现全量训练 | 把技术报告当成单变量实验 |
复现建议
如果你是研究生,不建议从“复现 Llama 级别模型”开始。更合理的路线是做三个小实验。
实验一:重建最小 Transformer。
用 PyTorch 写一个 decoder-only LM,在 TinyStories、WikiText-2 或自建小语料上训练。目标不是高分,而是验证 mask、residual、norm、FFN、position 的实现是否正确。必须保存 config、seed、loss 曲线和样例生成。
实验二:局部替换消融。
在同一训练预算下比较两到三个改动:absolute position vs RoPE,LayerNorm vs RMSNorm,GELU FFN vs SwiGLU FFN,MHA vs GQA。每次只改一个变量。报告里写明参数量是否变化、训练 token 是否一致、学习率是否重新调过。
实验三:推理侧测量。
固定一个开源小模型,测 prefill latency、decode latency、显存、KV cache 大小,比较不同上下文长度。这里不要追求论文级 benchmark,而要训练自己理解“为什么现代架构论文总在谈 KV cache、GQA、FlashAttention、serving engine”。
复现记录至少包括:
- 代码 commit 或压缩包 hash。
- Python、PyTorch、CUDA、transformers/vLLM/llama.cpp 版本。
- 数据集名称、版本、清洗规则和样本数。
- 模型 config:层数、hidden size、head 数、KV head 数、FFN hidden size、position type、norm type。
- 训练预算:token 数、batch size、学习率、warmup、precision。
- 日志:loss、吞吐、显存峰值、异常样例。
- 负结果:不稳定、loss spike、OOM、速度反常都要写。
常见误区
误区一:把 Transformer 等同于 attention。
Attention 是核心,但现代 LLM 的表现还依赖 FFN 容量、normalization、位置编码、训练目标、数据和规模。只读 attention 公式无法读懂 LLM 技术报告。
误区二:把 decoder-only 当成“更高级”。
Encoder-only、encoder-decoder、decoder-only 是任务和训练目标选择,不是线性进化。BERT 仍然适合表示学习;T5 仍然适合统一任务建模;decoder-only 只是现代通用生成模型的主流选择。
误区三:看到 MoE 就认为计算一定便宜。
MoE 降低每 token 激活参数,但会引入 routing、负载均衡、通信和部署复杂度。论文里的 total params、activated params、专家数、top-k、共享专家都要分开记录。
误区四:忽略硬件和 kernel。
长上下文 attention 是否可用,常常取决于 FlashAttention、paged KV cache、tensor parallel、GPU memory bandwidth 和 batch scheduling。架构读不懂系统,复现就容易失败。
误区五:复制 benchmark 表格当结论。
技术报告的评测表通常混合了模型、数据、后训练、提示格式和评测实现。科研训练要追求“能解释的差异”,不是堆排名。
适合研究生继续做的选题
- 小模型上的 position encoding 外推研究:固定 100M 到 300M decoder-only 模型,比较 RoPE、ALiBi、RoPE scaling 在短训长测下的稳定性。
- GQA 的质量-速度折中曲线:固定参数量和训练数据,系统改变 KV head 数,测 perplexity、decode latency 和显存。
- FFN 门控对推理任务的影响:比较 GELU、GEGLU、SwiGLU 在数学、代码、小语料语言建模上的差异,重点分析训练稳定性。
- MoE routing 可解释性小实验:在小型 MoE LM 上观察不同 token 类型、语言或任务是否倾向不同 expert。
- 技术报告声明核验工具:写脚本解析 Hugging Face config、model card 和论文表格,自动生成“架构声明清单”,标出待人工核验字段。
- 训练目标与架构交互:比较同一 Transformer block 在 causal LM、span corruption、prefix LM 下的表示和生成差异。
总结
Transformer 精读路线的核心不是“读完一篇神作”,而是建立一个能持续复用的架构坐标系。先读 2017 年原始 Transformer,理解 attention、FFN、position、residual、norm 的基本分工;再读 BERT、T5、GPT-3,理解训练目标如何改变模型用途;然后读 RoPE、RMSNorm、SwiGLU、MQA/GQA、FlashAttention,理解现代 block 的局部演化;最后读 DeepSeek-V3、Qwen3、Llama 4 这类技术报告,训练自己把系统级模型拆回可检验的研究问题。
真正的科研训练发生在复现和消融里:你能否固定变量、重跑小实验、解释负结果,并从一个局部改动提出下一步问题。能做到这一点,Transformer 就不再是一张经典架构图,而会变成你进入 LLM 研究的工具箱。
参考资料
检索日期:2026-08-01。以下优先列出论文、官方项目页、官方模型卡或会议页面;模型卡、仓库 release、benchmark 数字等易变化信息,投稿或发布前建议再次核验。
- Vaswani et al., 2017, Attention Is All You Need, arXiv: https://arxiv.org/abs/1706.03762
- Devlin et al., 2018/2019, BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding, arXiv: https://arxiv.org/abs/1810.04805
- Raffel et al., 2019/2023, Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer, arXiv: https://arxiv.org/abs/1910.10683
- Brown et al., 2020, Language Models are Few-Shot Learners, NeurIPS: https://papers.neurips.cc/paper/2020/hash/1457c0d6bfcb4967418bfb8ac142f64a-Abstract.html
- Kaplan et al., 2020, Scaling Laws for Neural Language Models, arXiv: https://arxiv.org/abs/2001.08361
- Shazeer, 2020, GLU Variants Improve Transformer, arXiv: https://arxiv.org/abs/2002.05202
- Zhang and Sennrich, 2019, Root Mean Square Layer Normalization, NeurIPS: https://papers.nips.cc/paper_files/paper/2019/hash/1e8a19426224ca89e83cef47f1e7f53b-Abstract.html
- Su et al., 2021, RoFormer: Enhanced Transformer with Rotary Position Embedding, arXiv: https://arxiv.org/abs/2104.09864
- Shazeer, 2019, Fast Transformer Decoding: One Write-Head is All You Need, arXiv: https://arxiv.org/abs/1911.02150
- Ainslie et al., 2023, GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints, ACL Anthology / EMNLP 2023: https://aclanthology.org/2023.emnlp-main.298/
- Dao, 2023, FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning, arXiv: https://arxiv.org/abs/2307.08691
- Chowdhery et al., 2022, PaLM: Scaling Language Modeling with Pathways, arXiv: https://arxiv.org/abs/2204.02311
- Touvron et al., 2023, LLaMA: Open and Efficient Foundation Language Models, arXiv: https://arxiv.org/abs/2302.13971
- Grattafiori et al., 2024, The Llama 3 Herd of Models, arXiv: https://arxiv.org/abs/2407.21783
- DeepSeek-AI, 2024/2025, DeepSeek-V3 Technical Report, arXiv: https://arxiv.org/abs/2412.19437
- Qwen Team, 2025, Qwen3 official repository and technical report links: https://github.com/QwenLM/Qwen3
- Qwen Team, 2025, Qwen3: Think Deeper, Act Faster, official blog: https://qwenlm.github.io/blog/qwen3/
- Meta, 2025, Llama 4 model card: https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md
- Meta, 2025, The Llama 4 herd, official blog: https://ai.meta.com/blog/llama-4-multimodal-intelligence/