
系列:AI 论文盘点 / 技术趋势:AI 论文精读与复现训练营
日期:2026-08-02
适合读者:研究生、准备做大模型方向的科研新人、有工程背景但想系统理解模型规模实验的读者
建议前置:理解语言模型交叉熵、Transformer 参数量、训练 token、FLOPs、log-log 图和基本统计拟合
摘要
Scaling Laws 不是一句“模型越大越好”,而是一套用小规模实验预测大规模行为的研究方法。Kaplan 等人在 2020 年把语言模型 loss 与参数量、数据量、训练计算量之间的幂律关系系统化;DeepMind 的 Chinchilla 工作在 2022 年把问题改写为“给定 compute budget,参数和 token 应该如何分配”;随后数据受限、多模态、多语言、post-training、test-time compute、emergent abilities 争议和 2026 年的 unified scaling law 又不断扩大了这个框架。
这篇文章的目标是给出一条 Scaling Laws 论文精读路线。读者要学会三件事:第一,看懂 scaling law 论文到底拟合了什么变量;第二,判断它的外推是否可信;第三,把论文里的大模型问题改造成自己能复现的小实验。
目录
- 为什么 Scaling Laws 值得精读
- 核心阅读方法:先读变量,再读曲线
- 代表论文路线图
- 关键论文精读
- 方法与实验对比表
- 复现建议
- 常见误区
- 适合研究生继续做的选题
- 总结
- 参考资料
为什么这个主题重要
大模型研究有一个现实约束:很多关键结论只能在昂贵训练之前判断。一个实验室不可能随意训练几十个 100B 级模型来试错,因此需要用较小模型、较少 token 和较低算力估计更大规模下的趋势。Scaling laws 的科研价值就在这里:它把“经验直觉”变成可拟合、可外推、可质疑的函数关系。
但 scaling law 也很容易被误读。论文中常见的横轴可能是 non-embedding parameters、training tokens、training FLOPs、训练步数、数据重复轮次、sampling ratio、test-time compute 或 reward optimization budget;纵轴可能是 validation loss、downstream accuracy、pass@k、reward score、人类偏好或安全指标。只要变量定义变了,“规模带来什么”的结论就可能完全不同。
所以这条路线的核心不是崇拜规模,而是训练一种科研判断:当作者说“可预测”时,他预测的是哪个指标?当作者说“emergent”时,突变来自能力本身,还是来自 metric、prompt、数据污染、采样方式或阈值化评分?

核心阅读方法:先读变量,再读曲线
精读 Scaling Laws 论文时,不建议从结论图开始,而要先做一张“变量表”:
- N:模型规模。 是否排除 embedding 参数?MoE 模型写的是 total parameters 还是 activated parameters?宽度、深度、head 数是否随 N 一起变化?
- D:训练数据。 计量单位是 token、样本、episode 还是多模态离散 token?数据是否去重?重复 token 是否被当作新数据?
- C:计算量。 是估算 FLOPs、实际训练时间、GPU-days,还是推理阶段的采样/搜索预算?
- L 或 M:指标。 是 cross-entropy loss、perplexity、accuracy、reward、human preference,还是离散的 pass/fail 指标?
- 外推范围。 拟合是在 10M 到 1B 之间做的,却外推到 100B 吗?是否验证过中间尺度或 held-out scale?
- 控制变量。 架构、tokenizer、数据 mixture、训练超参、batch size、learning rate schedule、eval set 是否保持一致?
读完变量表,再看曲线形态。传统幂律在 log-log 图上接近直线;broken scaling law 允许不同区间有不同斜率;temporal scaling law 关注训练过程中的 loss 轨迹;observational scaling law 尝试从公开模型而非自训模型中拟合规律。曲线越复杂,越要追问:复杂度带来的是解释力,还是过拟合?
代表论文路线图
第一站:Kaplan scaling laws。
2020 年 Scaling Laws for Neural Language Models 系统研究语言模型 cross-entropy loss 如何随参数量、数据量和训练计算量变化。它的重要性不在某个具体指数,而在研究范式:训练一族模型、跨尺度拟合、用小规模趋势指导大规模预算。
第二站:Chinchilla compute-optimal scaling。
2022 年 Training Compute-Optimal Large Language Models 重新估计参数与 token 的分配关系。论文通过 400 多个模型的实验指出,在固定训练 compute 下,许多当时的大模型相对“参数过多、数据不足”;Chinchilla 用 70B 参数和更多训练 token 与 Gopher 使用相近训练 compute,报告了更好的整体表现。对科研读者来说,重点是“预算分配”而不是“70B 这个数字”。
第三站:数据受限与重复数据。
Muennighoff 等人的 Scaling Data-Constrained Language Models 从 2023 年 arXiv 到 2025 年 JMLR 版本持续完善,研究高质量文本可能有限时,重复数据、代码数据、过滤策略和过量参数如何影响 compute optimality。它提醒我们:D 不是一个无穷可扩展的干净变量,数据来源和重复次数会改变 scaling law 的含义。
第四站:emergent abilities 的争议。
Wei 等人的 2022 年 TMLR 论文讨论了大模型中看似在某个规模后突然出现的能力;Schaeffer、Miranda 和 Koyejo 在 NeurIPS 2023 论文中指出,一些“涌现”可能来自 metric choice,例如非连续或阈值化指标会把平滑提升显示成突变。2025 年的 emergent abilities survey 又把争议扩展到 reasoning、quantization、prompting 和安全问题。读这一支线的重点是:不要把曲线形状和能力机制混为一谈。
第五站:多模态、多语言和更宽的 scaling。
Generative mixed-modal scaling laws 把文本、图像、语音、代码等离散 token 放进统一生成建模框架,讨论模态间竞争和协同;multilingual scaling laws 则研究多语言预训练中的 sampling ratio 与语言家族表现。这类论文说明,D 不只是“更多 token”,还包括数据混合比例、模态结构和任务分布。
第六站:post-training 与 test-time scaling。
2024 年以来,alignment 和 reasoning 方向把 scaling 从 pre-training 扩展到 reward optimization、DPO 类直接对齐、SFT/RLxF/test-time compute。ACL 2025 的 post-training scaling survey 和 2025 年 test-time scaling survey 都说明:今天的 scaling 不再只发生在预训练阶段,也发生在偏好数据、采样数量、搜索深度、反思轮次和工具调用过程中。
第七站:统一与动态 scaling law。
Temporal scaling law 关注训练过程中 test loss 随 step 的变化,并在 2025 年 EMNLP 版本中强调 token position 级别的动态;2026 年 Unified Neural Scaling Laws 试图把参数、数据、训练步数、推理步数、compute 和超参放进同一个函数形式。对读者来说,这类工作适合放在后半程读,因为它们假设你已经理解传统幂律的边界。
关键论文精读
1. Kaplan:读“可预测性”的前提
Kaplan 论文的精读重点是实验设计。作者不是训练一个大模型后画图,而是训练多个尺度的模型,在参数量、数据量和计算量上做系统 sweep。你要问:模型族是否足够一致?loss 是否在同一验证分布上测?拟合是否跨越足够数量级?是否区分了 undertrained、overtrained 和 data-limited 区域?
这篇论文适合训练你读 log-log 图。不要只看曲线漂亮,要看每个点代表什么实验、误差来自哪里、哪些点没有参与拟合、外推目标离已有数据有多远。
2. Chinchilla:读“预算分配”而不是冠军模型
Chinchilla 的核心问题是:给定固定训练 FLOPs,应该增大 N 还是增大 D?论文的答案推动了后续 LLM 训练从“堆参数”转向“参数和 token 更平衡”的配方。精读时建议把 Gopher、GPT-3、Chinchilla 放在参数-token 平面上,而不是只比较 benchmark 表。
一个容易忽略的点是:compute-optimal 是针对训练 loss 和给定计算预算的概念,不等于任意下游任务、任意推理成本、任意部署环境都最优。小模型训练更多 token,可能降低推理成本;但如果任务依赖长程推理、工具使用或多模态能力,还需要额外证据。
3. Data-constrained:读“数据不是免费变量”
数据受限 scaling law 很适合研究生精读,因为它把一个真实问题具体化:如果独立高质量文本不够了,重复数据是否还能继续带来收益?论文报告在一定重复轮次内损失变化很小,但更多重复后新增 compute 的价值会衰减,并公开了 datablations 相关模型和数据。
复现时不要追求 900B token 级别实验。可以用小语料构造 unique token、2 epoch、4 epoch、8 epoch、代码数据增强和弱过滤版本,观察 validation loss 与 memorization 指标。关键是记录“重复”如何定义,以及 eval set 是否和训练语料隔离。
4. Emergence:读指标,不要只读故事
Emergent abilities 论文很吸引人,因为它暗示模型规模可能带来质变。但科研训练要把问题拆开:能力是否真的不存在于小模型,还是小模型在连续指标上已经逐步改善?如果用 exact match、pass/fail 或超过阈值才算成功,曲线可能自然显得突变;如果换成 token-level probability、partial credit 或 calibrated score,可能变得平滑。
因此读 emergence 论文要做一个检查清单:任务是否足够难?指标是否连续?prompt 是否统一?样本量是否足够?是否报告置信区间?是否在多个模型族和数据源上复现?是否可能存在 benchmark contamination?
5. Post-training 与 test-time:读新的“规模轴”
2025 年以后,“scale”越来越多地指向预训练之外:SFT 数据规模、偏好数据规模、reward model 参数量、DPO/RL 优化强度、best-of-n 样本数、search depth、self-reflection 轮次、tool-use rollout 数量。它们不一定遵循和 pre-training 相同的幂律。
这里的核心训练是区分三种 compute:训练 compute、后训练 compute、推理 compute。一个方法可能训练便宜但推理贵,也可能通过更多 test-time compute 换取更高 accuracy。读这类论文时,表格里必须补上 latency、token usage、失败率和成本,而不只是最终分数。
方法与实验对比表
| 论文/资料 | 重点读什么 | 主要变量 | 最小复现实验 | 主要风险 |
|---|---|---|---|---|
| Scaling Laws for Neural Language Models | loss 与 N/D/C 的幂律拟合 | 参数、token、FLOPs、loss | 训练 10M-100M 小 LM,拟合 validation loss | 外推过远,忽略数据质量 |
| Chinchilla | 固定 compute 下的参数-token 分配 | N、D、训练预算 | 同一预算下比较大 N 少 token vs 小 N 多 token | 把 compute-optimal 误解成所有任务最优 |
| Scaling Data-Constrained LMs | 数据重复和数据稀缺 | unique token、重复轮次、过滤 | 小语料重复训练,记录 loss 与记忆化 | eval 泄漏、重复定义不清 |
| Emergent Abilities / Mirage | 涌现是否来自指标 | model scale、metric、threshold | 同一输出用连续与离散指标重评估 | 把指标突变当机制突变 |
| Mixed-modal / Multilingual Scaling | 数据混合如何影响 scaling | 模态、语言家族、sampling ratio | 小型多语言语料调整采样比例 | 不同语料质量混入结论 |
| Post-training / Test-time Scaling | 预训练之后的规模轴 | SFT/RL/TTC、采样数、搜索深度 | best-of-n 或 self-consistency 成本-收益曲线 | 忽略推理成本和失败样本 |
| Temporal / Unified Scaling Laws | 动态过程和多变量统一拟合 | step、inference step、超参 | 保存中间 checkpoint 拟合 loss trajectory | 函数形式复杂导致过拟合 |
复现建议
如果你没有大规模算力,可以做三个小而可靠的训练:
实验一:小型 LM 的 loss scaling。
选一个干净小语料,例如 TinyStories、WikiText 或自建英文/中文语料,训练 4 到 6 个 decoder-only 模型。控制 tokenizer、训练 token、batch size 和学习率,记录 validation loss。目标不是得到通用指数,而是学会如何构造 scale sweep 和 log-log 图。
实验二:compute 分配对比。
固定总训练 token 或近似 FLOPs,比较“更大模型训练更少步”和“更小模型训练更多 token”。报告参数量、实际 tokens、wall-clock、显存、最终 loss 和少量下游 probe。重点观察是否存在 undertrained 现象。
实验三:emergence metric audit。
找一个小推理任务或代码任务,用同一批模型输出,分别计算 exact match、partial credit、token probability、pass@k 和人工检查标签。看所谓“突然出现”是否仍然存在。这个实验非常适合写成 reproduction report。
每次复现都要保存:
- 代码 commit 或压缩包 hash。
- 数据来源、版本、去重方式、训练/验证切分。
- 模型 config:层数、hidden size、head 数、参数量计算方式。
- 训练预算:token 数、batch size、学习率、warmup、precision、硬件。
- 拟合脚本:函数形式、参与拟合的数据点、held-out scale。
- 图表:log-log loss curve、残差图、误差条、外推区间。
- 负结果:loss spike、过拟合、重复数据收益消失、指标不稳定。
常见误区
误区一:把 scaling law 当自然定律。
它是经验规律,依赖模型族、数据、训练配方、指标和拟合区间。换架构、换数据、换 tokenizer,都可能改变系数甚至曲线形态。
误区二:只看参数量。
现代模型比较必须同时看参数、激活参数、训练 token、数据质量、上下文长度、后训练和推理预算。只说“某模型更大”没有科研信息量。
误区三:把 loss 直接等同于能力。
Cross-entropy 是基础指标,但下游 reasoning、coding、tool use、安全拒答和多模态推理不一定按同一斜率改善。
误区四:看到 emergence 就停止追问。
真正的问题不是“有没有涌现”这个标签,而是任务、指标、模型族和数据是否支持“不可由小尺度趋势预测”的强结论。
误区五:忽略成本维度。
Test-time scaling 可能用更多采样和搜索换分数;如果不报告 token 成本、latency 和失败模式,结论对复现和科研选题都不完整。
适合研究生继续做的选题
- 中文小语料 scaling law 复现:用 10M-200M 参数模型比较中文新闻、百科、代码混合比例对 loss 的影响。
- 数据重复的边界实验:固定 unique token,系统改变重复轮次,测 validation loss、近邻记忆和生成重复率。
- emergence 指标审计工具:把 exact match、partial credit、log probability 和 confidence interval 自动放进同一报告。
- 小模型 compute-optimal 配方搜索:在固定 GPU 小时内寻找 N/D 分配,并比较不同 tokenizer 的影响。
- post-training scaling 的成本曲线:比较 SFT 数据量、DPO epoch、best-of-n 和 self-consistency 的收益递减点。
- 多语言 sampling ratio 复现:用低资源语言小语料测试 sampling ratio 是否能从小模型外推到较大模型。
总结
Scaling Laws 是大模型科研中少数能把“昂贵直觉”变成“可检验预测”的工具。读这条路线时,要从 Kaplan 的 loss 幂律开始,理解 N、D、C 与 loss 的基本关系;再读 Chinchilla,理解固定 compute 下的参数-token 分配;接着读数据受限、多模态、多语言、emergence 争议和 post-training/test-time scaling,看到“规模”这个概念如何从预训练扩展到数据混合、指标选择和推理计算。
对研究生来说,最重要的训练不是背下某个 scaling 指数,而是学会设计 scale sweep、控制变量、画 log-log 图、检查残差、标出外推范围,并诚实报告负结果。能做到这些,Scaling Laws 就不只是大厂训练前的预算工具,也会成为你形成研究问题和复现能力的基本方法。
参考资料
检索日期:2026-08-02。以下优先列出论文、会议页面、官方仓库或官方出版页面;模型规模、benchmark 数字、代码仓库状态、数据集版本等易变化信息,投稿或发布前建议再次核验。
- Kaplan et al., 2020, Scaling Laws for Neural Language Models, arXiv: https://arxiv.org/abs/2001.08361
- Hoffmann et al., 2022, Training Compute-Optimal Large Language Models, arXiv: https://arxiv.org/abs/2203.15556
- Google DeepMind, 2022, An empirical analysis of compute-optimal large language model training: https://deepmind.google/blog/an-empirical-analysis-of-compute-optimal-large-language-model-training/
- Wei et al., 2022, Emergent Abilities of Large Language Models, arXiv / TMLR: https://arxiv.org/abs/2206.07682
- Schaeffer, Miranda, Koyejo, 2023, Are Emergent Abilities of Large Language Models a Mirage?, NeurIPS: https://proceedings.neurips.cc/paper_files/paper/2023/hash/adc98a266f45005c403b8311ca7e8bd7-Abstract-Conference.html
- Muennighoff et al., 2023/2025, Scaling Data-Constrained Language Models, arXiv: https://arxiv.org/abs/2305.16264
- Muennighoff et al., 2025, JMLR version: https://jmlr.org/papers/v26/24-1000.html
- Hugging Face datablations repository: https://github.com/huggingface/datablations
- Caballero et al., 2023, Broken Neural Scaling Laws, arXiv / ICLR: https://arxiv.org/abs/2210.14891
- Aghajanyan et al., 2023, Scaling Laws for Generative Mixed-Modal Language Models, arXiv: https://arxiv.org/abs/2301.03728
- Gao, Schulman, Hilton, 2023, Scaling Laws for Reward Model Overoptimization, ICML: https://icml.cc/virtual/2023/poster/24924
- Rafailov et al., 2024, Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms, arXiv / NeurIPS 2024: https://arxiv.org/abs/2406.02900
- Ruan, Maddison, Hashimoto, 2024, Observational Scaling Laws and the Predictability of Language Model Performance, arXiv: https://arxiv.org/abs/2405.10938
- He et al., 2024, Scaling Laws for Multilingual Language Models, arXiv: https://arxiv.org/abs/2410.12883
- Xiong et al., 2024/2025, Temporal Scaling Law for Large Language Models, arXiv / EMNLP 2025: https://arxiv.org/abs/2404.17785
- Lai et al., 2025, A Survey of Post-Training Scaling in Large Language Models, ACL Anthology: https://aclanthology.org/2025.acl-long.140/
- Zhang et al., 2025, A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?, arXiv: https://arxiv.org/abs/2503.24235
- Berti, Giorgi, Kasneci, 2025, Emergent Abilities in Large Language Models: A Survey, arXiv: https://arxiv.org/abs/2503.05788
- Caballero et al., 2026, Unified Neural Scaling Laws, arXiv: https://arxiv.org/abs/2605.26248