
系列:AI 论文盘点 / 技术趋势,第二轮:2026 AI 系统与 Agent 基础设施专题
日期:2026-07-05
适合读者:研究生、做模型训练/评测的工程师、关注开源 LLM recipe 的技术读者
检索日期:2026-07-05
摘要
2025 到 2026 年,合成数据不再只是“缺标注时的补丁”,而正在成为 post-training 的核心生产资料。过去的经典路线是知识蒸馏:用大模型或模型集成的输出训练更小、更便宜的学生模型。LLM 时代把这个思路扩展成更复杂的数据飞轮:生产系统日志、人工偏好、公开题库、工具执行结果和模型自我生成的轨迹,被组织成 SFT、DPO、RLHF/RLAIF、RLVR、拒绝采样、验证器过滤和蒸馏数据,持续喂给下一代模型。
这篇文章的核心判断是:合成数据真正有价值的地方不在于“无限生成”,而在于“可验证、可追溯、可迭代”。DeepSeek-R1、Tulu 3、Llama 4、Qwen3、Magpie、UltraFeedback、OpenThoughts 等工作都说明,前沿能力越来越依赖数据管线本身:谁能定义任务分布、构造难例、过滤低质量样本、控制污染、把评测反馈回流到训练,谁就能把一次模型发布变成持续改进的工程系统。
目录
- 研究背景:为什么后训练开始围绕数据飞轮重组
- 近一年路线图:从 instruction data 到 reasoning data
- 代表论文分组解读
- 方法对比表
- 关键技术趋势
- 工程落地启发
- 局限与争议
- 接下来值得关注的问题
- 总结
- 参考资料
1. 研究背景:为什么后训练开始围绕数据飞轮重组
预训练阶段解决的是“把世界压进参数”,post-training 解决的是“让模型按人和任务需要工作”。在 GPT-3、InstructGPT、ChatGPT 之后,大家熟悉的流程大致是:先用人工示范做 supervised fine-tuning,再收集偏好数据训练奖励模型,最后用 PPO 之类的强化学习优化策略。这个范式证明了一个重要事实:模型规模并不自动等于可用产品,行为对齐和任务能力很大一部分来自训练后的数据与反馈。
合成数据切入的是这个瓶颈。人工写 prompt、写高质量回答、标 preference、标安全边界,成本高、速度慢、覆盖范围有限。Self-Instruct 的贡献在于把“生成指令、生成输入输出、过滤、再微调”做成自动流程;UltraFeedback 把人类反馈替换为大模型反馈,强调 scale 和 diversity;Magpie 进一步利用已对齐模型的聊天模板,从“空上下文”中抽取用户问题和回答。到 2025 年,DeepSeek-R1 和一批 reasoning dataset 工作把这条路推进到推理轨迹、可验证答案、代码执行和多轮难例筛选。
但“模型生成数据训练模型”不是免费的午餐。合成数据会带来分布收缩、模式坍缩、风格同质化、错误自我强化、benchmark 污染和版权/许可风险。2024 年 Nature 关于 model collapse 的工作提醒我们,如果新数据只是递归替换真实数据,尾部分布和稀有模式可能逐步丢失;后续也有工作指出,如果真实数据持续累积、合成数据经过验证,风险并非不可控。工程上更合理的表述不是“用 AI 数据替代人类数据”,而是“用模型把昂贵的人类信号放大,并用验证和审计约束放大过程”。
2. 近一年路线图:从 instruction data 到 reasoning data
2022-2023:指令生成和偏好学习成为基础设施。 InstructGPT 建立了 SFT + preference + RLHF 的产品化路径;Self-Instruct 证明少量种子任务可以引导模型合成大量指令数据;DPO 把偏好优化改写成更易训练的分类式目标;UltraFeedback 用 GPT-4 级别反馈构造大规模 AI preference 数据。这个阶段的关键词是“对齐聊天行为”。
2024:数据合成开始关注多样性、角色和评测污染。 Magpie、Persona Hub、instruction backtranslation 等工作把 synthetic instruction 的问题从“生成更多”推进到“覆盖更多任务视角”。Tulu 3 的开放 recipe 尤其重要,它把数据集、代码、训练 recipe、评测和去污染放到一起讨论,说明 post-training 不是单一算法,而是数据治理工程。
2025:reasoning data 与 verifiable reward 成为主线。 DeepSeek-R1 把大规模 RL、冷启动数据、拒绝采样、规则奖励和蒸馏小模型连成一条路线。Tulu 3 使用 SFT、DPO 和 RLVR,强调可验证奖励;LIMO 反过来挑战“数据越多越好”的直觉,认为在强 base model 上,少量高质量认知模板也可能激发推理能力;OpenThoughts 系列把公开 reasoning data recipe 做成可复现实验对象。
2026:数据飞轮开始与产品日志、Agent 环境和工具验证合流。 这部分仍在快速变化,许多 proprietary 系统不公开细节,以下判断标注为“待人工核验”:前沿系统倾向于把线上失败案例、工具调用日志、自动 red team、代码执行结果、搜索/浏览轨迹和用户反馈回流到训练与评测。合成数据的重点从“文本样本”扩展为“带环境、带工具、带验证器的经验样本”。

3. 代表论文分组解读
3.1 知识蒸馏:从压缩模型到迁移推理行为
Hinton、Vinyals 和 Dean 在 2015 年系统化了知识蒸馏:把多个模型或大模型的预测分布压缩到单个模型中,以降低部署成本。LLM 时代的蒸馏不再只是 soft label 压缩,还包括指令风格、推理轨迹、工具调用格式、拒绝策略和偏好排序的迁移。
DeepSeek-R1 是 2025 年最有代表性的案例之一。arXiv 页面显示,该论文 2025-01-22 首次提交,2026-01-04 修订,并发表在 Nature 2025。摘要强调纯 RL 可激发 self-reflection、verification 和 dynamic strategy adaptation,并且这些推理模式可以用于增强小模型。这里重要的不是某个单点 benchmark,而是“强 reasoning teacher -> 合成 reasoning traces -> 小模型 SFT/蒸馏”的可复制产业路径。
Meta 在 Llama 4 官方博客中也把 teacher model 放到核心位置:Llama 4 Behemoth 被描述为 Scout/Maverick 的教师模型,Maverick 通过 co-distillation 获得质量提升;博客还提到动态权重的蒸馏 loss、轻量 SFT、online RL、轻量 DPO,以及用模型 judge 移除容易样本。这些细节说明,现代蒸馏已经嵌入 pre-training、mid-training 和 post-training 的多个阶段,而不是训练结束后的压缩步骤。
3.2 指令合成:从 Self-Instruct 到 Magpie 和 Persona Hub
Self-Instruct 的流程很朴素:用语言模型生成 instruction、input、output,过滤无效或相似样本,再用这些样本微调原模型。它的价值在于把“任务设计”自动化,使研究者不必为每个新能力都从零标注大量数据。
Magpie 的思路更激进:利用已对齐模型聊天模板中的用户消息位置,让模型自动生成用户查询和回答。论文称其生成了 4M instruction-response,并选择 300K 高质量样本用于训练与评测。它提醒我们,很多闭源/半开源 instruct model 中隐含着一套“用户分布”,可以通过提示方式被抽取出来。不过,这类方法也带来许可、模型使用条款和数据来源审计问题,实际落地时不能只看效果。
Persona Hub 则从 diversity 入手,提出用大规模 persona 作为数据合成的视角载体。对工程系统而言,这个思想比“10 亿 persona”这个数字更重要:如果合成数据只来自少数模板,很容易产生风格和任务分布同质化;如果能显式管理 persona、场景、难度、语言、领域和安全等级,就能把数据覆盖变成可调参数。
3.3 AI feedback 与偏好数据:从 RLHF 到 RLAIF/DPO
InstructGPT 的经典流程依赖人工示范和人工排序;Constitutional AI 把部分监督替换为规则列表与 AI feedback;UltraFeedback 把 GPT-4 反馈扩展到大规模偏好数据;DPO 降低了 preference optimization 的工程门槛。它们共同推动了一个变化:偏好数据本身可以被生产、过滤、去偏和版本化。
这里需要小心两点。第一,AI feedback 不是客观真理,它继承 judge model 的偏见、盲区和安全策略。第二,偏好数据会强烈塑造模型风格,过度优化可能让模型变得啰嗦、保守、迎合或失去探索性。Llama 4 官方博客中提到 SFT 和 DPO 可能 over-constrain model,因而在 online RL 前减少 easy data,这个经验很值得工程团队重视。
3.4 Reasoning data:可验证答案改变数据生产方式
推理数据的关键不是“让模型写长思维链”,而是“让训练信号可验证”。数学可以比对最终答案,代码可以跑测试,形式化证明可以调用 proof checker,部分科学问题可以用模拟器或检索证据校验。DeepSeek-R1、Tulu 3 的 RLVR、OpenThoughts 的数据 recipe 都把可验证性放在中心。
OpenThoughts 2025 年论文的目标就是公开 reasoning model 的数据 recipe。摘要称 OpenThoughts2-1M 训练出的 OpenThinker2-32B 可匹配 DeepSeek-R1-Distill-32B 的标准 reasoning benchmark,并通过 1000+ controlled experiments 改进数据生成流水线。无论这些具体数字未来是否被新模型刷新,它代表的方向非常清楚:公开社区开始把“数据配方”当作模型能力的可复现实验对象。
LIMO 则提供了另一个角度。论文提出,在知识已经被 base model 编码的前提下,少量精心设计的 reasoning demonstrations 可能足以充当认知模板。它提醒我们,合成数据飞轮不能只追求样本量;数据质量、任务选择、轨迹结构和 base model 已有能力之间存在强相互作用。
3.5 开放 recipe:Tulu 3、Qwen3 与可复现后训练
Tulu 3 的重要性在于“把完整 recipe 公开”。arXiv 页面显示,它发布模型、数据、代码和训练配方,训练算法包括 SFT、DPO 和 RLVR,并引入开发集/未见评测、标准 benchmark 实现和去污染。对研究者来说,这比单纯发布一个高分模型更有价值,因为它让后训练成为可审计、可对比、可复用的系统。
Qwen3 技术报告则体现了另一个趋势:把 thinking mode 和 non-thinking mode 统一在一个模型系列中,并通过旗舰模型知识降低小模型构建成本。它没有把所有数据细节完全展开,但说明大型模型家族正在把推理模式、蒸馏、小模型效率和多语言覆盖作为同一条产品线设计。
4. 方法对比表
| 方法 | 主要数据来源 | 训练目标 | 优势 | 风险与注意点 |
|---|---|---|---|---|
| SFT on human demonstrations | 人工示范、专家答案、生产案例 | 模仿标准答案格式与行为 | 稳定、易调试、适合冷启动 | 成本高,覆盖受限,容易过拟合模板 |
| Self-Instruct / instruction synthesis | 模型自生成任务与答案 | 扩大指令覆盖 | 低成本扩展任务空间 | 同质化、错误自举、过滤成本高 |
| AI feedback / RLAIF | Judge model 评分、规则原则 | 对齐偏好与安全策略 | 可规模化偏好标注 | judge 偏差、奖励黑客、过度迎合 |
| DPO / preference optimization | chosen/rejected 对 | 直接优化偏好概率 | 比 RLHF 简洁,工程门槛低 | 数据质量决定上限,容易学到风格捷径 |
| RLVR / rule-based reward | 数学答案、代码测试、格式规则 | 优化可验证任务表现 | 反馈明确,可自动化 | 只覆盖可验证子集,可能牺牲开放问答质量 |
| Rejection sampling distillation | Teacher 生成多候选,验证器筛选 | 学习高质量轨迹 | 适合 reasoning/code/math | 算力消耗高,验证器偏差会被放大 |
| Data flywheel | 线上日志、失败案例、评测、合成数据 | 持续闭环改进 | 能跟随真实任务演化 | 隐私、许可、污染、治理复杂 |
5. 关键技术趋势
趋势一:数据从静态数据集变成版本化流水线。 未来论文中“用了某某 dataset”已经不够,真正有信息量的是生成 prompt、teacher 版本、temperature、采样次数、过滤器、去重策略、验证器、污染检测、mixing ratio 和失败样本回流规则。
趋势二:验证器决定合成数据的上限。 在数学、代码、工具调用和科学模拟中,验证器可以把合成样本从“看起来像”提升到“可执行通过”。这也是 reasoning post-training 进展快于开放式写作的一大原因。开放问答、医学建议、法律分析这类任务缺少简单验证器,需要结合检索证据、专家审阅和保守安全策略。
趋势三:教师模型不只是更大,还要更适合作为数据生产者。 好 teacher 应该能生成多样、可验证、解释清楚、符合目标风格的数据;有时一个顶级聊天模型未必是最好的数据生成器。Llama 4 和 DeepSeek-R1 都提示我们,teacher 的能力结构、输出格式和训练阶段会影响 student 的最终行为。
趋势四:小模型能力越来越依赖高质量蒸馏。 边缘部署、企业私有化和低延迟服务都需要 smaller model。蒸馏让小模型获得 reasoning/coding/tool-use 的行为模式,但也会继承 teacher 的错误、安全边界和语言偏好。小模型不是“廉价复制品”,而是需要单独评测和约束的产品。
趋势五:数据治理成为模型能力的一部分。 去重、去污染、版权许可、PII 过滤、安全红队、数据 lineage 和回滚机制不再只是合规附属项。一个不可追溯的数据飞轮很快会把线上 bug、benchmark 泄漏和模型偏见固化到下一轮训练里。
6. 工程落地启发
第一,把合成数据系统拆成可观测组件。至少需要 source registry、prompt template registry、teacher registry、generation jobs、filter jobs、eval jobs、dataset version、training run 和 model card。每个样本最好能追溯到来源、生成参数、过滤原因和使用过的模型版本。
第二,不要把“更多 synthetic data”当成默认优化方向。更可行的做法是按能力缺口生产数据:先从 eval failure、用户投诉、低置信度任务和业务高价值场景中抽样,再决定是人工标注、teacher 蒸馏、检索增强生成、工具验证,还是直接修改产品提示和 guardrail。
第三,建立三层过滤:格式过滤、语义过滤和结果验证。格式过滤保证 JSON、工具调用、引用结构正确;语义过滤检查重复、低信息量、明显幻觉和安全问题;结果验证用 unit test、数学答案、retrieval evidence、专家规则或 judge ensemble 兜底。单一 LLM judge 不应是最后裁判。
第四,训练集和评测集要分权管理。数据飞轮最容易犯的错误是把评测失败样本转成训练数据后,仍然用原评测集汇报进步。正确做法是保留 frozen holdout,给回流样本打标签,使用时间切分或来源切分,必要时做 contamination scan。
第五,把合成数据的“真实数据锚点”制度化。即使大部分样本由模型生成,仍需要持续注入人工专家样本、真实用户授权样本、生产环境错误样本和领域 ground truth。否则数据分布会朝 teacher model 的舒适区收缩。
第六,企业落地时先从可验证任务开始。代码修复、SQL 生成、客服分类、文档抽取、表单校验、知识库问答、策略合规检查都比开放式战略建议更适合构建数据飞轮,因为它们有日志、有验收标准、有错误标签,也更容易做离线回放。
7. 局限与争议
模型坍缩不是口号,但也不是合成数据的必然结局。 递归训练在完全替换真实数据时风险最大;如果真实数据持续累积,并且合成数据经过严格筛选,风险可以被缓解。工程问题在于,很多团队没有足够的 lineage 和检测手段知道自己是否正在递归污染。
合成数据会放大 teacher 的盲点。 如果 teacher 不会某类题,student 也很难从 teacher 输出中学会;如果 teacher 在安全策略、文化背景或语言风格上有偏置,student 会继承甚至强化这些偏置。
推理轨迹的可解释性仍有争议。 训练模型生成长 chain-of-thought 并不等价于获得真实内部推理过程。很多系统会蒸馏 reasoning style,但最终产品可能隐藏或压缩思维链。研究者在比较模型时需要区分“轨迹作为训练信号”和“轨迹作为解释证据”。
benchmark 数字越来越容易被数据飞轮污染。 当数据生成器、过滤器和训练任务都围绕公开 benchmark 迭代时,未见评测和真实任务评测比排行榜更重要。Tulu 3 强调 decontamination 是一个好信号,但行业整体仍缺统一标准。
法律与平台条款风险上升。 用某个商业模型批量生成训练数据,是否允许训练竞争模型,取决于服务条款和数据来源授权。本文不提供法律意见;涉及商业化训练时,必须由法务和数据治理团队核验。
8. 接下来值得关注的问题
- 可验证奖励能否扩展到开放世界任务?数学和代码已经相对清楚,科研、医学、法律、企业决策需要更复杂的 evidence graph 和专家审核。
- 数据飞轮如何处理长期记忆与隐私?Agent 系统会产生大量用户轨迹,哪些可以训练,哪些只能做个性化记忆,哪些必须删除,需要清晰边界。
- 小模型蒸馏会不会成为开源生态的主战场?如果强 teacher 的 reasoning traces 可获得,7B-32B 模型可能在大量垂直任务中达到足够可用。
- 评测是否会从 benchmark-first 转向 replay-first?真实系统更需要基于生产日志的离线回放、A/B shadow eval 和风险分层评测。
- 数据 recipe 能否像代码一样复现?未来有价值的开源项目可能不只是权重,而是完整的 data generator、filter、eval harness 和训练脚本。
9. 总结
Synthetic Data、Distillation 和 Post-Training 数据飞轮共同指向一个变化:模型能力越来越像“数据操作系统”的产物。算法名称仍然重要,但决定上限的往往是数据从哪里来、如何生成、如何验证、如何混合、如何回流、如何审计。
对研究者来说,下一步值得关注的是公开 recipe、验证器设计和数据污染控制,而不是单纯比较某个模型在单个榜单上的得分。对工程团队来说,最务实的起点是:围绕一个可验证业务任务,把生产失败样本、teacher 生成、过滤器、离线评测和小模型蒸馏串成闭环。只有当这个闭环可追溯、可回滚、可度量时,合成数据才从“便宜样本”变成真正的模型资产。
参考资料
检索日期均为 2026-07-05。易变化信息如模型版本、官方产品可用性、代码仓库状态和 benchmark 排名,应在发布前再次人工核验。
- Geoffrey Hinton, Oriol Vinyals, Jeff Dean. “Distilling the Knowledge in a Neural Network.” arXiv, 2015. https://arxiv.org/abs/1503.02531
- Long Ouyang et al. “Training language models to follow instructions with human feedback.” arXiv, 2022. https://arxiv.org/abs/2203.02155
- Yizhong Wang et al. “Self-Instruct: Aligning Language Models with Self-Generated Instructions.” arXiv, ACL 2023 version. https://arxiv.org/abs/2212.10560
- Yuntao Bai et al. “Constitutional AI: Harmlessness from AI Feedback.” arXiv, 2022. https://arxiv.org/abs/2212.08073
- Rafael Rafailov et al. “Direct Preference Optimization: Your Language Model is Secretly a Reward Model.” arXiv, 2023. https://arxiv.org/abs/2305.18290
- Ganqu Cui et al. “UltraFeedback: Boosting Language Models with Scaled AI Feedback.” arXiv, ICML 2024 version. https://arxiv.org/abs/2310.01377
- Zhangchen Xu et al. “Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing.” arXiv, 2024. https://arxiv.org/abs/2406.08464
- Tao Ge et al. “Scaling Synthetic Data Creation with 1,000,000,000 Personas.” arXiv, 2024. https://arxiv.org/abs/2406.20094
- Nathan Lambert et al. “Tulu 3: Pushing Frontiers in Open Language Model Post-Training.” arXiv, v5 revised 2025-04-14. https://arxiv.org/abs/2411.15124
- DeepSeek-AI et al. “DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.” arXiv, first submitted 2025-01-22, revised 2026-01-04. https://arxiv.org/abs/2501.12948
- Yixin Ye et al. “LIMO: Less is More for Reasoning.” arXiv, 2025. https://arxiv.org/abs/2502.03387
- Ke Wang et al. “A Survey on Data Synthesis and Augmentation for Large Language Models.” arXiv, 2024. https://arxiv.org/abs/2410.12896
- Mihai Nadas, Laura Diosan, Andreea Tomescu. “Synthetic Data Generation Using Large Language Models: Advances in Text and Code.” arXiv, 2025. https://arxiv.org/abs/2503.14023
- Ilia Shumailov et al. “The Curse of Recursion: Training on Generated Data Makes Models Forget.” arXiv, 2023. https://arxiv.org/abs/2305.17493
- Matthias Gerstgrasser et al. “Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data.” arXiv, 2024. https://arxiv.org/abs/2404.01413
- Etash Guha et al. “OpenThoughts: Data Recipes for Reasoning Models.” arXiv, 2025. https://arxiv.org/abs/2506.04178
- An Yang et al. “Qwen3 Technical Report.” arXiv, 2025. https://arxiv.org/abs/2505.09388
- Meta AI. “The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation.” Official blog, 2025-04-05. https://ai.meta.com/blog/llama-4-multimodal-intelligence/
- OpenAI Developers. “Supervised fine-tuning / Distilling from a larger model.” Official API docs, accessed 2026-07-05. https://platform.openai.com/docs/guides/distillation