
系列:AI 论文精读与复现训练营
日期:2026-08-20
适合读者:研究生、科研新人、有工程背景的 AI 读者
检索日期:2026-08-20
摘要
很多研究生读完十篇论文后,得到的不是一个研究 proposal,而是一份更长的 related work:谁做了什么、用了什么模型、在哪些 benchmark 上更好。问题在于,proposal 不是文献综述的自然延长线。它需要把论文压缩成一个可回答的问题、一个可被证伪的假设、一组有因果指向的方法选择,以及一套资源可承受的实验计划。
本文给出一个面向 AI 研究训练的工作流:如何从 10 篇论文出发,画出问题地图,构造 gap matrix,筛选研究假设,设计最小实验计划,最后写成 2-4 页 pre-proposal。文章参考了 DARPA Heilmeier Catechism、NSF proposal preparation guidance、ICLR 2026 author guidance,也结合 2025-2026 年关于 LLM research ideation、AI Scientist、PaperBench、LiveIdeaBench、InciteResearch 和 proposal writing 的最新资料。重点不是让 LLM 替你“生成选题”,而是训练你把论文读成研究决策。
目录
- 为什么这个主题重要
- 10 篇论文不是数量要求,而是证据边界
- 核心流程:从 paper set 到 proposal
- 代表论文与资料路线图
- 关键论文精读:AI 能帮到哪里,帮不到哪里
- Gap Matrix:把阅读笔记变成研究判断
- Proposal 草稿结构
- 复现与预实验建议
- 常见误区
- 适合研究生继续做的选题
- 总结与参考资料
为什么这个主题重要
论文精读训练的终点不是“我知道这个方向有哪些工作”,而是“我能提出一个小而清楚、可被检验、可在现有资源下执行的问题”。这正是从阅读者转向研究者的关键台阶。
在 AI 方向,这个台阶尤其难。第一,论文更新太快。一个 proposal 如果只停留在“改进某个 2024 baseline”,可能在开题前就被 2025-2026 的模型或 benchmark 吞掉。第二,很多论文把贡献包装成系统工程:数据、模型、prompt、后处理、训练 recipe 和评测策略纠缠在一起,读者很难判断真正有效的变量。第三,LLM 已经开始参与文献检索、idea generation、proposal writing 和实验执行,但最新研究也反复提醒我们:模型能给出看似合理的 idea,却容易在可行性、引用准确性、多样性和真实执行上出问题。
DARPA 的 Heilmeier Catechism 很适合作为 proposal 的最低门槛:你要做什么?今天怎么做,限制在哪里?你的新方法是什么,为什么可能成功?谁在乎?风险、成本、时间和中期/最终验收是什么?NSF 的 proposal guidance 也把核心问题压缩成类似结构:想做什么,为什么做,如何做,如何知道成功,以及成功后有什么价值。对研究生来说,这些问题比“标题是否酷”“模型是否新”更重要。
10 篇论文不是数量要求,而是证据边界
“从 10 篇论文形成 proposal”不等于随机读 10 篇。更好的构成是:
- 2 篇奠基论文:定义任务、范式或核心假设。
- 3 篇最近强 baseline:代表当前主流做法,优先选 2025-2026 年或仍被当前工作使用的技术报告。
- 2 篇反例或负结果:指出 benchmark、复现、泛化或机制解释的问题。
- 2 篇邻近分支:提供可迁移方法,但不是同一套路的简单堆叠。
- 1 篇综述、系统论文或 benchmark 论文:帮助你理解评价边界。
这 10 篇论文的目的不是覆盖所有相关工作,而是建立一个“足够做判断”的证据边界。读完后,你应该能回答四个问题:这个方向的核心变量是什么?哪些结论已经被反复验证?哪些结论只在狭窄设置中成立?如果我只能做一个月预实验,最值得检验的缺口是什么?
如果十篇论文全是同一实验套路的 SOTA paper,你很容易得到一个平庸 proposal:换模型、换数据、换 loss、再跑一次 leaderboard。真正有训练价值的 paper set 应该包含张力:一个方法声称有效,另一个复现研究质疑它;一个 benchmark 流行,另一个 contamination 或 leakage 分析指出风险;一个 agent 框架自动生成实验,另一个评测显示 agent 仍远低于人类复现能力。
核心流程:从 paper set 到 proposal

第一步,做 problem map。不要先按论文时间线排,而要按“它们认为问题在哪里”排。每篇论文都填三句话:它要解决的失败模式是什么?它把失败归因于什么变量?它认为成功应该如何测量?例如在 LLM research ideation 方向,有的论文把问题定义为 novelty,有的定义为 feasibility,有的定义为 groundedness,有的定义为执行成功率。它们表面上都在做“生成研究想法”,但问题定义并不相同。
第二步,做 claim extraction。把每篇论文的核心 claim 写成可验证句子,而不是摘要句。错误写法是“提出一个自动科研系统”。更好的写法是“在给定模板和代码库的条件下,系统能完成 idea generation、实验迭代、写作和自动 review,但产出论文仍存在解释和可靠性问题”。claim 一旦被写成可验证句子,就能进入下一步比较。
第三步,做 gap matrix。行是论文或方法,列是问题定义、假设、数据/任务、模型规模、实验变量、metric、baseline、复现材料、失败案例、外部有效性。你要找的 gap 不是“没人做过 X”,而是“现有证据不能支持某个重要判断”。比如:idea generation 论文可能证明生成 idea 新颖,但没有证明它们能被低成本实验验证;proposal writing 论文可能改进文本质量,却仍要单独核查 reference validity;PaperBench 显示 AI agent 复现复杂 AI 论文仍困难,这会限制全自动 proposal-to-paper 系统的现实可信度。
第四步,生成 3 个候选假设。每个假设都必须包含方向、机制和可证伪条件。弱假设是“加入检索会提升研究 proposal 质量”。强假设是“在从 10 篇论文生成 AI research proposal 的任务中,把文献证据显式压缩为 gap matrix,比直接 RAG 生成 proposal 更能提升 feasibility 和 reference validity;若人工评审或执行预实验未显示显著差异,则假设不成立。”
第五步,设计最小实验计划。proposal 不是要把所有实验列满,而是要证明你知道第一块证据应该怎么拿。最小实验通常包括一个主对比、一个 ablation、一个失败案例分析和一个人工核验环节。对于 AI 论文训练,尤其要写清楚 seed、数据版本、模型版本、prompt、推理预算、评分规则和日志保存方式。
第六步,写 pre-proposal。先写 2-4 页,不要直接写 15 页。顺序是:问题、已有证据、核心 gap、假设、方法、实验、风险、时间表。只要这几页讲不清,长 proposal 只会把问题藏起来。
代表论文与资料路线图
| 类别 | 代表资料 | 对 proposal 训练的启发 |
|---|---|---|
| Proposal 判断框架 | DARPA Heilmeier Catechism;NSF Preparing Your Proposal | 把选题压成目标、现状、创新、价值、风险、成本、验收 |
| 顶会写作规范 | ICLR 2026 Author Guide;NeurIPS 2026 review guidance | 关注贡献类型、可复现性、匿名代码、伦理和实验支撑 |
| AI research ideation | Si et al., ICLR 2025;Measuring the Gap Between Human and LLM Research Ideas, 2026 | LLM idea 可有新颖性,但 feasibility、diversity 和 human taste gap 需要单独评估 |
| 自动科研系统 | The AI Scientist / AI Scientist-v2;PaperBench | 自动生成和复现仍受执行、代码、实验和评审可靠性约束 |
| Idea benchmark | LiveIdeaBench;InciteResearch / TF-Bench | 科学创意评价要拆成 originality、feasibility、flexibility、clarity 等维度 |
| Proposal writing | Assisting Research Proposal Writing with LLMs, 2025 | 文本质量和引用真实性应分开评估,迭代提示不能替代人工核验 |
关键论文精读:AI 能帮到哪里,帮不到哪里
Si、Yang 和 Hashimoto 的 ICLR 2025 研究是读这个主题的入口。它招募 100 多位 NLP 研究者参与 idea 写作与盲审,发现 LLM 生成 idea 在新颖性评价上可以超过人类专家,但可行性略弱,并暴露出 LLM self-evaluation 失败和生成多样性不足的问题。对 proposal 训练的直接启发是:不要把“新颖”当作唯一目标。一个研究生 proposal 如果只有 novelty,没有可执行实验和失败标准,很容易变成漂亮但不可验证的空想。
2026 年的 Measuring the Gap Between Human and LLM Research Ideas 更进一步。它不只评价单个 idea,而是比较人类论文与 LLM idea 的分布差异。论文指出,LLM idea 往往更集中在 bridge-like opportunity 和 synthesis method 上,而人类研究 idea 的分布更分散。这个结论对使用 LLM 辅助选题的人很重要:模型可能不断给你“把 A 和 B 结合”的建议,但真正的研究机会也可能来自反常现象、测量缺口、负结果、机制解释或约束条件变化。
The AI Scientist 和 AI Scientist-v2 展示了 agentic research pipeline 的可能性:生成假设、写代码、跑实验、分析结果和写论文。AI Scientist-v2 的 GitHub README 也明确提醒,系统会执行 LLM 写出的代码,需要在受控 sandbox 中运行,并且 v2 不一定比模板化 v1 产出更好,特别是在有强模板的任务上。这对 proposal 设计是一条硬约束:自动化可以帮助探索,但 proposal 仍要写清楚哪些步骤由人核验、哪些实验可重复、哪些失败会触发 pivot。
PaperBench 则提供了冷静的一面。OpenAI 在 2025 年发布的 PaperBench 要求 agent 从零复现 20 篇 ICML 2024 Spotlight / Oral 论文,并用作者共同制定的层级 rubric 评分。公开结果显示,当时最佳 tested agent 仍没有超过人类基线。这里不应只关注分数,而要学习它的 rubric 思想:一个 research plan 不能只写“复现论文”,而要把复现拆成可评分任务,例如数据准备、模型实现、训练目标、核心实验、ablation、图表和结论核验。
LiveIdeaBench 和 InciteResearch 适合提醒我们:proposal 不是简单的 convergent reasoning。LiveIdeaBench 用 originality、feasibility、fluency、flexibility 和 clarity 等维度衡量 scientific idea generation,说明科学创意与一般智能分数并不等价。InciteResearch 则强调许多研究起点并不是清楚问题,而是“隐性摩擦”:你觉得某个方向不对劲,但还说不出问题。这正是读 10 篇论文的意义:不是马上生成答案,而是把模糊不满变成可检查的研究问题。
最后,Assisting Research Proposal Writing with LLMs 直接讨论 proposal writing。它把内容质量与 reference validity 分开评估,并用迭代 prompting 改善写作质量、减少引用错误。这个设定很实用:当你用 LLM 辅助 proposal 草稿时,应至少保留两张表,一张评估论证结构,一张逐条核查引用是否真实、是否支持对应句子。
Gap Matrix:把阅读笔记变成研究判断
下面是一个可直接复用的 gap matrix 模板。
| 字段 | 要填什么 | 判断标准 |
|---|---|---|
| Problem | 论文解决的具体失败模式 | 是否比“大模型不够好”更具体 |
| Assumption | 方法成立依赖的前提 | 是否能被实验打破 |
| Intervention | 方法真正改变的变量 | 是否与工程细节混淆 |
| Evidence | 支持 claim 的证据 | 是否包含 baseline、ablation、统计或人工核验 |
| Boundary | 证据适用边界 | 是否说明数据、模型、任务和预算限制 |
| Missing | 仍未回答的问题 | 是否重要且可实验 |
| Feasibility | 你能否在 2-4 周做预实验 | 数据、算力、代码、评测是否可得 |
| Proposal Hook | 可形成的研究假设 | 是否有机制和可证伪条件 |
完成矩阵后,不要急着选“最大”的 gap。研究生训练更适合选择“中等重要、低到中等成本、证据链清楚、能在一个月拿到预实验结果”的 gap。一个小 proposal 的目标不是击败整个领域,而是建立一个能被导师、同学或 reviewer 认真讨论的证据起点。
Proposal 草稿结构
建议先写一页版本:
- 标题:必须包含任务、变量和目标,不要只写一个大方向。
- 问题:用 3-5 句话说明现有方法在哪个具体场景失败。
- 文献证据:列出 10 篇论文如何共同支持这个问题存在。
- 核心 gap:说明现有证据缺什么,不要只说“尚未有人研究”。
- 假设:写成可证伪句子。
- 方法:说明你改变哪个变量,以及为什么这可能解决 gap。
- 实验计划:列 dataset、metric、baseline、ablation、人工核验和日志。
- 风险与替代计划:写清楚失败后如何缩小问题或 pivot。
再扩成 2-4 页版本时,可以增加 related work map、pilot experiment、timeline 和资源预算。参考 NSF 的思路,proposal 应该回答“想做什么、为什么做、如何做、如何知道成功”。参考 DARPA 的思路,还要回答“谁在乎、风险是什么、阶段性考试是什么”。对于 AI 研究训练,阶段性考试可以很具体:两周内复现 baseline;第三周完成主对比;第四周完成 ablation 和 error analysis;若主指标无提升,则转向解释失败原因,而不是继续堆技巧。
复现与预实验建议
第一,先复现一个可信 baseline,而不是先实现你的新方法。baseline 复现失败,通常说明环境、数据、metric 或理解存在问题。这个阶段的日志应该包含 commit、依赖版本、seed、模型 checkpoint、数据 hash、运行命令和异常记录。
第二,把 proposal 的核心假设压成最小干预。例如你的假设是“gap matrix improves proposal feasibility”,就不要同时换模型、换 prompt、换检索库、换评审标准。最小实验可以是:同一组 10 篇论文、同一模型、同一输出格式,对比 direct RAG proposal 与 gap-matrix-first proposal,再由人工 rubric 评估 specificity、feasibility、reference support 和 testability。
第三,保留负结果。很多 proposal 的真正价值不是“方法立刻有效”,而是发现现有 claim 的边界。NeurIPS 2026 等会议已经在贡献类型中给 negative results、concept & feasibility、evaluation analysis 留出空间;只要实验设计严谨,负结果可以成为强选题。
第四,不要把 LLM judge 当最终证据。可以用 LLM 做初筛、结构检查和引用提醒,但 reference validity、实验可执行性和关键 claim 必须人工核验。PaperBench 之所以有训练价值,正是因为它把复现任务拆成层级 rubric,而不是只问模型“这篇复现是否成功”。
常见误区
误区一:把 proposal 写成 related work。Related work 解释过去,proposal 必须押注未来的一个可验证判断。
误区二:把 gap 理解成“没人做过”。很多没人做过的事是不重要、不可能、或做了也没意义。更好的 gap 是“现有证据不足以支持一个重要 claim”。
误区三:只追求 novelty。Si et al. 和后续 ideation 研究都提示,novelty 与 feasibility、diversity、execution success 不是一回事。
误区四:实验计划过大。proposal 的第一阶段不该依赖训练 70B 模型或构建全新 benchmark。先证明关键变量值得研究。
误区五:引用不核验。LLM 生成的 proposal 文字越流畅,越容易掩盖引用错配。引用必须逐条对应 claim。
误区六:没有失败标准。没有失败标准的 proposal 不是研究计划,而是愿望清单。
适合研究生继续做的选题
- Gap-matrix-first proposal writing:比较结构化 gap matrix 与直接 RAG 对 proposal 可行性、引用准确性和可测试性的影响。
- Research idea diversity audit:复现 Measuring the Gap Between Human and LLM Research Ideas 的思想,在某个 AI 子领域分析 LLM idea 是否过度偏向“方法融合”。
- Proposal reference validity benchmark:构建小型中文/英文 AI proposal 数据集,评估 LLM 是否引用真实论文、引用是否支持对应论断。
- PaperBench-style proposal rubric:把一篇 proposal 拆成可评分任务,研究这种 rubric 是否提升导师反馈质量。
- Negative-result-driven proposal mining:从复现失败、benchmark 陷阱和 ablation 负结果中自动提取可执行 follow-up idea。
- Human-AI proposal co-writing protocol:设计一个流程,明确哪些步骤由 LLM 辅助,哪些步骤必须由人类研究者核验。
总结
从 10 篇论文到 proposal 的核心,不是“读得越多越好”,而是把文献变成决策。你要从论文中抽取问题定义、核心假设、方法干预、证据强度和未解 gap,再把其中一个 gap 压成可证伪假设和最小实验计划。
一个合格的研究生 proposal 至少应该让读者相信三件事:问题真实且重要;你的方法选择有机制理由;实验计划能在有限资源下给出清楚答案。LLM 可以帮助检索、整理、生成候选假设和检查结构,但它不能替你承担最终判断。真正的训练在于:你能否说清楚为什么是这个问题、为什么是这个实验、以及失败后你会学到什么。
参考资料
检索日期:2026-08-20。以下链接均为写作时可访问的一手或近一手资料;会议政策、代码仓库、benchmark 结果、模型版本和 arXiv 版本可能变化,正式发表前请再次核验。
- DARPA, The Heilmeier Catechism. https://www.darpa.mil/about/heilmeier-catechism
- NSF, Preparing Your Proposal. https://www.nsf.gov/funding/preparing-proposal
- ICLR 2026 Author Guide. https://iclr.cc/Conferences/2026/AuthorGuide
- Chenglei Si, Diyi Yang, Tatsunori Hashimoto, "Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers", ICLR 2025. https://mlanthology.org/iclr/2025/si2025iclr-llms/
- Ziyu Chen, Yilun Zhao, Arman Cohan, "Measuring the Gap Between Human and LLM Research Ideas", arXiv:2607.01233, 2026. https://arxiv.org/abs/2607.01233
- SakanaAI, AI-Scientist-v2 GitHub repository. https://github.com/SakanaAI/AI-Scientist-v2
- Sakana AI, The AI Scientist project page. https://sakana.ai/ai-scientist/
- OpenAI, PaperBench: Evaluating AI's Ability to Replicate AI Research, 2025. https://openai.com/index/paperbench/
- OpenAI frontier-evals, PaperBench README. https://github.com/openai/frontier-evals/blob/main/project/paperbench/README.md
- Jing Ren, Weiqi Wang, "Assisting Research Proposal Writing with Large Language Models: Evaluation and Refinement", arXiv:2509.09709, 2025. https://arxiv.org/abs/2509.09709
- Kai Ruan et al., "Evaluating LLMs' divergent thinking capabilities for scientific idea generation with minimal context", Nature Communications, 2026. https://www.nature.com/articles/s41467-026-70245-1
- Jie Yu, Song Qiu, "More Than Can Be Said: A Benchmark and Framework for Pre-Question Scientific Ideation", arXiv:2605.06345, 2026. https://arxiv.org/abs/2605.06345
- Rosni Vasu et al., "HARPA: A Testability-Driven, Literature-Grounded Framework for Research Ideation", OpenReview ICLR 2026 withdrawn submission. https://openreview.net/forum?id=zGr73fcSsB
- NeurIPS 2026 Evaluations and Datasets Reviewing Guidelines. https://neurips.cc/Conferences/2026/EvaluationsDatasetsReviewerGuidelines