封面图

系列:AI 论文精读与复现训练营
日期:2026-08-20
适合读者:研究生、科研新人、有工程背景的 AI 读者
检索日期:2026-08-20

摘要

很多研究生读完十篇论文后,得到的不是一个研究 proposal,而是一份更长的 related work:谁做了什么、用了什么模型、在哪些 benchmark 上更好。问题在于,proposal 不是文献综述的自然延长线。它需要把论文压缩成一个可回答的问题、一个可被证伪的假设、一组有因果指向的方法选择,以及一套资源可承受的实验计划。

本文给出一个面向 AI 研究训练的工作流:如何从 10 篇论文出发,画出问题地图,构造 gap matrix,筛选研究假设,设计最小实验计划,最后写成 2-4 页 pre-proposal。文章参考了 DARPA Heilmeier Catechism、NSF proposal preparation guidance、ICLR 2026 author guidance,也结合 2025-2026 年关于 LLM research ideation、AI Scientist、PaperBench、LiveIdeaBench、InciteResearch 和 proposal writing 的最新资料。重点不是让 LLM 替你“生成选题”,而是训练你把论文读成研究决策。

目录

  1. 为什么这个主题重要
  2. 10 篇论文不是数量要求,而是证据边界
  3. 核心流程:从 paper set 到 proposal
  4. 代表论文与资料路线图
  5. 关键论文精读:AI 能帮到哪里,帮不到哪里
  6. Gap Matrix:把阅读笔记变成研究判断
  7. Proposal 草稿结构
  8. 复现与预实验建议
  9. 常见误区
  10. 适合研究生继续做的选题
  11. 总结与参考资料

为什么这个主题重要

论文精读训练的终点不是“我知道这个方向有哪些工作”,而是“我能提出一个小而清楚、可被检验、可在现有资源下执行的问题”。这正是从阅读者转向研究者的关键台阶。

在 AI 方向,这个台阶尤其难。第一,论文更新太快。一个 proposal 如果只停留在“改进某个 2024 baseline”,可能在开题前就被 2025-2026 的模型或 benchmark 吞掉。第二,很多论文把贡献包装成系统工程:数据、模型、prompt、后处理、训练 recipe 和评测策略纠缠在一起,读者很难判断真正有效的变量。第三,LLM 已经开始参与文献检索、idea generation、proposal writing 和实验执行,但最新研究也反复提醒我们:模型能给出看似合理的 idea,却容易在可行性、引用准确性、多样性和真实执行上出问题。

DARPA 的 Heilmeier Catechism 很适合作为 proposal 的最低门槛:你要做什么?今天怎么做,限制在哪里?你的新方法是什么,为什么可能成功?谁在乎?风险、成本、时间和中期/最终验收是什么?NSF 的 proposal guidance 也把核心问题压缩成类似结构:想做什么,为什么做,如何做,如何知道成功,以及成功后有什么价值。对研究生来说,这些问题比“标题是否酷”“模型是否新”更重要。

10 篇论文不是数量要求,而是证据边界

“从 10 篇论文形成 proposal”不等于随机读 10 篇。更好的构成是:

  • 2 篇奠基论文:定义任务、范式或核心假设。
  • 3 篇最近强 baseline:代表当前主流做法,优先选 2025-2026 年或仍被当前工作使用的技术报告。
  • 2 篇反例或负结果:指出 benchmark、复现、泛化或机制解释的问题。
  • 2 篇邻近分支:提供可迁移方法,但不是同一套路的简单堆叠。
  • 1 篇综述、系统论文或 benchmark 论文:帮助你理解评价边界。

这 10 篇论文的目的不是覆盖所有相关工作,而是建立一个“足够做判断”的证据边界。读完后,你应该能回答四个问题:这个方向的核心变量是什么?哪些结论已经被反复验证?哪些结论只在狭窄设置中成立?如果我只能做一个月预实验,最值得检验的缺口是什么?

如果十篇论文全是同一实验套路的 SOTA paper,你很容易得到一个平庸 proposal:换模型、换数据、换 loss、再跑一次 leaderboard。真正有训练价值的 paper set 应该包含张力:一个方法声称有效,另一个复现研究质疑它;一个 benchmark 流行,另一个 contamination 或 leakage 分析指出风险;一个 agent 框架自动生成实验,另一个评测显示 agent 仍远低于人类复现能力。

核心流程:从 paper set 到 proposal

从 10 篇论文到 Proposal 的流程图

第一步,做 problem map。不要先按论文时间线排,而要按“它们认为问题在哪里”排。每篇论文都填三句话:它要解决的失败模式是什么?它把失败归因于什么变量?它认为成功应该如何测量?例如在 LLM research ideation 方向,有的论文把问题定义为 novelty,有的定义为 feasibility,有的定义为 groundedness,有的定义为执行成功率。它们表面上都在做“生成研究想法”,但问题定义并不相同。

第二步,做 claim extraction。把每篇论文的核心 claim 写成可验证句子,而不是摘要句。错误写法是“提出一个自动科研系统”。更好的写法是“在给定模板和代码库的条件下,系统能完成 idea generation、实验迭代、写作和自动 review,但产出论文仍存在解释和可靠性问题”。claim 一旦被写成可验证句子,就能进入下一步比较。

第三步,做 gap matrix。行是论文或方法,列是问题定义、假设、数据/任务、模型规模、实验变量、metric、baseline、复现材料、失败案例、外部有效性。你要找的 gap 不是“没人做过 X”,而是“现有证据不能支持某个重要判断”。比如:idea generation 论文可能证明生成 idea 新颖,但没有证明它们能被低成本实验验证;proposal writing 论文可能改进文本质量,却仍要单独核查 reference validity;PaperBench 显示 AI agent 复现复杂 AI 论文仍困难,这会限制全自动 proposal-to-paper 系统的现实可信度。

第四步,生成 3 个候选假设。每个假设都必须包含方向、机制和可证伪条件。弱假设是“加入检索会提升研究 proposal 质量”。强假设是“在从 10 篇论文生成 AI research proposal 的任务中,把文献证据显式压缩为 gap matrix,比直接 RAG 生成 proposal 更能提升 feasibility 和 reference validity;若人工评审或执行预实验未显示显著差异,则假设不成立。”

第五步,设计最小实验计划。proposal 不是要把所有实验列满,而是要证明你知道第一块证据应该怎么拿。最小实验通常包括一个主对比、一个 ablation、一个失败案例分析和一个人工核验环节。对于 AI 论文训练,尤其要写清楚 seed、数据版本、模型版本、prompt、推理预算、评分规则和日志保存方式。

第六步,写 pre-proposal。先写 2-4 页,不要直接写 15 页。顺序是:问题、已有证据、核心 gap、假设、方法、实验、风险、时间表。只要这几页讲不清,长 proposal 只会把问题藏起来。

代表论文与资料路线图

类别 代表资料 对 proposal 训练的启发
Proposal 判断框架 DARPA Heilmeier Catechism;NSF Preparing Your Proposal 把选题压成目标、现状、创新、价值、风险、成本、验收
顶会写作规范 ICLR 2026 Author Guide;NeurIPS 2026 review guidance 关注贡献类型、可复现性、匿名代码、伦理和实验支撑
AI research ideation Si et al., ICLR 2025;Measuring the Gap Between Human and LLM Research Ideas, 2026 LLM idea 可有新颖性,但 feasibility、diversity 和 human taste gap 需要单独评估
自动科研系统 The AI Scientist / AI Scientist-v2;PaperBench 自动生成和复现仍受执行、代码、实验和评审可靠性约束
Idea benchmark LiveIdeaBench;InciteResearch / TF-Bench 科学创意评价要拆成 originality、feasibility、flexibility、clarity 等维度
Proposal writing Assisting Research Proposal Writing with LLMs, 2025 文本质量和引用真实性应分开评估,迭代提示不能替代人工核验

关键论文精读:AI 能帮到哪里,帮不到哪里

Si、Yang 和 Hashimoto 的 ICLR 2025 研究是读这个主题的入口。它招募 100 多位 NLP 研究者参与 idea 写作与盲审,发现 LLM 生成 idea 在新颖性评价上可以超过人类专家,但可行性略弱,并暴露出 LLM self-evaluation 失败和生成多样性不足的问题。对 proposal 训练的直接启发是:不要把“新颖”当作唯一目标。一个研究生 proposal 如果只有 novelty,没有可执行实验和失败标准,很容易变成漂亮但不可验证的空想。

2026 年的 Measuring the Gap Between Human and LLM Research Ideas 更进一步。它不只评价单个 idea,而是比较人类论文与 LLM idea 的分布差异。论文指出,LLM idea 往往更集中在 bridge-like opportunity 和 synthesis method 上,而人类研究 idea 的分布更分散。这个结论对使用 LLM 辅助选题的人很重要:模型可能不断给你“把 A 和 B 结合”的建议,但真正的研究机会也可能来自反常现象、测量缺口、负结果、机制解释或约束条件变化。

The AI Scientist 和 AI Scientist-v2 展示了 agentic research pipeline 的可能性:生成假设、写代码、跑实验、分析结果和写论文。AI Scientist-v2 的 GitHub README 也明确提醒,系统会执行 LLM 写出的代码,需要在受控 sandbox 中运行,并且 v2 不一定比模板化 v1 产出更好,特别是在有强模板的任务上。这对 proposal 设计是一条硬约束:自动化可以帮助探索,但 proposal 仍要写清楚哪些步骤由人核验、哪些实验可重复、哪些失败会触发 pivot。

PaperBench 则提供了冷静的一面。OpenAI 在 2025 年发布的 PaperBench 要求 agent 从零复现 20 篇 ICML 2024 Spotlight / Oral 论文,并用作者共同制定的层级 rubric 评分。公开结果显示,当时最佳 tested agent 仍没有超过人类基线。这里不应只关注分数,而要学习它的 rubric 思想:一个 research plan 不能只写“复现论文”,而要把复现拆成可评分任务,例如数据准备、模型实现、训练目标、核心实验、ablation、图表和结论核验。

LiveIdeaBench 和 InciteResearch 适合提醒我们:proposal 不是简单的 convergent reasoning。LiveIdeaBench 用 originality、feasibility、fluency、flexibility 和 clarity 等维度衡量 scientific idea generation,说明科学创意与一般智能分数并不等价。InciteResearch 则强调许多研究起点并不是清楚问题,而是“隐性摩擦”:你觉得某个方向不对劲,但还说不出问题。这正是读 10 篇论文的意义:不是马上生成答案,而是把模糊不满变成可检查的研究问题。

最后,Assisting Research Proposal Writing with LLMs 直接讨论 proposal writing。它把内容质量与 reference validity 分开评估,并用迭代 prompting 改善写作质量、减少引用错误。这个设定很实用:当你用 LLM 辅助 proposal 草稿时,应至少保留两张表,一张评估论证结构,一张逐条核查引用是否真实、是否支持对应句子。

Gap Matrix:把阅读笔记变成研究判断

下面是一个可直接复用的 gap matrix 模板。

字段 要填什么 判断标准
Problem 论文解决的具体失败模式 是否比“大模型不够好”更具体
Assumption 方法成立依赖的前提 是否能被实验打破
Intervention 方法真正改变的变量 是否与工程细节混淆
Evidence 支持 claim 的证据 是否包含 baseline、ablation、统计或人工核验
Boundary 证据适用边界 是否说明数据、模型、任务和预算限制
Missing 仍未回答的问题 是否重要且可实验
Feasibility 你能否在 2-4 周做预实验 数据、算力、代码、评测是否可得
Proposal Hook 可形成的研究假设 是否有机制和可证伪条件

完成矩阵后,不要急着选“最大”的 gap。研究生训练更适合选择“中等重要、低到中等成本、证据链清楚、能在一个月拿到预实验结果”的 gap。一个小 proposal 的目标不是击败整个领域,而是建立一个能被导师、同学或 reviewer 认真讨论的证据起点。

Proposal 草稿结构

建议先写一页版本:

  1. 标题:必须包含任务、变量和目标,不要只写一个大方向。
  2. 问题:用 3-5 句话说明现有方法在哪个具体场景失败。
  3. 文献证据:列出 10 篇论文如何共同支持这个问题存在。
  4. 核心 gap:说明现有证据缺什么,不要只说“尚未有人研究”。
  5. 假设:写成可证伪句子。
  6. 方法:说明你改变哪个变量,以及为什么这可能解决 gap。
  7. 实验计划:列 dataset、metric、baseline、ablation、人工核验和日志。
  8. 风险与替代计划:写清楚失败后如何缩小问题或 pivot。

再扩成 2-4 页版本时,可以增加 related work map、pilot experiment、timeline 和资源预算。参考 NSF 的思路,proposal 应该回答“想做什么、为什么做、如何做、如何知道成功”。参考 DARPA 的思路,还要回答“谁在乎、风险是什么、阶段性考试是什么”。对于 AI 研究训练,阶段性考试可以很具体:两周内复现 baseline;第三周完成主对比;第四周完成 ablation 和 error analysis;若主指标无提升,则转向解释失败原因,而不是继续堆技巧。

复现与预实验建议

第一,先复现一个可信 baseline,而不是先实现你的新方法。baseline 复现失败,通常说明环境、数据、metric 或理解存在问题。这个阶段的日志应该包含 commit、依赖版本、seed、模型 checkpoint、数据 hash、运行命令和异常记录。

第二,把 proposal 的核心假设压成最小干预。例如你的假设是“gap matrix improves proposal feasibility”,就不要同时换模型、换 prompt、换检索库、换评审标准。最小实验可以是:同一组 10 篇论文、同一模型、同一输出格式,对比 direct RAG proposal 与 gap-matrix-first proposal,再由人工 rubric 评估 specificity、feasibility、reference support 和 testability。

第三,保留负结果。很多 proposal 的真正价值不是“方法立刻有效”,而是发现现有 claim 的边界。NeurIPS 2026 等会议已经在贡献类型中给 negative results、concept & feasibility、evaluation analysis 留出空间;只要实验设计严谨,负结果可以成为强选题。

第四,不要把 LLM judge 当最终证据。可以用 LLM 做初筛、结构检查和引用提醒,但 reference validity、实验可执行性和关键 claim 必须人工核验。PaperBench 之所以有训练价值,正是因为它把复现任务拆成层级 rubric,而不是只问模型“这篇复现是否成功”。

常见误区

误区一:把 proposal 写成 related work。Related work 解释过去,proposal 必须押注未来的一个可验证判断。

误区二:把 gap 理解成“没人做过”。很多没人做过的事是不重要、不可能、或做了也没意义。更好的 gap 是“现有证据不足以支持一个重要 claim”。

误区三:只追求 novelty。Si et al. 和后续 ideation 研究都提示,novelty 与 feasibility、diversity、execution success 不是一回事。

误区四:实验计划过大。proposal 的第一阶段不该依赖训练 70B 模型或构建全新 benchmark。先证明关键变量值得研究。

误区五:引用不核验。LLM 生成的 proposal 文字越流畅,越容易掩盖引用错配。引用必须逐条对应 claim。

误区六:没有失败标准。没有失败标准的 proposal 不是研究计划,而是愿望清单。

适合研究生继续做的选题

  1. Gap-matrix-first proposal writing:比较结构化 gap matrix 与直接 RAG 对 proposal 可行性、引用准确性和可测试性的影响。
  2. Research idea diversity audit:复现 Measuring the Gap Between Human and LLM Research Ideas 的思想,在某个 AI 子领域分析 LLM idea 是否过度偏向“方法融合”。
  3. Proposal reference validity benchmark:构建小型中文/英文 AI proposal 数据集,评估 LLM 是否引用真实论文、引用是否支持对应论断。
  4. PaperBench-style proposal rubric:把一篇 proposal 拆成可评分任务,研究这种 rubric 是否提升导师反馈质量。
  5. Negative-result-driven proposal mining:从复现失败、benchmark 陷阱和 ablation 负结果中自动提取可执行 follow-up idea。
  6. Human-AI proposal co-writing protocol:设计一个流程,明确哪些步骤由 LLM 辅助,哪些步骤必须由人类研究者核验。

总结

从 10 篇论文到 proposal 的核心,不是“读得越多越好”,而是把文献变成决策。你要从论文中抽取问题定义、核心假设、方法干预、证据强度和未解 gap,再把其中一个 gap 压成可证伪假设和最小实验计划。

一个合格的研究生 proposal 至少应该让读者相信三件事:问题真实且重要;你的方法选择有机制理由;实验计划能在有限资源下给出清楚答案。LLM 可以帮助检索、整理、生成候选假设和检查结构,但它不能替你承担最终判断。真正的训练在于:你能否说清楚为什么是这个问题、为什么是这个实验、以及失败后你会学到什么。

参考资料

检索日期:2026-08-20。以下链接均为写作时可访问的一手或近一手资料;会议政策、代码仓库、benchmark 结果、模型版本和 arXiv 版本可能变化,正式发表前请再次核验。

  1. DARPA, The Heilmeier Catechism. https://www.darpa.mil/about/heilmeier-catechism
  2. NSF, Preparing Your Proposal. https://www.nsf.gov/funding/preparing-proposal
  3. ICLR 2026 Author Guide. https://iclr.cc/Conferences/2026/AuthorGuide
  4. Chenglei Si, Diyi Yang, Tatsunori Hashimoto, "Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers", ICLR 2025. https://mlanthology.org/iclr/2025/si2025iclr-llms/
  5. Ziyu Chen, Yilun Zhao, Arman Cohan, "Measuring the Gap Between Human and LLM Research Ideas", arXiv:2607.01233, 2026. https://arxiv.org/abs/2607.01233
  6. SakanaAI, AI-Scientist-v2 GitHub repository. https://github.com/SakanaAI/AI-Scientist-v2
  7. Sakana AI, The AI Scientist project page. https://sakana.ai/ai-scientist/
  8. OpenAI, PaperBench: Evaluating AI's Ability to Replicate AI Research, 2025. https://openai.com/index/paperbench/
  9. OpenAI frontier-evals, PaperBench README. https://github.com/openai/frontier-evals/blob/main/project/paperbench/README.md
  10. Jing Ren, Weiqi Wang, "Assisting Research Proposal Writing with Large Language Models: Evaluation and Refinement", arXiv:2509.09709, 2025. https://arxiv.org/abs/2509.09709
  11. Kai Ruan et al., "Evaluating LLMs' divergent thinking capabilities for scientific idea generation with minimal context", Nature Communications, 2026. https://www.nature.com/articles/s41467-026-70245-1
  12. Jie Yu, Song Qiu, "More Than Can Be Said: A Benchmark and Framework for Pre-Question Scientific Ideation", arXiv:2605.06345, 2026. https://arxiv.org/abs/2605.06345
  13. Rosni Vasu et al., "HARPA: A Testability-Driven, Literature-Grounded Framework for Research Ideation", OpenReview ICLR 2026 withdrawn submission. https://openreview.net/forum?id=zGr73fcSsB
  14. NeurIPS 2026 Evaluations and Datasets Reviewing Guidelines. https://neurips.cc/Conferences/2026/EvaluationsDatasetsReviewerGuidelines