
系列:AI 论文盘点 / 技术趋势
日期:2026-07-10
适合读者:研究生、AI4Science 研究者、科学计算与实验自动化方向读者、有工程背景的技术读者
检索日期:2026-07-10
摘要
AI for Science 正在从“给科学家提供模型和工具”,走向“参与科学流程本身”。AlphaFold、GNoME、AlphaGenome 等基础模型说明,深度学习可以在蛋白结构、材料稳定性、基因调控等高价值问题上形成新的预测层;Coscientist、AI co-scientist、Robin、The AI Scientist-v2、AlphaEvolve、AutoLabs 和 2026 年若干 self-driving lab 预印本则把问题推进到另一层:AI 能否提出假设、设计实验、调用仿真或仪器、分析结果,再把证据反馈给下一轮搜索?
这篇文章的核心判断是:AI for Science 的前沿不再只是“模型精度”,而是科学工作流的闭环能力。真正困难的地方包括假设是否新颖且可证伪、实验是否可执行、数据和代码是否可复现、自动评价是否可靠、失败实验是否被记录,以及人类专家如何在安全边界内接入系统。
目录
- 研究背景:从科学预测模型到科研闭环
- 核心科学问题:AI 到底在科学流程中做什么
- 近一年论文路线图
- 代表论文分组解读
- 方法对比表
- 实验与 benchmark 如何看
- 可复现性与数据问题
- 局限与争议
- 适合研究生继续做的选题
- 总结
- 参考资料
研究背景:从科学预测模型到科研闭环
过去十年,AI for Science 最成功的范式是“用机器学习替代或加速科学流程中的一个昂贵环节”。在蛋白结构预测中,AlphaFold 系列把氨基酸序列到三维结构的预测推到接近实验可用的水平;在材料科学中,GNoME 用图神经网络和 DFT 验证扩大候选晶体空间;在基因组学中,AlphaGenome 把长 DNA 序列映射到多种调控属性和变异效应。这些工作都很重要,但它们通常仍处在科学流程的某个局部环节:预测结构、筛选候选、解释变异或优化算法。
2024-2026 年的变化,是 LLM、工具调用、多 Agent、自动化实验室和科学基础模型开始被拼成更完整的工作流。系统不只回答“这个分子可能是什么结构”,而是尝试回答“下一步应该提出什么假设、做哪个实验、用什么指标验收、如果失败如何改计划”。这使 AI for Science 从单点模型问题,变成一个包含知识检索、因果解释、实验设计、执行控制、数据治理和人机协作的系统问题。
需要先划清边界:本文讨论的“闭环”不等于完全无人科学家。多数系统仍有强人工边界,例如人类定义目标、审查假设、提供湿实验资源、批准危险操作、解释异常结果。更准确的说法是,AI 正在承担越来越多可形式化、可执行、可评价的科研子流程。
核心科学问题:AI 到底在科学流程中做什么
AI for Science 的研究问题可以拆成六层。
第一层是科学表征:蛋白、材料、基因组、细胞图像、物理场、实验谱图如何被编码?这对应 AlphaFold、GNoME、AlphaGenome、神经算子、扩散生成模型和多模态科学模型。
第二层是知识综合:系统是否能从论文、数据库、专利、实验记录和负结果中抽取可用事实?这不是普通 RAG,因为科学知识有单位、条件、剂量、仪器参数、统计显著性和反例。
第三层是假设生成:AI 生成的不是“听起来合理”的文字,而是可测试、可证伪、有机制解释、能和已有证据区分开的研究假设。Google Research 的 AI co-scientist、FutureHouse 的 Robin 和 Sakana AI 的 The AI Scientist 系列都在这一层发力。
第四层是实验设计与执行:从自然语言目标到实验 protocol、仿真脚本、机器人 API、云实验室指令或高通量筛选方案。Coscientist、ChemCrow、AutoLabs 和 self-driving labs 属于这一类。
第五层是结果解释与更新:实验数据不能只被模型总结成“成功/失败”。闭环系统需要把谱图、图像、RNA-seq、性能曲线和负结果转化为下一轮决策。
第六层是评测与治理:科学任务常常没有短期标准答案。系统必须说明证据来源、实验条件、失败路径、潜在污染、人工干预点和安全边界。

近一年论文路线图
2025 年的主线之一是“科研 Agent 化”。Google Research 发布 AI co-scientist,把 Gemini 2.0、多 Agent、生成-辩论-演化和 test-time compute 结合起来,用于药物再利用、肝纤维化靶点和抗微生物耐药机制等生物医学任务。FutureHouse 的 Robin 把文献 Agent 与数据分析 Agent 串起来,围绕干性年龄相关性黄斑变性提出治疗策略,并在 lab-in-the-loop 框架中验证候选药物。Sakana AI 的 The AI Scientist-v2 进一步把 ML 研究中的想法生成、实验、写作和自动审稿做成端到端树搜索系统,并宣称有 AI 生成论文通过 ICLR workshop 评审;这一点有标志意义,但质量、审稿标准和可复现性仍应谨慎看待。
第二条主线是“可验证发现”。AlphaEvolve 用 LLM 生成和修改代码,再由自动评价器筛选候选程序,适合数学、算法和计算基础设施这类可以明确打分的科学问题。它比普通科研聊天助手更接近科学闭环,因为每个候选解都必须运行、计分、进入演化数据库,再影响下一轮搜索。
第三条主线是“自动实验室”。Coscientist 早在 2023 年已经展示 GPT-4 驱动的化学实验规划和液体处理器控制;2025-2026 年的 AutoLabs、A-Lab GPSS、SARA-H、AHOIS 等工作继续把 LLM、多 Agent、自校正、主动学习和机器人实验结合起来。这里的新信号不是机器人能做实验,而是系统开始把“异常观测、失败样本、专家反馈、代理测量和中间观测”纳入决策。
第四条主线是“评测体系跟上”。PaperBench、MLE-bench、MLRC-Bench、FML-bench、ScienceAgentBench、AInsteinBench 等 benchmark 试图分别评估论文复现、机器学习工程、研究竞赛、基础 ML 研究探索、科学数据分析和科学代码仓库任务。它们共同说明一个事实:如果没有可执行任务、专家 rubric 和新鲜数据,科研 Agent 的能力很容易被 LLM-as-a-judge 或漂亮报告高估。
代表论文分组解读
1. 科学基础模型:把自然对象变成可计算表征
AlphaFold 3 将结构预测从单链蛋白扩展到蛋白、DNA、RNA、小分子配体、离子和修饰之间的相互作用;AlphaGenome 则面向基因调控,输入长达百万碱基的 DNA 序列,输出多种分子属性和变异效应预测;GNoME 用图网络和主动学习扩大材料候选空间,并把稳定材料候选交给 Materials Project 这样的开放数据库。
这些模型的共同价值是给科学流程提供“可调用的预测器”。但它们本身不等于闭环发现。预测结果还要经过实验验证、误差分析、适用域判断和下游目标函数设计。以材料发现为例,热力学稳定性不等于可合成、可加工、可规模化,也不等于具备目标应用所需的全部性质。
2. 科研 Agent:从文献综述走向假设竞争
AI co-scientist 的关键不是“帮忙查论文”,而是把科学方法拆成若干角色:生成、反思、排序、演化、邻近性检查和元审查。系统用 tournament 和 Elo 式自动评价推动假设迭代,并允许科学家提供 seed idea 或自然语言反馈。官方博客和 arXiv 论文都强调它是协作工具,而不是替代科学家。
Robin 的特点是更贴近生物医学发现循环:文献搜索、假设生成、实验建议、数据分析和新假设更新被整合到一个多 Agent 流程中。它的强处是把湿实验结果纳入下一轮推理;需要谨慎的地方是,单个疾病案例的成功不能直接外推到所有生物医学问题。
The AI Scientist-v2 代表“AI 研究自动化”的激进路线。它针对机器学习研究,让系统自动提出方法、写代码、跑实验、画图、写论文并响应审稿反馈。独立评估已经指出早期版本存在新颖性误判、实验失败、引用不足和幻觉数字等问题。因此,这条线最值得研究的不是“AI 是否会写论文”,而是怎样设计严谨的 novelty check、实验 oracle、审稿协议和失败追踪。
3. 可验证算法发现:当科学问题有明确评价器
AlphaEvolve、FunSearch、AlphaDev 和 AlphaTensor 属于更容易闭环的科学发现路线:候选解可以写成程序,程序可以被运行,结果可以被自动评价。AlphaEvolve 的官方资料显示,它把 Gemini 模型、程序数据库、提示采样和演化选择结合起来,用自动评价器验证候选算法。
这类系统的重要启发是:科研 Agent 最先可靠突破的场景,往往不是最开放的假设空间,而是存在清晰 objective、可执行验证器和大量廉价试错的空间。数学构造、算法优化、编译器优化、科学计算 kernel、模拟器参数搜索,可能会比“泛化到所有科学假设”更早成熟。
4. 自动实验室:把 AI 决策接到仪器和样本
Coscientist 展示了 LLM 如何调用网络搜索、文档检索、代码执行和实验自动化 API,完成合成规划、液体处理器控制和交叉偶联反应设计。ChemCrow 则把化学工具接入 LLM,强调分子性质、反应规划和外部工具的组合。
Self-driving lab 的传统核心是主动学习或贝叶斯优化:模型根据已有实验选择下一批最有信息量的实验。2025-2026 年的新工作开始引入更复杂的多阶段决策和 LLM 推理,例如 A-Lab GPSS 面向空气敏感锂卤化物尖晶石导体,SARA-H 结合自动相识别和人类反馈,AutoLabs 评估多 Agent 自校正在实验 protocol 生成中的作用,AHOIS 则尝试让物理 critic 通过苏格拉底式追问修正假设。这些预印本的具体数值和结论需要发布前再次核验,但方向很清楚:实验闭环正在从“优化一个黑箱函数”走向“解释异常、提出机制、调整流程”。
方法对比表
| 路线 | 代表工作 | 核心能力 | 适合任务 | 主要风险 |
|---|---|---|---|---|
| 科学基础模型 | AlphaFold 3、AlphaGenome、GNoME | 从科学对象到预测表征 | 结构、材料、基因调控、物理场预测 | 适用域、实验验证、数据偏差 |
| 假设生成 Agent | AI co-scientist、Robin | 文献综合、假设生成、排序和更新 | 生物医学靶点、药物再利用、机制解释 | 幻觉、新颖性误判、证据链薄弱 |
| 自动科研流水线 | The AI Scientist-v2 | 想法、实验、写作、审稿闭环 | 机器学习研究原型 | 论文质量、引用、结果可复现性 |
| 可验证算法发现 | AlphaEvolve、FunSearch | 生成程序并用评价器筛选 | 数学、算法、科学计算优化 | 目标函数过窄、过拟合评价器 |
| 自驱实验室 | Coscientist、AutoLabs、A-Lab GPSS、SARA-H | protocol 生成、机器人执行、主动学习 | 化学、材料、高通量实验 | 仪器安全、样本污染、数据质量 |
| 科研评测 | PaperBench、MLE-bench、MLRC-Bench、ScienceAgentBench | 用可执行任务和 rubric 测能力 | 论文复现、ML 工程、科学数据分析 | 评测污染、成本高、覆盖不全 |
实验与 benchmark 如何看
读 AI for Science 论文时,不要只看 headline。至少要问六个问题。
第一,任务是否有真实科学价值?在 Kaggle、合成 benchmark 或 toy lab 上成功,不等于能产生可发表的新科学发现。相反,真实科研任务通常目标模糊、实验昂贵、负结果多、评价慢。
第二,评价器是否独立可靠?AlphaEvolve 这类系统之所以有说服力,是因为候选程序可以被自动运行和验证。开放假设生成更难,因为 LLM 自评、Elo 排名或 AI reviewer 可能奖励流畅性和常识一致性,而不是科学新颖性。
第三,有没有人类专家基线?PaperBench 和 MLRC-Bench 的价值在于把任务拆成可评分子目标,并尽量引入人类专家或竞赛成绩作为参照。没有基线的“AI 发现”容易被高估。
第四,失败样本是否公开?科研闭环最有价值的数据往往是失败实验、错误假设和被否定的路线。如果论文只展示成功案例,很难判断系统是否真正会科学推理。
第五,数据是否可能泄漏?文献、代码、benchmark、竞赛榜单和实验 protocol 都可能进入模型训练集。越接近公开论文复现和已知竞赛,越需要新鲜任务和去污染设计。
第六,实验资源是否可复现?湿实验依赖仪器、试剂批次、环境控制和操作细节;计算实验依赖随机种子、GPU、依赖版本和隐藏 prompt。没有完整 provenance,闭环很难被独立验证。
可复现性与数据问题
AI for Science 比普通 LLM 应用更怕“看起来合理”。科学输出如果不可复现,代价不是用户体验下降,而是浪费实验资源,甚至误导后续研究。一个可靠系统至少要保存四类记录:输入知识来源、模型和 prompt 版本、实验或仿真执行日志、以及所有成功和失败结果。
材料科学中的 GNoME/A-Lab 争议提醒我们,自动化系统的瓶颈常常不在生成候选,而在候选是否真的是新结构、是否被正确表征、是否有足够证据支持“合成成功”。生物医学中的药物再利用也类似:细胞实验阳性只是早期信号,不等于机制确认、动物实验有效或临床可行。
因此,未来 AI for Science 的数据基础设施会和模型同等重要。负结果数据库、实验 protocol 标准、机器可读论文、样本元数据、仪器日志、可执行 notebook、代码容器和开放 benchmark,都会决定闭环系统能否真正学习。
局限与争议
第一,自动假设生成容易产生“合理但平庸”的想法。许多系统善于组合公开文献,但真正新颖的科学问题往往来自反常现象、隐性实验经验和长期领域直觉。
第二,自动评价可能奖励错误目标。一个假设在 LLM 评审中得分高,不代表它可验证;一个程序在 benchmark 上表现好,也可能只是对评价器过拟合。
第三,实验自动化带来安全边界。化学、生物、材料实验涉及危险试剂、污染、双用途知识和昂贵设备。Agent 不能直接拥有无限制仪器权限,必须有 safety gate、权限分层和人工审批。
第四,跨学科合作仍是瓶颈。AI 研究者常低估实验误差、样本制备和数据标注成本;领域科学家也可能低估模型适用域和评测污染。真正可用的系统需要两边共同定义 objective 和 failure mode。
第五,2026 年新预印本变化很快。本文纳入的 AutoScientists、AHOIS、A-Lab GPSS 等工作应被视为趋势信号,涉及 benchmark 分数、实验规模和系统能力的数字在正式发布前需要人工复核。
适合研究生继续做的选题
- 科学假设的 novelty check:结合文献图谱、知识图谱、时间切分数据库和专家标注,评价一个假设是否只是旧知识重述。
- 负结果驱动的科研 Agent:让失败实验进入记忆和规划,而不是只保留成功轨迹。
- 科学 protocol 到可执行代码:面向某一类仪器或仿真软件,构建可验证的自然语言到 protocol 编译器。
- 实验闭环的 provenance 标准:为 Agent 生成的假设、实验、数据和图表设计机器可读审计日志。
- 跨模态科学数据评测:把谱图、显微图、表格、代码和文本放在同一任务中,避免只评测纯文本问答。
- LLM 与贝叶斯优化融合:让 LLM 负责机制解释、约束生成和异常诊断,让 BO 负责数据高效搜索。
- AI reviewer 的校准:研究自动审稿系统何时和人类专家一致,何时偏好流畅叙述而非真实贡献。
总结
AI for Science 的第三阶段正在形成:第一阶段是科学预测模型,第二阶段是科研助手和工具增强,第三阶段是能在受控范围内循环“读文献、提假设、做实验、看结果、再更新”的闭环系统。短期内,最可靠的突破会出现在评价器清晰、实验可自动化、失败可记录的领域,例如算法发现、科学计算优化、高通量材料筛选和特定生物医学假设验证。
更长远看,科研 Agent 的价值不在于写出更多论文,而在于把科学探索变得更可审计、更数据高效、更能积累失败经验。真正值得期待的不是无人科学家神话,而是人类科学家和 AI 系统共同维护一个可验证、可复现、可持续更新的发现循环。
参考资料
检索日期:2026-07-10。
- Hengjie Yu, Yaochu Jin, “AI for Science: Current progress and pathways forward.” arXiv, 2025. https://arxiv.org/abs/2503.05822
- Jiaqi Wei et al., “From AI for Science to Agentic Science: A Survey on Autonomous Scientific Discovery.” arXiv, 2025. https://arxiv.org/abs/2508.14111
- Fan Liu et al., “Foundation Models for Scientific Discovery: From Paradigm Enhancement to Paradigm Transition.” arXiv, 2025. https://arxiv.org/abs/2510.15280
- Josh Abramson et al., “Accurate structure prediction of biomolecular interactions with AlphaFold 3.” Nature, 2024. https://www.nature.com/articles/s41586-024-07487-w
- Google DeepMind, “AlphaGenome: AI for better understanding the genome.” 2025-06-25, updated 2026-01. https://deepmind.google/blog/alphagenome-ai-for-better-understanding-the-genome/
- Amil Merchant et al., “Scaling deep learning for materials discovery.” Nature, 2023. https://www.nature.com/articles/s41586-023-06735-9
- Google DeepMind, “Millions of new materials discovered with deep learning.” 2023-11-29. https://deepmind.google/blog/millions-of-new-materials-discovered-with-deep-learning/
- Daniil A. Boiko et al., “Autonomous chemical research with large language models.” Nature, 2023. https://www.nature.com/articles/s41586-023-06792-0
- Andres M. Bran et al., “ChemCrow: Augmenting large-language models with chemistry tools.” arXiv, 2023. https://arxiv.org/abs/2304.05376
- Juraj Gottweis et al., “Towards an AI co-scientist.” arXiv, 2025. https://arxiv.org/abs/2502.18864
- Google Research, “Accelerating scientific breakthroughs with an AI co-scientist.” 2025-02-19. https://research.google/blog/accelerating-scientific-breakthroughs-with-an-ai-co-scientist/
- Ali Essam Ghareeb et al., “Robin: A multi-agent system for automating scientific discovery.” arXiv, 2025. https://arxiv.org/abs/2505.13400
- Chris Lu et al., “The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery.” arXiv, 2024. https://arxiv.org/abs/2408.06292
- Yutaro Yamada et al., “The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search.” arXiv, 2025. https://arxiv.org/abs/2504.08066
- Sakana AI, “The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery.” 2024-08-13. https://sakana.ai/ai-scientist/
- Joeran Beel, Min-Yen Kan, Moritz Baumgart, “Evaluating Sakana's AI Scientist for Autonomous Research.” arXiv, 2025. https://arxiv.org/abs/2502.14297
- Alexander Novikov et al., “AlphaEvolve: A coding agent for scientific and algorithmic discovery.” arXiv, 2025. https://arxiv.org/abs/2506.13131
- Google DeepMind, “AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms.” 2025-05-14. https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/
- Nathan J. Szymanski et al., “An autonomous laboratory for the accelerated synthesis of inorganic materials.” Nature, 2023. https://www.nature.com/articles/s41586-023-06734-w
- Adedire D. Adesiji et al., “Benchmarking Self-Driving Labs.” arXiv, 2025. https://arxiv.org/abs/2508.06642
- Luca Torresi, Pascal Friederich, “Multi-stage Bayesian optimisation for dynamic decision-making in self-driving labs.” arXiv, 2025. https://arxiv.org/abs/2512.15483
- Gihan Panapitiya et al., “AutoLabs: Cognitive Multi-Agent Systems with Self-Correction for Autonomous Chemical Experimentation.” arXiv, 2025. https://arxiv.org/abs/2509.25651
- Yuxing Fei et al., “Agentic LLM Reasoning in a Self-Driving Laboratory for Air-Sensitive Lithium Halide Spinel Conductors.” arXiv, 2026. https://arxiv.org/abs/2604.11957
- Xianrui Zeng et al., “Socratic agents for autonomous scientific discovery in high-dimensional physical systems.” arXiv, 2026. https://arxiv.org/abs/2606.26722
- Giulio Starace et al., “PaperBench: Evaluating AI's Ability to Replicate AI Research.” arXiv, 2025. https://arxiv.org/abs/2504.01848
- Jun Shern Chan et al., “MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering.” arXiv, 2024. https://arxiv.org/abs/2410.07095
- Yunxiang Zhang et al., “MLRC-Bench: Can Language Agents Solve Machine Learning Research Challenges?” arXiv, 2025. https://arxiv.org/abs/2504.09702
- Qiran Zou et al., “FML-bench: A Benchmark for Automatic ML Research Agents.” arXiv, 2025. https://arxiv.org/abs/2510.10472
- Titouan Duston et al., “AInsteinBench: Benchmarking Coding Agents on Scientific Repositories.” arXiv, 2025. https://arxiv.org/abs/2512.21373
- Ziru Chen et al., “ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery.” arXiv, 2024. https://arxiv.org/abs/2410.05080
- Shanghua Gao, Ada Fang, Marinka Zitnik, “AutoScientists: Self-Organizing Agent Teams for Long-Running Scientific Experimentation.” arXiv, 2026. https://arxiv.org/abs/2605.28655