封面图

系列:AI 论文精读与复现训练营
日期:2026-08-11
适合读者:研究生、AI4Science 入门研究者、有工程背景的技术读者
检索日期:2026-08-11

摘要

AI for Science 不是一个单点模型方向,而是一组围绕科学对象、物理约束和实验验证组织起来的方法族。分子方向关心 SMILES、分子图、3D 构象和蛋白口袋;蛋白方向关心序列、结构、功能和湿实验筛选;材料方向关心晶体结构、组成、稳定性、性质约束和合成可行性;自动实验方向则把文献、模型、仪器 API、主动学习和真实测量连成闭环。

这篇文章给出一条适合科研训练的阅读路线:先读“表征与预测”,再读“生成与逆向设计”,最后读“实验验证与自主发现”。重点不是记住每个模型名字,而是学会判断一篇 AI4Science 论文是否真正回答了科学问题:数据是否代表真实分布,benchmark 是否泄漏,生成结果是否经过物理或实验验证,复现时能否拿到数据、权重、代码和评价协议。

为什么这个主题重要

AI4Science 的难点在于它同时要求“机器学习正确”和“科学问题正确”。在普通 NLP 任务里,公开测试集上的提升至少说明模型适应该数据分布;但在分子、蛋白和材料里,离线指标只是第一层证据。真正重要的问题是:模型提出的分子能否合成,蛋白能否表达并保持功能,晶体是否稳定且可制备,实验代理是否能在仪器和安全约束下完成闭环。

2025 到 2026 年的趋势让这个问题更明显。Co-Scientist 把多智能体、文献检索和假设生成推到科学发现流程;Boltz-2 把结构预测推进到结合亲和力预测;MatterGen 把材料发现从“筛选候选”转向“按约束直接生成”;InstructBioMol 等工作尝试让自然语言成为生物分子设计接口。这些工作很兴奋,但也更需要严谨阅读:科学智能系统的失败往往不是代码跑不通,而是证据链在某一环断掉。

核心阅读方法

读 AI4Science 论文时,建议把每篇文章拆成五层。

  1. 科学对象:研究的是小分子、蛋白、蛋白-配体复合物、晶体材料、反应条件,还是完整实验流程?对象决定表示方式。SMILES 方便语言建模但弱化 3D 几何;分子图保留连接关系但需要处理构象;蛋白序列适合大规模预训练但不等于功能;晶体材料还要表示周期性晶格和空间群。
  2. 任务定义:论文是在做 property prediction、structure prediction、inverse design、docking、binding affinity、reaction planning,还是 hypothesis generation?同样叫“生成”,有的只是生成合法结构,有的要求满足性质约束,有的还要求可合成并通过实验测量。
  3. 约束来源:分子要满足价态、药物相似性、可合成性和口袋相容性;蛋白要折叠、表达、稳定、结合目标并避免非特异性作用;材料要满足电荷平衡、热力学稳定性和工艺条件;自动实验还要遵守仪器能力、试剂安全和预算。
  4. 证据强度:离线 benchmark、物理模拟、数据库验证、专家评审、自动实验和湿实验验证不是同一级证据。证据越靠后成本越高,也越有说服力,但仍要检查阴性对照、失败样本和统计显著性。
  5. 复现边界:尽早判断自己能复现哪一层。很多 AI4Science 论文最合理的复现目标不是完整湿实验,而是复现实验前的筛选、评价拆分、消融或失败案例分析。

AI for Science 阅读路线图

代表论文路线图

1. 分子模型:从表示学习到可验证生成

分子方向的基础问题是“模型到底看见了什么”。SMILES/SELFIES 适合语言建模,图神经网络适合原子-键结构,3D equivariant 模型进一步纳入空间几何。读这类论文时,先看它解决的是表示、预测还是生成,再看训练和测试拆分是否真的隔离 scaffold、靶点或 assay。

2025 年一个重要警示是 binding affinity 预测里的数据泄漏。Graber 等人讨论 PDBbind 与 CASF benchmark 的相似性问题,提出 CleanSplit 后,若干模型表现下降。这类论文很适合训练科研判断力:指标下降不一定是坏事,可能是评价终于接近真实泛化。

2. 蛋白设计:从结构预测到功能生成

蛋白方向的经典起点仍然是 AlphaFold2。读它时不要只记住 CASP14,而要拆输入、MSA、结构模块、置信度估计和限制条件。接着读 ProteinMPNN 与 RFdiffusion:前者代表“给定骨架设计序列”的逆问题,后者代表用扩散模型生成满足结构或功能约束的蛋白骨架。

2024 到 2025 年后,焦点转向更通用的生物分子交互。AlphaFold3 把蛋白、核酸、小分子、离子和修饰残基放进统一结构预测框架;Chai、Boltz 等体系推动可复现的复合物建模;ESM3 则代表以序列、结构和功能为多模态空间的生成式蛋白语言模型。阅读时要特别区分“结构准确”“亲和力准确”和“功能有效”。

3. 材料发现:从大规模筛选到逆向生成

材料方向可以先读 GNoME。它的核心不是语言模型,而是通过图网络和高通量计算扩大稳定晶体候选空间。读这类论文时,要关注稳定性判据、DFT 设置、数据发布版本,以及是否与 Materials Project 等数据库联动。

再读 MatterGen。它把目标从“从海量候选里筛”改成“给定化学、对称性或性质约束直接生成”。这对方法论很重要:筛选式发现考验候选覆盖率和打分函数,生成式发现则考验约束控制、结构有效性、能量弛豫、稳定性和真实合成验证。尤其要记住:热力学稳定不等于实验中容易合成。

4. 自动实验:从工具代理到科学闭环

A-Lab 把目标材料、文献挖掘、合成启发、机器人操作、XRD 表征和主动学习放在同一闭环里;Coscientist 用 LLM、文档检索、代码执行和实验 API 来规划并执行化学实验;Co-Scientist 则把多智能体辩论、排序、演化和专家反馈用于假设生成,并在生物医学问题上做实验验证。

这条线最适合训练“系统读论文”的能力。你要问:哪一部分是 LLM,哪一部分是数据库、工具或人类专家?实验是否全自动,还是只在决策层自动?失败实验有没有记录?安全约束如何实现?如果没有这些问题,自动实验论文很容易被读成“机器人做实验”的新闻稿。

方法与实验对比表

论文/系统 应先读什么 方法关键词 复现切入点
AlphaFold2 输入、置信度、CASP14 设置 MSA、结构模块、几何约束 跑公开代码或 ColabFold,对比置信度与失败案例
RFdiffusion 设计任务和实验筛选 diffusion、motif scaffolding 小规模 backbone generation 与过滤流程
ESM3 序列/结构/功能三模态如何对齐 protein language model、prompting 使用开放模型做受限设计,记录许可和安全边界
AlphaFold3 / Chai / Boltz 输入实体和输出任务边界 biomolecular complex、affinity 用小型复合物集合比较输入格式、速度和置信度
GNoME / MatterGen 稳定性、约束和数据版本 graph network、crystal diffusion 复现候选筛选、弛豫和 SUN 指标定义
A-Lab / Coscientist / Co-Scientist 闭环中谁做决策 robotics、tools、multi-agent 复现实验日志结构、主动学习或 hypothesis rubric

复现建议

AI4Science 的复现要先选层级,不要一上来承诺“完整复现论文”。

阅读型复现:复现论文表格的列定义、数据来源、评价协议和模型输入输出,目标是把任务说清楚。
计算型复现:下载代码和权重,在小样本上跑通 inference,记录环境、GPU、随机种子、版本、失败样例和耗时。
评价型复现:重做 benchmark split、去重、scaffold split、时间切分、相似性过滤和置信度校准。对分子和蛋白亲和力任务尤其重要。
闭环型复现:用模拟器、公开数据库或廉价实验替代真实实验。只有在有实验条件和安全审批时,才进入湿实验复现。

每次复现都建议保留四份日志:环境日志、数据日志、运行日志和判断日志。判断日志要写明哪些结果可信,哪些只是在复现实验设置,哪些需要人工核验。

常见误区

第一,把 benchmark 分数当成科学发现。AI4Science 的 benchmark 多半是代理任务,不能自动推出真实世界有效。

第二,把结构预测当成功能预测。蛋白结构相似不代表活性、稳定性、表达量和免疫原性都可用。

第三,把“生成合法分子”当成“发现候选药物”。合法、可合成、可结合、可优化、低毒性和可成药是不同门槛。

第四,把“稳定材料”当成“能合成材料”。材料论文必须检查热力学稳定、动力学路径、前驱体和实验表征之间的关系。

第五,只读成功样例。失败样例往往更有研究价值,因为它暴露模型的分布外边界、仪器瓶颈或评价漏洞。

适合研究生继续做的选题

  1. 面向蛋白-配体 benchmark 的数据泄漏审计:从序列相似性、结构相似性和配体 scaffold 三个层次重新拆分训练测试集。
  2. AI4Science 生成模型失败样例库:系统收集无效结构、不可合成候选、低置信度预测和湿实验失败案例。
  3. 小规模材料逆向设计复现:用开源材料数据库复现“约束生成 + 稳定性过滤 + 文献合成可行性检查”流程。
  4. 科学假设生成评价 rubric:比较 LLM 生成假设在新颖性、可检验性、证据支持和实验成本上的排序一致性。
  5. 复现报告自动化模板:把环境、数据版本、模型权重、评价脚本、失败日志和人工核验项标准化。

总结

AI for Science 的论文阅读路线可以概括为一句话:先问科学对象,再问建模假设,最后问证据链。分子、蛋白、材料和自动实验看似分散,但它们共享同一个训练逻辑:把复杂科学对象编码成模型可处理的表示,用生成或预测方法提出候选,再用物理、统计和实验验证把候选变成证据。

对研究生来说,最值得练的不是背下每个模型名称,而是形成一套可迁移的问题清单:数据从哪里来,任务是否真实,指标是否泄漏,生成结果如何过滤,失败样例是否公开,复现能做到哪一层。

参考资料

检索日期:2026-08-11。以下优先列出论文、官方项目页和一手资料;模型版本、API 可用性、leaderboard 结果和代码发布状态可能变化,复现前请再次核对。

  1. Jumper et al., “Highly accurate protein structure prediction with AlphaFold”, Nature, 2021. https://www.nature.com/articles/s41586-021-03819-2
  2. Google DeepMind AlphaFold2 GitHub repository. https://github.com/google-deepmind/alphafold
  3. Watson et al., “De novo design of protein structure and function with RFdiffusion”, Nature, 2023. https://www.nature.com/articles/s41586-023-06415-8
  4. Abramson et al., “Accurate structure prediction of biomolecular interactions with AlphaFold 3”, Nature, 2024. https://www.nature.com/articles/s41586-024-07487-w
  5. Hayes et al., “Simulating 500 million years of evolution with a language model”, Science, 2025. https://doi.org/10.1126/science.ads0018
  6. EvolutionaryScale ESM repository. https://github.com/evolutionaryscale/esm
  7. Passaro et al., “Boltz-2: Towards Accurate and Efficient Binding Affinity Prediction”, bioRxiv, 2025. https://www.biorxiv.org/content/10.1101/2025.06.14.659707v1
  8. Boltz official repository. https://github.com/jwohlwend/boltz
  9. Chai Discovery chai-lab repository and Chai-1/Chai-2 citation notes. https://github.com/chaidiscovery/chai-lab
  10. Zhuang et al., “Advancing biomolecular understanding and design following human instructions”, Nature Machine Intelligence, 2025. https://www.nature.com/articles/s42256-025-01064-0
  11. Graber et al., “Resolving data bias improves generalization in binding affinity prediction”, Nature Machine Intelligence, 2025. https://doi.org/10.1038/s42256-025-01124-5
  12. Merchant et al., “Scaling deep learning for materials discovery”, Nature, 2023. https://www.nature.com/articles/s41586-023-06735-9
  13. Google DeepMind GNoME materials discovery repository. https://github.com/google-deepmind/materials_discovery
  14. Zeni et al., “A generative model for inorganic materials design”, Nature, 2025. https://www.nature.com/articles/s41586-025-08628-5
  15. Szymanski et al., “An autonomous laboratory for the accelerated synthesis of inorganic materials”, Nature, 2023. https://www.nature.com/articles/s41586-023-06734-w
  16. Boiko et al., “Autonomous chemical research with large language models”, Nature, 2023. https://www.nature.com/articles/s41586-023-06792-0
  17. Bran et al., “Augmenting large language models with chemistry tools”, Nature Machine Intelligence, 2024. https://doi.org/10.1038/s42256-024-00832-8
  18. Gottweis et al., “Accelerating scientific discovery with Co-Scientist”, Nature, 2026. https://www.nature.com/articles/s41586-026-10644-y
  19. Google DeepMind, “Co-Scientist: A multi-agent AI partner to accelerate research”, 2026. https://deepmind.google/blog/co-scientist-a-multi-agent-ai-partner-to-accelerate-research/
  20. ICLR 2026 Workshop on Foundation Models for Science, OpenReview venue page. https://openreview.net/group?id=ICLR.cc%2F2026%2FWorkshop%2FFM4Science