
系列:AI 论文盘点 / 技术趋势
日期:2026-07-15
适合读者:机器学习、NLP、AI safety、可解释性和深度学习系统方向研究生;关注模型内部机制与可靠评测的工程读者
检索日期:2026-07-15
摘要
Mechanistic Interpretability(机制解释,以下简称 MI)关心的不是“模型给出的自然语言解释是否像人话”,而是更硬的问题:一个训练好的神经网络内部,哪些激活、特征、注意力头、MLP 方向和跨层路径实际导致了某个行为?如果我们删除、替换或增强这些内部变量,模型行为是否按预期改变?
这篇文章把 2025-2026 年的 MI 进展拆成五条路线:早期 circuits 传统如何把 Transformer 拆成可命名电路;activation patching、causal tracing 和自动电路发现如何验证因果路径;sparse autoencoder(SAE)、transcoder 和 dictionary learning 如何试图把混叠表示分解成稀疏特征;线性表示分析与 steering 如何连接“可解释方向”和“可控生成”;以及 SAEBench、AxBench、Neuronpedia、Gemma Scope 等新基础设施如何暴露评测难题。本文不会把“解释看起来合理”当成结论,重点是哪些证据能支持“这个解释是因果忠实的”。
目录
- 研究背景:为什么 MI 在大模型时代更难也更重要
- 核心科学问题
- 近一年论文路线图
- 代表论文分组解读
- 方法对比表
- 实验与 benchmark 如何看
- 可复现性与数据问题
- 局限与争议
- 适合研究生继续做的选题
- 总结
- 参考资料
研究背景:为什么 MI 在大模型时代更难也更重要
可解释 AI 很早就有 saliency map、attention visualization、probe、feature attribution 等方法。但 MI 的野心更接近“逆向工程”:找到模型内部实际执行计算的结构。经典脉络可以从 Transformer Circuits 系列读起:Anthropic/OpenAI 研究者在《A Mathematical Framework for Transformer Circuits》中把 attention head、residual stream、MLP 写成可分析的计算组件;随后 induction head 工作展示了 Transformer 如何通过特定注意力头实现上下文内复制和模式续写;toy model of superposition 则解释了为什么神经网络会把多个语义特征压进同一组神经元或方向里。
大模型让这个问题变得更紧迫。模型越强,越可能在医学、代码、科学推理和 agent 场景中被委托更高风险任务;但模型内部表示也更分布式、更上下文依赖、更难靠单个 neuron 解释。2023 年的《Towards Monosemanticity》把 dictionary learning 引入小型 Transformer,尝试从激活中学习“更单义”的稀疏特征;2024 年 Anthropic 在 Claude 3 Sonnet 上扩展了这种路线,展示了可以在大模型中找到与概念、拒答、代码、偏见、欺骗等行为相关的特征。到 2025 年,《Circuit Tracing: Revealing Computational Graphs in Language Models》和 Anthropic 的《On the Biology of a Large Language Model》把焦点进一步推向“从特征到计算图”:不仅要找出单个特征,还要描述特征之间如何通过模型权重和激活形成因果链。

核心科学问题
第一,什么算“机制”?一个 attention head 关注某些 token,一个 SAE feature 对某类文本激活,一个 probe 可以线性读出实体属性,这些都只是相关性证据。MI 更强的目标是:如果把这个内部变量 patch、ablate、clamp 或 steer,输出行为会按机制假设改变。机制应当能支持反事实干预。
第二,表示是否可分解?superposition 观点认为,神经网络常把超过维度数量的特征压进有限表示空间。单个 neuron 不一定对应单个概念,单个概念也可能分散在多个方向。SAE 的承诺是把激活分解为稀疏 feature codes,但 SAE 学到的 feature 是否稳定、是否真正对应模型使用的因果变量,仍然需要 benchmark 和干预验证。
第三,电路如何跨层组合?早期 induction head 很适合做教学样例,因为路径相对短、功能相对明确。真实 LLM 行为往往涉及多层 residual stream、MLP 读写、attention routing、token position、上下文条件和解码策略。一个解释若只定位到“某层某头重要”,还远不能说明完整计算。
第四,解释如何评测?自然语言解释容易让人产生理解错觉。MI 评测需要回答:解释能否预测 unseen prompts 上的行为?能否通过干预改变行为?能否压缩模型行为而保留关键输出?能否定位失败案例?SAEBench 和 AxBench 这类新 benchmark 正是在试图把“特征好不好”转化为可重复测量的问题。
近一年论文路线图
1. 从特征可视化到 circuit tracing。 2025 年的 circuit tracing 工作把 SAE/transcoder 特征、局部替代模型和 attribution graph 结合起来,目标是给出语言模型内部从输入 token 到输出预测的计算图。它的意义不只是“画图更好看”,而是把 feature-level 解释推进到 graph-level 机制假设。需要注意的是,这类图仍然依赖所选替代模型、阈值、归因规则和人工解释,不能自动等同于真实因果机制。
2. SAE 进入 benchmark 阶段。 2024 年以后,SAE 从少量概念展示进入基础设施化阶段:Gemma Scope 发布面向 Gemma 2 的开放 SAE 资源,Neuronpedia 提供特征浏览、解释、搜索和干预实验界面;2025 年 SAEBench 提出系统评测套件,比较 reconstruction、sparsity、feature interpretability、downstream behavior 等维度。随后一些论文开始质疑:SAE benchmark 是否可靠?随机初始化或不充分训练的模型上是否也能学到看似可解释特征?这些质疑把方向从“展示漂亮特征”拉回到实验设计。
3. Steering 与表示分析重新合流。 线性方向、activation steering、representation engineering 不是传统 MI 的全部,但它们提供了一个强干预接口:如果一个方向真的编码某类属性,那么加减该方向应当可控地改变输出。AxBench 这类评测把 steering、control 和 interpretability 放在一起比较,也让研究者意识到:可控不等于可解释,解释也不一定带来更好的控制。
4. 自动化和工具链成为研究对象。 TransformerLens、nnsight、Neuronpedia、SAELens、Circuit Tracer 等工具降低了实验门槛。与此同时,自动电路发现、LLM 生成 neuron/feature 解释、自动评分 explanation quality 也变得常见。工具越强,越需要警惕“自动解释流水线”把相关性、可视化和自然语言描述包装成过度确定的结论。
5. 2026 年的争议集中在可迁移性和可靠性。 截至 2026-07-15,可见的新论文更多在追问:SAE 解释能否跨模型、跨数据集、跨层稳定?benchmark 分数是否与人类理解一致?自动发现的 feature/circuit 是否真的有 causal faithfulness?这些问题比单个 feature demo 更适合成为研究生课题。
代表论文分组解读
A. Transformer circuits:从组件分解到可命名电路
Transformer Circuits 的基础工作把 Transformer 拆成 residual stream 中的信息读写。attention head 可以被看成把某些 token 的值向量写入当前位置;MLP 可以被看成 key-value memory 或非线性特征变换;不同层通过 residual stream 叠加信息。这个框架的价值在于它给了研究者一套“看模型内部计算”的语言。
Induction head 是这条线最著名的成功案例之一。模型在序列中看到 A ... B ... A 时,某些 head 会从前一个 A 后面的 token 复制信息,帮助预测第二个 A 后面的续写。这类工作说明 MI 可以发现可复用机制,而不是只做事后可视化。但 induction head 也提醒我们:能解释一个简洁机制,不代表能解释所有复杂行为。
B. Causal tracing 与 activation patching:把解释变成干预假设
Activation patching 的基本思想是:对同一个模型运行 clean prompt 和 corrupted prompt,把某层某位置的激活从 clean run 替换到 corrupted run,观察输出是否恢复。如果恢复,说明该激活携带了任务相关信息。Causal tracing、path patching、attribution patching、ACDC 等方法在不同粒度上扩展了这个想法:定位层、头、MLP、路径或子图。
这类方法的优点是直接:它问的是“内部变量是否导致行为变化”。缺点也很现实。patching 结果依赖 prompt pair 设计、metric 选择、干预粒度和是否引入 out-of-distribution 激活。一个组件被 patch 后有效,可能说明它参与机制,也可能只是它携带了可替代信息。好的论文通常会做多组 prompt、负对照、随机对照、跨模型复现,并报告失败样例。
C. SAE、transcoder 与 dictionary learning:从 neuron 到 feature
SAE 把某层激活 x 编码成稀疏向量 h,再从 h 重构 x。如果训练成功,h 中的单个 feature 可能比原始 neuron 更单义:例如某个 feature 对括号、某类语言、代码模式、拒答语气或地名上下文强激活。Transcoder 则更进一步,尝试学习从一层激活到后一层或某个模块输出的稀疏可解释映射。
这条路线的强处是规模化:SAE 可以一次性产生大量候选特征,支持搜索、浏览和人工标注。Neuronpedia 使这种探索更加工程化,Gemma Scope 则提供了开放模型上的 SAE 资源,方便不同团队复现和比较。风险在于“feature naming”很容易过度解释。一个 feature 的高激活样例看起来像某个概念,不代表它只表示这个概念,也不代表模型在任务中实际使用它。
D. Circuit tracing:把特征连成计算图
2025 年 Anthropic 的 circuit tracing 路线试图回答一个更难的问题:如果 SAE 给出的是局部 feature,那么这些 feature 如何通过模型权重和激活相互影响,最终导致输出?论文和技术报告使用 attribution graph 描述特征之间的影响路径,并在案例中分析模型对事实、推理、拒答等行为的内部计算。
它的重要性在于把 MI 从“特征目录学”推进到“机制图谱学”。但读这类结果要非常谨慎:图中的边来自归因或局部近似,不等于完整因果证明;图的可读性受到阈值和筛选影响;人工解释仍然参与很深。最稳妥的读法是:把 circuit graph 当成可检验假设生成器,再用干预和外部任务验证。
E. 表示方向、steering 与控制
表示分析常用线性 probe、PCA/CCA、logit lens、activation steering 等工具。它们能快速回答某层是否线性编码某个属性,也能通过加减方向改变模型输出风格或事实倾向。Representation engineering 的一系列工作说明,在 LLM 内部存在可操作的方向,能影响诚实性、情感、拒答、毒性、偏好等行为。
这条线和 MI 的关系有张力。它提供了清晰的干预接口,但未必给出完整机制。一个 steering direction 有效,可能只是利用了模型的局部控制面板,而不是解释了模型如何产生该行为。AxBench 等评测有价值,正是因为它把 steering success、control specificity 和 interpretability evidence 放到同一个实验框架中比较。
方法对比表
| 路线 | 主要对象 | 典型证据 | 代表资源 / 论文 | 主要风险 |
|---|---|---|---|---|
| Transformer circuits | attention head、MLP、residual stream | 可命名电路、路径分析、手工验证 | Mathematical Framework, Induction Heads | 成功案例可能偏小,难扩展到复杂行为 |
| Activation patching / causal tracing | 层、位置、头、路径激活 | clean/corrupted 干预恢复行为 | Causal Tracing, ACDC, path patching | prompt pair 和 metric 选择影响很大 |
| SAE / dictionary learning | 稀疏 feature、特征字典 | 重构、稀疏性、高激活样例、干预 | Towards Monosemanticity, Gemma Scope, SAEBench | feature 命名过度解释,benchmark 尚不稳定 |
| Circuit tracing / attribution graph | feature 之间的计算图 | feature graph、边归因、局部干预 | Circuit Tracing, On the Biology of a LLM | 图结构依赖近似和阈值,未必完整因果 |
| 表示方向 / steering | 线性方向、probe、activation edit | 控制效果、属性读出、反事实编辑 | Representation Engineering, AxBench | 可控不等于可解释,可能缺少机制闭环 |
实验与 benchmark 如何看
读 MI 论文时,不建议只看漂亮可视化或几个 anecdote。至少要问七个问题。
第一,解释的对象是什么?是单个 neuron、SAE feature、attention head、MLP channel、residual direction,还是跨层 circuit?粒度不同,证据要求也不同。
第二,是否有因果干预?仅展示高激活样例或相关性曲线不够。更强证据包括 ablation、patching、feature clamping、direction steering、path intervention,以及干预后对任务 metric 的影响。
第三,是否有负对照?例如随机 feature、随机方向、随机层、无关 prompt、同频率但不同语义的 token。没有负对照时,很难判断解释是不是由数据分布或模型普遍敏感性造成。
第四,benchmark 是否测到了真正目标?SAEBench 关注 SAE 的多维质量,AxBench 关注 steering/control/alignment 风格任务,但任何 benchmark 都会诱导优化。分数提升不一定代表解释更接近真实机制,需要结合人工审阅和干预实验。
第五,是否跨模型、跨层、跨数据复现?一个机制如果只在单一模型、单一 prompt family、单一 layer 上成立,结论应当收窄。跨 Pythia、Gemma、Llama、Claude 等模型的可复现性更有说服力,但闭源模型会限制核验。
第六,是否报告失败样例?好的 MI 论文应该展示解释失效的情形:feature polysemantic、patching 不稳定、steering 产生副作用、circuit graph 漏掉路径。失败样例比只展示成功图更能帮助后续研究。
第七,是否区分“人类可读”和“模型实际使用”?一个 feature 名称可以帮助人理解,但名字不是机制本身。真正关键的是该 feature 在模型计算中是否有可测影响。
可复现性与数据问题
MI 的复现难点主要在细节。Patching 实验需要明确模型版本、tokenizer、prompt pair、层和位置索引、logit metric、采样设置;SAE 需要报告训练语料、激活缓存、层位、hidden expansion、稀疏惩罚、dead feature 处理、重构误差和训练步数;circuit tracing 需要说明 attribution graph 构造、阈值、局部近似和人工筛选流程。
数据也很敏感。解释一个事实回忆机制时,prompt 的措辞、实体频率、训练语料污染都会影响结果;解释安全相关行为时,公开 prompt 可能触发模型策略差异;解释代码或数学能力时,tokenization 和格式细节会改变激活路径。因此,本文没有写“某方法达到 SOTA”这类容易过期的结论。对于 benchmark 结果、仓库状态、模型覆盖范围和在线平台功能,出版前应以论文主页、GitHub release、OpenReview 或 arXiv 最新版本人工核验。
局限与争议
第一,MI 还没有可靠的“显微镜”。SAE、probe、patching、attribution graph 都是工具,而不是保证真相的仪器。工具会带来自己的偏差。
第二,特征可能不是自然概念。人类倾向于给 feature 起名字,但模型内部变量可能混合语义、语法、位置、频率和任务策略。polysemanticity 不是例外,而可能是高效表示的一部分。
第三,解释和控制可能分离。一个方向能 steer 模型,不代表它解释了模型为何输出;一个 circuit graph 能解释某些样例,不代表它能稳定控制所有相关行为。
第四,规模化会稀释人工理解。大模型可能有上千万候选 feature。即使工具能自动生成解释,人类也不可能逐一审阅。未来需要更好的抽样、审计、层级组织和错误发现机制。
第五,AI safety 语境容易高估 MI 的短期能力。MI 对发现风险机制很有潜力,但目前还不能保证大型模型没有隐藏目标、欺骗策略或未知失败路径。把 MI 当作安全论证的一部分是合理的,把它当作完整安全证明则过早。
适合研究生继续做的选题
SAE feature 的因果评测协议:不仅评估重构和稀疏性,还要求 feature ablation、feature swap、跨 prompt family 和负对照。
跨模型 circuit 复现:在同一任务上比较 Pythia、Gemma、Llama 等开源模型,研究相似行为是否由相似路径实现。
解释失败样例数据集:收集 feature 命名错误、patching 假阳性、steering 副作用、benchmark 分数与人工判断冲突的案例。
自动 circuit discovery 的可信度校准:让算法输出机制图的同时输出不确定性,并用预注册干预实验验证。
MI 与形式化验证结合:把发现的电路或表示方向转化为可测试规范,例如某些安全 feature 被激活时是否必须触发拒答路径。
多模态模型的机制解释:研究视觉 token、语言 token 和 cross-attention 之间的因果路径,避免只把文本 LLM 方法直接套到 VLM。
总结
Mechanistic Interpretability 正在从小型 circuits demo 走向大模型内部机制工程。2025-2026 年最值得关注的变化,是研究对象从单个 neuron/head 扩展到 SAE feature、transcoder、attribution graph 和 benchmark;研究方法从“可视化解释”转向“可干预、可复现、可审计的机制假设”。
这条路线的前景很大,但不宜被漂亮图谱冲昏头脑。对科研读者来说,最有价值的判断标准仍然朴素:解释是否能预测新样例?是否经得起干预?是否有负对照?是否承认失败?如果答案是否定的,它最多是一个有趣可视化;如果答案逐步变成肯定,MI 才可能成为理解和治理大模型的核心科学工具。
参考资料
检索日期:2026-07-15。以下优先列出论文、官方研究页、项目主页和工具文档;模型覆盖、代码仓库状态、benchmark 排名和在线平台功能均可能变化,出版前建议再次人工核验。
- Elhage et al., A Mathematical Framework for Transformer Circuits, Transformer Circuits, 2021. https://transformer-circuits.pub/2021/framework/index.html
- Olsson et al., In-context Learning and Induction Heads, Transformer Circuits, 2022. https://transformer-circuits.pub/2022/in-context-learning-and-induction-heads/index.html
- Elhage et al., Toy Models of Superposition, Transformer Circuits, 2022. https://transformer-circuits.pub/2022/toy_model/index.html
- Bricken et al., Towards Monosemanticity: Decomposing Language Models With Dictionary Learning, Transformer Circuits, 2023. https://transformer-circuits.pub/2023/monosemantic-features/index.html
- Templeton et al., Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet, Transformer Circuits / Anthropic, 2024. https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html
- Marks et al., Circuit Tracing: Revealing Computational Graphs in Language Models, Transformer Circuits, 2025. https://transformer-circuits.pub/2025/attribution-graphs/methods.html
- Anthropic, On the Biology of a Large Language Model, 2025. https://transformer-circuits.pub/2025/attribution-graphs/biology.html
- Anthropic, Tracing the Thoughts of a Large Language Model, 2025. https://www.anthropic.com/research/tracing-thoughts-language-model
- Meng et al., Locating and Editing Factual Associations in GPT, NeurIPS 2022 / project page. https://rome.baulab.info/
- Conmy et al., Towards Automated Circuit Discovery for Mechanistic Interpretability, NeurIPS 2023. https://arxiv.org/abs/2304.14997
- Wang et al., Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small, ICLR 2023. https://arxiv.org/abs/2211.00593
- Bills et al., Language Models Can Explain Neurons in Language Models, OpenAI, 2023. https://openai.com/index/language-models-can-explain-neurons-in-language-models/
- Google DeepMind, Gemma Scope: helping the safety community shed light on the inner workings of language models, 2024. https://deepmind.google/discover/blog/gemma-scope-helping-the-safety-community-shed-light-on-the-inner-workings-of-language-models/
- Bloom, Neuronpedia: Interactive Reference and Tooling for Mechanistic Interpretability, project page, 2024-2026. https://www.neuronpedia.org/
- Karvonen et al., SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability, arXiv, 2025. https://arxiv.org/abs/2503.09532
- Wu et al., AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders, arXiv, 2025. https://arxiv.org/abs/2501.17148
- Chanin, Are Sparse Autoencoder Benchmarks Reliable?, arXiv, 2026. https://arxiv.org/abs/2605.18229
- Heap et al., Automated Interpretability Metrics Do Not Distinguish Trained and Random Transformers, arXiv, 2025, revised 2026. https://arxiv.org/abs/2501.17727
- Huben et al., Sparse Autoencoders Find Highly Interpretable Directions in Language Models, ICLR 2024. https://openreview.net/forum?id=F76bwRSLeK
- Nanda and Bloom, TransformerLens, documentation and repository. https://github.com/TransformerLensOrg/TransformerLens
- nnsight team, nnsight: interpreting and manipulating the internals of deep learning models, documentation. https://nnsight.net/
- Sharkey et al., Mechanistic Interpretability for AI Safety: A Review, arXiv / TMLR, 2025. https://arxiv.org/abs/2404.14082