
系列:AI 论文精读与复现训练营
日期:2026-08-09
适合读者:准备进入多模态大模型方向的研究生、科研新人,以及有工程背景、希望系统读论文和做复现的 AI 读者。
摘要
多模态 LLM 的论文很容易读成“模型名盘点”:CLIP、Flamingo、BLIP-2、LLaVA、Qwen-VL、InternVL、Molmo、Gemini、GPT-4o、Llama Vision……每篇都在说模型更强、数据更多、benchmark 更高。但真正适合科研训练的读法,不是把榜单背下来,而是追问三个问题:视觉信息如何变成语言模型能使用的 token?图文、视频、文档和指令数据如何改变模型行为?所谓多模态推理到底是在考感知、OCR、空间关系、数学图表、长视频记忆,还是语言先验?
本文给出一条 Multimodal LLM 论文精读路线。它把论文分成四层:视觉表征、模态连接、对齐与指令数据、评测与推理。读完一篇 VLM 论文时,你应该能画出它的输入分辨率、视觉编码器、connector、LLM backbone、训练阶段、数据配方、评测集合和失败类型。复现时,也不要一上来训练大模型,而应从开源权重评测、数据格式复刻、少量指令微调和错误分析开始。
目录
- 为什么多模态 LLM 值得精读
- 一张阅读路线图
- 代表论文时间线
- 四类关键问题:encoder、connector、data、reasoning
- 方法与实验对比表
- 如何做一个可复现的小实验
- 常见误区
- 适合研究生继续做的选题
- 参考资料
为什么这个主题重要
多模态 LLM 是从“看图说话”走向“以视觉为证据进行推理”的技术路线。早期视觉语言模型多关注检索、分类、caption、VQA;现代 MLLM 则希望在同一个对话接口中处理图像、视频、文档、图表、屏幕、数学题和多轮指令。问题也因此变得更难:模型是否真的看懂了图?是否只是利用题干和选项中的语言线索?是否把 OCR 错误包装成自信推理?是否在 chart、医学图像、GUI、长视频中出现新的幻觉?
对研究生来说,这个方向特别适合训练三种能力。第一,架构拆解能力:同样是“接入视觉”,有的论文冻结 CLIP/ViT,只训练 projector;有的使用 Q-Former、cross-attention、resampler;有的开始做原生多模态预训练和多尺度视觉 token。第二,数据意识:多模态能力很大程度来自数据类型、过滤方式、合成指令、OCR/grounding 标注和偏好数据,而不是单一模块创新。第三,评测敏感性:MMMU、MathVista、MMBench、Video-MME、CharXiv、MMStar 等 benchmark 测的不是同一种能力,直接比较总分往往会误导选题。

核心阅读方法:先画信息流,再看分数
读多模态 LLM 论文时,建议先画一张五段式信息流:
输入层:论文支持单图、多图、视频、文档、屏幕截图还是音频?图像是否被切成 patch、多尺度 crop、任意分辨率 tile?视频是抽帧、时间位置编码,还是音视频交错输入?
视觉编码器层:使用 CLIP ViT、SigLIP、EVA、InternViT、自研 ViT,还是端到端训练的视觉模块?视觉编码器冻结还是参与训练?如果冻结,论文是否解释了分辨率、OCR、细粒度定位的瓶颈?
模态连接层:视觉 token 如何进入 LLM?常见路线包括线性 projector、MLP connector、Q-Former、Perceiver Resampler、cross-attention adapter、token pooling、dynamic resolution 和多层特征融合。这里要重点看 token 数量,因为它直接影响上下文成本、长视频能力和推理延迟。
语言模型层:backbone 是 LLaMA/Qwen/Mistral/OLMo/InternLM/Gemma/Phi 还是闭源模型?论文是否把语言能力和视觉能力拆开评测?如果视觉模型换了 backbone,收益来自视觉训练还是语言底座更强?
训练与对齐层:至少拆成预训练、图文对齐、视觉指令微调、偏好优化/安全对齐、视觉推理强化或 test-time scaling。不要只记录“用了多少数据”,还要记录数据是 caption、OCR、region grounding、multi-image、video QA、chart、document、GUI,还是由强模型蒸馏出来的 synthetic instruction。
代表论文路线图
第一阶段:视觉-语言表征对齐。 CLIP 用大规模图文对比学习证明了自然语言监督可以形成可迁移视觉表征。它不是现代聊天式 VLM,但它定义了很多后续模型的视觉编码器起点:图像不是先变成类别,而是变成能和语言空间对齐的 embedding。精读 CLIP 时要关注训练目标、负样本规模、zero-shot prompt 和 robustness gap,而不是只看 ImageNet。
第二阶段:冻结大模型,学习模态接口。 Flamingo 把冻结视觉模型和冻结语言模型连接起来,通过 gated cross-attention 与 Perceiver-style resampler 支持 interleaved image/video/text few-shot prompting。BLIP-2 用 Q-Former 作为轻量桥接模块,在冻结图像编码器和冻结 LLM 之间做两阶段预训练。这一阶段的核心问题是:如何用较少可训练参数跨过“视觉表征”和“语言生成”之间的模态间隙。
第三阶段:视觉指令微调。 LLaVA 把 GPT-4 生成的视觉指令数据用于大模型对话能力构建,展示了“图像-问答-解释”格式对 MLLM 行为的巨大影响。LLaVA-1.5、LLaVA-NeXT、LLaVA-OneVision 等后续工作继续扩展分辨率、多图和视频能力。读这一路线要把数据构造、训练阶段和评测脚本读得非常细,因为小改动常常带来大幅分数变化。
第四阶段:开源强模型与原生多模态预训练。 Qwen-VL/Qwen2-VL/Qwen2.5-VL/Qwen3-VL、InternVL2/3/3.5、Molmo、Llama 3.2 Vision、MiniCPM-V/o、NVLM 等模型把重点从“能接图”推进到“高分辨率文档、长视频、视觉定位、图表推理、GUI 操作和多模态偏好优化”。例如,Qwen2.5-VL 技术报告覆盖 3B、7B、72B 规模,并强调文档解析、目标定位和长视频理解;Qwen3-VL 官方资料进一步强调空间-时间建模、DeepStack 多层 ViT 特征和视觉 agent 能力。InternVL3 把 native multimodal pretraining、mixed preference optimization 和 multimodal test-time scaling 放到核心位置。Molmo/PixMo 则强调开放权重、开放数据和可复现训练配方。
第五阶段:从图片理解到 omni / video / action。 GPT-4o、Gemini 2.x、Qwen2.5-Omni、MiniCPM-o 等报告显示,前沿模型开始处理图像、文本、音频、视频和语音输出。对本文主题来说,重点不是追踪所有产品能力,而是理解多模态输入如何改变评测方法:音视频同步、时间戳、长上下文、流式输入、实时交互和安全评测都会让传统 VQA 复现实验不够用。
关键论文精读:四个入口
1. 视觉编码器:它到底看到了什么?
很多论文把视觉编码器当作“现成模块”,但复现时这里经常决定上限。你要记录编码器类型、输入尺寸、patch size、是否多尺度、是否支持任意分辨率、是否为 OCR/文档优化。Llama 3.2 Vision 的模型卡明确说明其视觉模型通过单独训练的 vision adapter 将图像编码器表示接入 Llama 3.1 文本模型,并给出 11B、90B 两个视觉模型规模。Molmo 官方博客则说明其模型使用多尺度、多 crop 预处理、ViT 图像编码器、MLP connector 和 token pooling。这样的细节比“模型很强”更有研究价值。
读 encoder 部分时可以问:如果把图像缩小,文本、表格、小目标会丢失什么?如果切 tile,空间关系如何保留?如果视频只抽少量帧,事件顺序是否仍可推理?如果使用 frozen CLIP,视觉表征是否适合文档、医学图像、GUI 和几何图?
2. Connector:模态间隙在哪里被压缩?
Connector 是多模态论文最容易被低估的部分。线性 projector 简单、便宜、便于复现;Q-Former 和 resampler 能压缩视觉 token 并选择查询;cross-attention adapter 可以让语言层按需读取视觉信息;多层特征融合则试图同时保留低层细节和高层语义。Qwen3-VL 技术报告提到 DeepStack 集成多层 ViT features,是近期“不要只取最后一层视觉特征”的代表信号。
精读时不要只看模块图,要查训练目标是否真的迫使 connector 学会 grounding。只做 caption 可能会让模型擅长描述,不一定擅长定位;只做 VQA 可能会过拟合题型;缺少 OCR 和结构化文档数据时,图表与论文截图往往成为短板。
3. 对齐数据:能力来自哪些样本?
多模态 LLM 的数据通常混合图文对、caption、OCR、region-level grounding、多轮视觉对话、视频字幕、文档问答、数学图表、GUI 操作和模型生成的 synthetic instruction。这里要特别警惕“数据规模崇拜”。更大的数据并不自动等于更好的 reasoning;数据覆盖、标注质量、去重、题目视觉依赖性和评测污染更关键。
Molmo/PixMo 的价值在于把开放数据和训练配方放到研究问题中心;LLaVA 路线的价值在于展示了视觉指令数据如何塑造对话行为;Qwen、InternVL 等技术报告的价值在于暴露工程化训练阶段如何变复杂。读这些论文时,应把“数据从哪里来、是否开放、能否复刻、是否蒸馏闭源模型、是否和 benchmark 重叠”写进笔记。
4. 多模态推理:它是真的推理,还是语言先验?
MMMU 强调大学级多学科知识和异质图像类型;MathVista 关注视觉语境中的数学推理;MMBench 强调多维能力与 circular evaluation;Video-MME 关注长短视频理解;CharXiv 用真实论文图表检验 chart understanding;MMStar 明确指出许多样本不需要视觉输入也能答对,并提出多模态增益与泄漏指标。这些 benchmark 的共同提醒是:多模态分数不是单一能力。
做论文精读时,建议把每个 benchmark 归入一类问题:感知/OCR、空间关系、图表、数学、文档、视频时间、领域知识、幻觉诊断、语言泄漏。然后再看模型在哪些类上提升。只报告平均分的论文,证据强度是不够的。
方法与实验对比表
| 路线 | 代表论文/系统 | 核心机制 | 精读重点 | 复现入口 |
|---|---|---|---|---|
| 图文对比表征 | CLIP | 图文对比学习,zero-shot 分类 | 训练目标、prompt、鲁棒性 | 用 open_clip 跑小数据 zero-shot/linear probe |
| 冻结模型桥接 | Flamingo、BLIP-2 | resampler、cross-attention、Q-Former | 冻结策略、视觉 token 压缩 | 复现小型 VQA 或 caption 微调 |
| 视觉指令微调 | LLaVA 系列 | projector + visual instruction tuning | 指令数据、两阶段训练、评测脚本 | 用开源权重跑 LMMs-Eval/VLMEvalKit |
| 开源强 VLM | Qwen-VL、InternVL、Molmo、MiniCPM-V | 高分辨率、多图、视频、文档、偏好优化 | 数据配方、OCR/grounding、token 预算 | 固定模型,对比分辨率、prompt、采样和评测 |
| omni / video / agentic | GPT-4o、Gemini、Qwen-Omni、Qwen3-VL | 音视频、长上下文、时间对齐、GUI/agent | 输入协议、时间建模、安全评测 | 以公开 API 或开源模型做受控案例研究 |
如何做一个可复现的小实验
不要从训练 70B VLM 开始。一个合理的研究生复现实验可以这样设计:
- 选一个开源模型族,例如 Qwen2.5-VL、LLaVA-OneVision、InternVL 或 Molmo,并固定具体 checkpoint、transformers/vLLM/VLMEvalKit 版本。
- 选两个能力互补的 benchmark 子集,例如 MathVista testmini + CharXiv sample,或者 MMBench dev + Video-MME short subset。若排行榜或数据版本变化,记录“待人工核验”。
- 建立严格日志:模型名、commit、权重来源、图像分辨率、max pixels、frame 数、prompt 模板、temperature、seed、硬件、失败样例。
- 做一个小 ablation:只改一个变量,例如图像分辨率、是否 OCR 文本外置、是否多图合并、是否 CoT prompt、是否加入 self-consistency。
- 输出错误分类,而不是只输出总分。至少分成 OCR 错误、定位错误、关系错误、数学推理错误、语言先验覆盖视觉证据、格式解析错误、拒答/安全策略影响。
这个实验的价值在于训练你把“模型能力”拆成可观察现象。哪怕最终没有超过任何 SOTA,也能形成可靠的复现笔记和 follow-up idea。
常见误区
误区一:把 VLM 看成 LLM 加图片。 真正的问题是视觉 token 如何被压缩、对齐和检索。图像不是 prompt 附件,而是另一套带噪声、分辨率和空间结构限制的证据。
误区二:只比较榜单总分。 多模态 benchmark 的题型差异很大。MMStar 已经提醒:部分题目可能存在视觉非必要或泄漏问题。读论文时必须检查无图 baseline、文本-only baseline 和题目去重策略。
误区三:忽视数据开放性。 如果训练数据、过滤规则、synthetic instruction 生成器和评测脚本都不可得,论文仍可学习思路,但复现目标要降级为“行为复现”或“消融复现”,不能承诺完整训练复现。
误区四:默认 CoT 提升代表视觉推理提升。 视觉题中的长解释可能只是语言模型补全。需要检查中间步骤是否可由图像证据支持,必要时做遮挡、裁剪、无图、反事实图像和选项打乱实验。
适合研究生继续做的选题
- 视觉依赖性评测清洗:从已有 benchmark 中筛出无图也能答对的样本,构造更可靠的 visual-required 子集。
- Connector 层消融:在同一 encoder 和 LLM 下比较 projector、Q-Former、resampler、multi-layer feature fusion 的 token 效率与错误类型。
- 文档与图表的细粒度错误分析:围绕 CharXiv、OCRBench v2、CC-OCR 或 LongDocURL,分析图表元素、坐标、图例、单位和多页定位错误。
- 长视频时间推理:固定帧预算,比较均匀抽帧、事件检索、字幕辅助和时间戳 prompt 对 Video-MME 类任务的影响。
- 多模态偏好优化的副作用:比较 SFT、DPO/MPO/RLHF 后模型在安全拒答、视觉幻觉和详细解释上的变化。
总结
Multimodal LLM 论文的精读重点不是“谁第一”,而是理解视觉证据如何进入语言推理链。CLIP 告诉我们自然语言监督可以塑造视觉表征;Flamingo 和 BLIP-2 告诉我们桥接模块能用较少训练成本连接冻结模型;LLaVA 路线说明指令数据会显著改变模型行为;Qwen、InternVL、Molmo、Llama Vision 等技术报告展示了现代 VLM 已经进入高分辨率、多图、视频、文档、偏好优化和 agentic 交互阶段。
作为科研训练,你的目标是读完论文后能回答:模型看到了什么、丢掉了什么、如何对齐、靠什么数据学会、在哪些 benchmark 上被验证、失败样例说明了什么。能回答这些问题,才算真正读懂一篇多模态 LLM 论文。
参考资料
检索日期:2026-08-09。以下链接优先选取论文、项目主页、官方博客、模型卡或会议页面;排行榜、API、模型发布状态和 benchmark 最新分数仍建议在投稿或复现实验前再次人工核验。
- Radford et al., “Learning Transferable Visual Models From Natural Language Supervision / CLIP,” OpenAI, 2021. https://openai.com/index/clip/ ,论文:https://arxiv.org/abs/2103.00020
- Alayrac et al., “Flamingo: a Visual Language Model for Few-Shot Learning,” DeepMind, 2022. https://deepmind.google/blog/tackling-multiple-tasks-with-a-single-visual-language-model/ ,论文:https://arxiv.org/abs/2204.14198
- Li et al., “BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models,” arXiv, 2023. https://arxiv.org/abs/2301.12597
- Liu et al., “Visual Instruction Tuning / LLaVA,” NeurIPS 2023 Oral, project and code. https://github.com/haotian-liu/LLaVA ,论文:https://arxiv.org/abs/2304.08485
- LLaVA-OneVision documentation, LLaVA-NeXT. https://github.com/LLaVA-VL/LLaVA-NeXT/blob/main/docs/LLaVA_OneVision.md
- Bai et al., “Qwen2.5-VL Technical Report,” arXiv, 2025. https://arxiv.org/abs/2502.13923 ,GitHub:https://github.com/QwenLM/Qwen2.5-VL
- Qwen Team, “Qwen3-VL Technical Report,” arXiv, 2025; official repo and blog. https://arxiv.org/abs/2511.21631 ,https://github.com/QwenLM/Qwen3-VL ,https://qwen.ai/blog?id=99f0335c4ad9ff6153e517418d48535ab6d8afef
- Zhu et al., “InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models,” arXiv, 2025; project page. https://internvl.github.io/blog/2025-04-11-InternVL-3.0/ ,https://github.com/OpenGVLab/InternVL
- Wang et al., “InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency,” arXiv, 2025. https://huggingface.co/papers/2508.18265
- Deitke et al., “Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Multimodal Models,” arXiv, 2024; Ai2 blog/repo. https://arxiv.org/abs/2409.17146 ,https://allenai.org/blog/molmo ,https://github.com/allenai/molmo
- Meta, “Llama 3.2 Vision Model Card,” 2024. https://github.com/meta-llama/llama-models/blob/main/models/llama3_2/MODEL_CARD_VISION.md
- OpenAI, “GPT-4o System Card,” 2024. https://openai.com/index/gpt-4o-system-card/
- Google, “Gemini 2.5: Our most intelligent AI model,” 2025. https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-model-thinking-updates-march-2025/
- Xu et al., “Qwen2.5-Omni Technical Report,” arXiv, 2025. https://arxiv.org/abs/2503.20215
- Yue et al., “MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark,” CVPR 2024 Oral. https://arxiv.org/abs/2311.16502
- Lu et al., “MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts,” ICLR 2024 Oral. https://mathvista.github.io/
- OpenCompass, “MMBench: Is Your Multi-modal Model an All-around Player?” official repo. https://github.com/open-compass/MMBench
- Fu et al., “Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis,” arXiv, 2024. https://video-mme.github.io/home_page.html
- Chen et al., “MMStar: Are We on the Right Way for Evaluating Large Vision-Language Models?” NeurIPS 2024. https://mmstar-benchmark.github.io/
- Wang et al., “CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs,” NeurIPS 2024 Datasets & Benchmarks. https://proceedings.neurips.cc/paper_files/paper/2024/hash/cdf6f8e9fd9aeaf79b6024caec24f15b-Abstract-Datasets_and_Benchmarks_Track.html ,repo:https://github.com/princeton-nlp/CharXiv
- Yang et al., “CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy,” ICCV 2025. https://mlanthology.org/iccv/2025/yang2025iccv-ccocr/