今天这批论文如果放在一起看,我觉得最明显的一条线不是“模型又变大了”,而是:

大家越来越在认真处理 AI 系统里的“中间层问题”。

什么叫中间层问题?

不是最底层的 backbone,也不是最表层的 benchmark 分数,而是那些决定系统到底能不能稳定工作的连接层:

  • 测试时扩展策略,到底该靠人手工调,还是让 agent 自己发现
  • 自动驾驶这么多异构数据,究竟有没有可能先统一成一套可复用基础设施
  • 视觉语言模型想要真正理解 3D 世界,视觉 token 表示该怎么压缩、对齐和注入
  • 图像生成后训练,怎么避免多目标奖励一上来就互相打架
  • 知识图谱问答要想可信,怎么把“有解释路径”和“有统计校准”真正接起来

它们看起来分属不同方向:

  • LLM 推理
  • 自动驾驶数据工程
  • 3D 视觉语言模型
  • 文生图后训练
  • 可信问答

但拼在一起,你会看到一个越来越清晰的趋势:

AI 研究正在从“把能力做出来”转向“把能力接稳、接省、接可信”。

今天我挑 5 篇来盘,分别代表测试时策略搜索、数据基础设施、3D 表示、多目标图像对齐和可信路径推理这五条线。

如果你最近更关心“哪些方向更可能直接影响真实系统”,今天这组论文我觉得挺值得看。


1)AutoTTS:测试时扩展,不一定非得靠人拍脑袋设计策略

  • arXiv:2605.08083
  • 标题:LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling
  • 方向:test-time scaling / agentic discovery / reasoning control

过去一年,test-time scaling 已经变成推理模型里最常见的关键词之一。

大家默认接受的一种做法是:

  • 多采样几条推理路径
  • 适当分支、回看、剪枝
  • 再加一些 probe、打分、投票、选择策略

问题在于,这些策略大多还是人工设计的。

也就是说,虽然我们在说“让模型多想一会儿”,但“怎么想、什么时候停、什么时候分叉、什么时候回退”,往往还是研究者自己凭经验凑出来的。

AutoTTS 这篇论文想改的,正是这里。

它的核心主张是:

与其手工设计一套 test-time scaling 规则,不如把规则搜索本身变成 agent 可以自动完成的任务。

这篇论文最有意思的地方有两个

第一,它不是直接暴力搜索,而是先把“可搜索环境”搭出来

论文很强调 environment construction。

这是关键点。

因为测试时扩展策略的动作空间如果不先整理清楚,所谓“自动发现”很容易直接变成:

  • 搜索空间太大
  • LLM 调用成本太高
  • 每次验证一个策略都太贵
  • 最后方法本身比收益还贵

所以作者做了一个很工程化的折中:

  • 基于预先收集好的 reasoning trajectories 和 probe signals
  • 让 controller 去决定何时 branch、continue、probe、prune、stop
  • 在不重复大量调用底模的前提下,便宜地评估策略

这就把问题从“在线昂贵搜索”变成了“离线环境内的可控策略发现”。

第二,它代表了一个值得长期关注的方向:把研究者手写 heuristics 变成可学习控制器

我觉得这件事的重要性,不只是 test-time scaling。

它更像是在说:

很多今天还靠人手调的推理流程,未来都可能被重新表述成“控制器学习问题”。

包括:

  • 何时检索
  • 何时多采样
  • 何时停机
  • 何时调用 critic
  • 何时回滚到更保守策略

论文里给出的结果也挺亮眼:

  • 数学推理 benchmark 上能改善 accuracy-cost tradeoff
  • 发现成本不高,报告里甚至强调整个 discovery 过程只花了几十美元量级

这篇论文最值得带走的不是“又一个 test-time scaling 技巧”,而是它在认真推进一个更大的方向:

推理策略本身,也可以被 agent 化。


2)123D:自动驾驶研究一个长期痛点,终于有人先从“数据统一层”下手了

  • arXiv:2605.08084
  • 标题:123D: Unifying Multi-Modal Autonomous Driving Data at Scale
  • 方向:autonomous driving / multimodal data infrastructure / dataset unification

自动驾驶这么多年,数据其实一直特别丰富。

但一个尴尬事实是:

“丰富”不等于“能一起用”。

不同数据集之间经常有这些问题:

  • 模态不一样:camera、lidar、ego state、traffic light、HD map 各自组织方式不同
  • 采样率不同,时序对齐很麻烦
  • 标注体系不一致
  • 文件格式、工具链、依赖栈割裂
  • 你能在一个数据集上复现实验,不代表能顺手迁到另一个

123D 这篇论文做的事情看起来没那么 flashy,但我觉得特别重要:

它试图把自动驾驶多模态数据先变成一套统一 API 下的“事件流基础设施”。

为什么这个思路很对?

因为很多人谈自动驾驶 foundation model,默认都在看:

  • 模型结构
  • policy learning
  • world model
  • planning

但现实里,大量时间其实耗在更底层的事情上:

  • 数据怎么读
  • 模态怎么对齐
  • 不同数据集的语义怎么统一
  • 训练和评测到底能不能跨集迁移

如果这层不解决,上层很多“统一模型”都会被基础设施拖住。

123D 的一个关键设计:每种模态都被看作独立 timestamped event stream

这个设计非常实用。

因为现实中的驾驶传感器本来就不是整齐同步的。

如果系统强行要求:

  • 所有模态同频
  • 所有数据硬对齐
  • 所有数据按一种刚性格式组织

那么一到跨数据集整合,就会非常痛苦。

123D 反过来做:

  • 每个模态是自己的事件流
  • 同步或异步访问都能支持
  • 跨数据集的数据接入逻辑更统一

从系统设计上,这其实比“造一个新 benchmark”更有长远价值。

我为什么觉得这篇值得关注?

因为它代表的是一种成熟信号:

自动驾驶研究开始把“数据统一层”当成第一等问题,而不是默认前置条件。

而只要数据层真正被统一,后面很多事情都会更顺:

  • cross-dataset transfer
  • 规划与强化学习复用
  • world model 预训练
  • 数据质量与标注偏差分析

这类工作短期可能没有最强模型 headline 那么吸睛,但从长期看,它往往更能决定一个方向能不能真正扩展起来。


3)Proxy3D:VLM 想要真正理解 3D 世界,关键可能不是更多像素,而是更好的代理表示

  • arXiv:2605.08064
  • 标题:Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment
  • 方向:VLM / 3D spatial intelligence / representation alignment

这篇论文切的是一个很值得继续盯的方向:

视觉语言模型怎样才能真正获得稳定的 3D 空间理解能力。

现在很多 VLM 还是典型的 2D pipeline:

  • 图像进来
  • 变成视觉 token
  • 再接入语言模型

这套方法在通用看图问答上没问题,但一旦任务变成:

  • 3D grounding
  • 跨视角空间一致性
  • 视频中的空间关系推理
  • 真实环境里的对象布局理解

2D token 表示就容易开始露出短板。

Proxy3D 的核心想法很清楚:

不要把所有视觉信息都保持在像素对齐层面,而是先提炼出更紧凑、更有几何语义的 3D proxies。

论文里的做法是:

  • 从视频帧中提取语义和几何特征
  • 在 3D 空间里做语义感知聚类
  • 得到一组 compact 的 proxy 表示
  • 再通过多阶段训练把这套表示和 VLM 对齐

这篇论文的价值,不只是“更省 token”

更关键的是,它在回答一个系统问题:

VLM 该用什么样的表示进入语言侧,才既保住空间一致性,又不会让视觉序列长度爆炸。

这是多模态系统里特别现实的矛盾:

  • 保留更多像素细节,token 很快爆
  • 压得太狠,3D 关系又不稳

Proxy3D 这种 proxy-based 表示,正是在试图找一个中间点。

为什么我觉得这条线很重要?

因为未来很多多模态任务都不是“看一张图说一句话”这么简单,而是更偏:

  • spatial intelligence
  • embodied reasoning
  • video-grounded QA
  • GUI / environment interaction

到了这些任务里,2D token 直灌 LLM 的路线,很可能越来越不够。

所以我会把这篇论文看作一个明确的信号:

多模态系统下一步竞争的关键,不只是底模大小,而是谁先把视觉世界压成一种更适合推理的结构化表示。


4)Flow-OPD:图像生成后训练,越来越像“多教师知识整合”而不只是单一奖励强化

  • arXiv:2605.08063
  • 标题:Flow-OPD: On-Policy Distillation for Flow Matching Models
  • 方向:text-to-image / post-training / reward alignment / distillation

图像生成后训练最近也越来越像 LLM 社区了。

大家都开始谈:

  • RL 对齐
  • reward hacking
  • 多目标权衡
  • on-policy 采样
  • 冷启动与蒸馏

这篇论文的切入点我觉得非常准。

它指出,Flow Matching 文生图模型在做多任务对齐时,常见有两个大坑:

  • 标量 reward 太稀疏
  • 多个异质目标一起训时,梯度互相干扰

最后就会出现很典型的 seesaw effect:

  • 提高一个指标
  • 另一个指标掉下去
  • 模型开始学会投机拿分,而不是真的整体变好

Flow-OPD 的核心做法:先把不同目标训成各自擅长的 teacher,再慢慢蒸馏回一个 student

这个思路非常像“先分科,再统考”。

论文里的两阶段设计大致是:

  1. 先用单一 reward 把不同 teacher 分别推到各自 ceiling
  2. 再通过 on-policy distillation,把多种专长合回一个 student

此外还加了:

  • Flow-based cold start
  • task routing labeling
  • trajectory-level dense supervision
  • Manifold Anchor Regularization 作为通用质量锚点

这件事为什么重要?

因为它反映出一个越来越清楚的现实:

生成模型后训练的难点,不只是“有没有奖励”,而是“如何在不互相拉扯的情况下整合多种奖励”。

这和 LLM 的后训练越来越像。

模型不是只追一个指标,而是同时要顾:

  • 指令跟随
  • 审美质量
  • OCR 正确率
  • 结构一致性
  • 人偏好

如果全都糊成一个 reward 去硬训,通常很快就会乱。

我对这篇论文的判断

它最值得关注的地方,不一定是具体提升了多少分,而是它代表了一条会越来越常见的方法论:

通用生成模型的后训练,未来更像多专家蒸馏与策略整合,而不只是单模型上直接做 RL。

这条线如果继续成熟,后面不只是文生图,视频、多模态生成、甚至 agent policy alignment 都可能借鉴这种“teacher specialization → student consolidation”的套路。


5)CPR:KGQA 要想真正可信,光有解释路径还不够,还得把覆盖率校准补上

  • arXiv:2605.08077
  • 标题:Conformal Path Reasoning: Trustworthy Knowledge Graph Question Answering via Path-Level Calibration
  • 方向:KGQA / conformal prediction / trustworthy reasoning

知识图谱问答一直有个很吸引人的点:

它天然比纯文本生成更像“有证据可查”的推理。

因为模型往往会沿着图中的关系路径去找答案。

但问题是,“有路径”不等于“可信”。

现实里依然会出现:

  • 覆盖率不稳定
  • prediction set 太大
  • calibration 失效
  • 模型看起来给了推理路径,但统计意义上并不可靠

这篇论文要补的,正是这一层。

CPR 的核心想法:

把 conformal prediction 真正做进 path-level reasoning,而不是只在答案层面做一个松散外壳。

它做了两件关键事:

第一,做 query-level conformal calibration,但校准对象是 path-level score

这点很重要。

因为 KGQA 的本体不是单个答案 token,而是通往答案的候选路径结构。

如果只在最后答案层做 conformal,很多中间信息其实已经丢掉了。

CPR 把 path score 直接纳入校准对象,等于更贴近 KGQA 本身的推理单元。

第二,它加了一个 Residual Conformal Value Network 去学更有区分度的非一致性分数

这也是很关键的工程补丁。

因为 conformal 方法很多时候理论漂亮,但真进复杂任务后常见问题就是:

  • score 太粗
  • set 变得很大
  • 虽然覆盖率上去了,但可用性下降

所以作者专门设计轻量模块去提升 path-level score 的可分性。

这篇论文最值得关注的地方是什么?

我觉得不是 KGQA 这个具体任务,而是它背后那种更普遍的趋势:

AI 系统正在尝试把“结构化推理”和“统计校准保证”真正接在一起。

这在未来会越来越重要。

因为只要系统进入高风险或高价值场景,大家就会追问:

  • 不只是答案是什么
  • 还要知道这条答案的可信边界是什么
  • 在多大概率上会覆盖正确答案
  • prediction set 大小是否还能用

这种“有结构解释 + 有统计保证”的组合,很可能会比单纯更强的生成能力更有长远价值。


最后总结

今天这 5 篇论文如果放在一起看,我觉得它们共同指向的是一件事:

AI 研究正在认真补“系统中间层”。

具体来说:

  • AutoTTS 在补推理阶段的策略发现层
  • 123D 在补自动驾驶的数据统一层
  • Proxy3D 在补 VLM 的 3D 表示层
  • Flow-OPD 在补图像生成的多目标后训练层
  • CPR 在补结构化问答的可信校准层

它们都不是那种“把模型再大一圈”的工作。

但恰恰是这类工作,往往更能决定系统最后是不是:

  • 真的能扩展
  • 真的能迁移
  • 真的能对齐
  • 真的能被信任

如果用一句话概括今天这批论文,我会写成:

下一阶段 AI 的差距,越来越不只是主模型能力差距,而是谁先把连接能力、表示能力、训练能力和可信能力这些中间层做扎实。

如果你最近追论文不只是为了看 headline,而是想找那些更可能影响真实系统设计的方向,今天这组我觉得很值得留档。