今天这批论文如果放在一起看,我觉得最明显的一条线不是“模型又变大了”,而是:
大家越来越在认真处理 AI 系统里的“中间层问题”。
什么叫中间层问题?
不是最底层的 backbone,也不是最表层的 benchmark 分数,而是那些决定系统到底能不能稳定工作的连接层:
- 测试时扩展策略,到底该靠人手工调,还是让 agent 自己发现
- 自动驾驶这么多异构数据,究竟有没有可能先统一成一套可复用基础设施
- 视觉语言模型想要真正理解 3D 世界,视觉 token 表示该怎么压缩、对齐和注入
- 图像生成后训练,怎么避免多目标奖励一上来就互相打架
- 知识图谱问答要想可信,怎么把“有解释路径”和“有统计校准”真正接起来
它们看起来分属不同方向:
- LLM 推理
- 自动驾驶数据工程
- 3D 视觉语言模型
- 文生图后训练
- 可信问答
但拼在一起,你会看到一个越来越清晰的趋势:
AI 研究正在从“把能力做出来”转向“把能力接稳、接省、接可信”。
今天我挑 5 篇来盘,分别代表测试时策略搜索、数据基础设施、3D 表示、多目标图像对齐和可信路径推理这五条线。
如果你最近更关心“哪些方向更可能直接影响真实系统”,今天这组论文我觉得挺值得看。
1)AutoTTS:测试时扩展,不一定非得靠人拍脑袋设计策略
- arXiv:2605.08083
- 标题:LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling
- 方向:test-time scaling / agentic discovery / reasoning control
过去一年,test-time scaling 已经变成推理模型里最常见的关键词之一。
大家默认接受的一种做法是:
- 多采样几条推理路径
- 适当分支、回看、剪枝
- 再加一些 probe、打分、投票、选择策略
问题在于,这些策略大多还是人工设计的。
也就是说,虽然我们在说“让模型多想一会儿”,但“怎么想、什么时候停、什么时候分叉、什么时候回退”,往往还是研究者自己凭经验凑出来的。
AutoTTS 这篇论文想改的,正是这里。
它的核心主张是:
与其手工设计一套 test-time scaling 规则,不如把规则搜索本身变成 agent 可以自动完成的任务。
这篇论文最有意思的地方有两个
第一,它不是直接暴力搜索,而是先把“可搜索环境”搭出来
论文很强调 environment construction。
这是关键点。
因为测试时扩展策略的动作空间如果不先整理清楚,所谓“自动发现”很容易直接变成:
- 搜索空间太大
- LLM 调用成本太高
- 每次验证一个策略都太贵
- 最后方法本身比收益还贵
所以作者做了一个很工程化的折中:
- 基于预先收集好的 reasoning trajectories 和 probe signals
- 让 controller 去决定何时 branch、continue、probe、prune、stop
- 在不重复大量调用底模的前提下,便宜地评估策略
这就把问题从“在线昂贵搜索”变成了“离线环境内的可控策略发现”。
第二,它代表了一个值得长期关注的方向:把研究者手写 heuristics 变成可学习控制器
我觉得这件事的重要性,不只是 test-time scaling。
它更像是在说:
很多今天还靠人手调的推理流程,未来都可能被重新表述成“控制器学习问题”。
包括:
- 何时检索
- 何时多采样
- 何时停机
- 何时调用 critic
- 何时回滚到更保守策略
论文里给出的结果也挺亮眼:
- 数学推理 benchmark 上能改善 accuracy-cost tradeoff
- 发现成本不高,报告里甚至强调整个 discovery 过程只花了几十美元量级
这篇论文最值得带走的不是“又一个 test-time scaling 技巧”,而是它在认真推进一个更大的方向:
推理策略本身,也可以被 agent 化。
2)123D:自动驾驶研究一个长期痛点,终于有人先从“数据统一层”下手了
- arXiv:2605.08084
- 标题:123D: Unifying Multi-Modal Autonomous Driving Data at Scale
- 方向:autonomous driving / multimodal data infrastructure / dataset unification
自动驾驶这么多年,数据其实一直特别丰富。
但一个尴尬事实是:
“丰富”不等于“能一起用”。
不同数据集之间经常有这些问题:
- 模态不一样:camera、lidar、ego state、traffic light、HD map 各自组织方式不同
- 采样率不同,时序对齐很麻烦
- 标注体系不一致
- 文件格式、工具链、依赖栈割裂
- 你能在一个数据集上复现实验,不代表能顺手迁到另一个
123D 这篇论文做的事情看起来没那么 flashy,但我觉得特别重要:
它试图把自动驾驶多模态数据先变成一套统一 API 下的“事件流基础设施”。
为什么这个思路很对?
因为很多人谈自动驾驶 foundation model,默认都在看:
- 模型结构
- policy learning
- world model
- planning
但现实里,大量时间其实耗在更底层的事情上:
- 数据怎么读
- 模态怎么对齐
- 不同数据集的语义怎么统一
- 训练和评测到底能不能跨集迁移
如果这层不解决,上层很多“统一模型”都会被基础设施拖住。
123D 的一个关键设计:每种模态都被看作独立 timestamped event stream
这个设计非常实用。
因为现实中的驾驶传感器本来就不是整齐同步的。
如果系统强行要求:
- 所有模态同频
- 所有数据硬对齐
- 所有数据按一种刚性格式组织
那么一到跨数据集整合,就会非常痛苦。
123D 反过来做:
- 每个模态是自己的事件流
- 同步或异步访问都能支持
- 跨数据集的数据接入逻辑更统一
从系统设计上,这其实比“造一个新 benchmark”更有长远价值。
我为什么觉得这篇值得关注?
因为它代表的是一种成熟信号:
自动驾驶研究开始把“数据统一层”当成第一等问题,而不是默认前置条件。
而只要数据层真正被统一,后面很多事情都会更顺:
- cross-dataset transfer
- 规划与强化学习复用
- world model 预训练
- 数据质量与标注偏差分析
这类工作短期可能没有最强模型 headline 那么吸睛,但从长期看,它往往更能决定一个方向能不能真正扩展起来。
3)Proxy3D:VLM 想要真正理解 3D 世界,关键可能不是更多像素,而是更好的代理表示
- arXiv:2605.08064
- 标题:Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment
- 方向:VLM / 3D spatial intelligence / representation alignment
这篇论文切的是一个很值得继续盯的方向:
视觉语言模型怎样才能真正获得稳定的 3D 空间理解能力。
现在很多 VLM 还是典型的 2D pipeline:
- 图像进来
- 变成视觉 token
- 再接入语言模型
这套方法在通用看图问答上没问题,但一旦任务变成:
- 3D grounding
- 跨视角空间一致性
- 视频中的空间关系推理
- 真实环境里的对象布局理解
2D token 表示就容易开始露出短板。
Proxy3D 的核心想法很清楚:
不要把所有视觉信息都保持在像素对齐层面,而是先提炼出更紧凑、更有几何语义的 3D proxies。
论文里的做法是:
- 从视频帧中提取语义和几何特征
- 在 3D 空间里做语义感知聚类
- 得到一组 compact 的 proxy 表示
- 再通过多阶段训练把这套表示和 VLM 对齐
这篇论文的价值,不只是“更省 token”
更关键的是,它在回答一个系统问题:
VLM 该用什么样的表示进入语言侧,才既保住空间一致性,又不会让视觉序列长度爆炸。
这是多模态系统里特别现实的矛盾:
- 保留更多像素细节,token 很快爆
- 压得太狠,3D 关系又不稳
Proxy3D 这种 proxy-based 表示,正是在试图找一个中间点。
为什么我觉得这条线很重要?
因为未来很多多模态任务都不是“看一张图说一句话”这么简单,而是更偏:
- spatial intelligence
- embodied reasoning
- video-grounded QA
- GUI / environment interaction
到了这些任务里,2D token 直灌 LLM 的路线,很可能越来越不够。
所以我会把这篇论文看作一个明确的信号:
多模态系统下一步竞争的关键,不只是底模大小,而是谁先把视觉世界压成一种更适合推理的结构化表示。
4)Flow-OPD:图像生成后训练,越来越像“多教师知识整合”而不只是单一奖励强化
- arXiv:2605.08063
- 标题:Flow-OPD: On-Policy Distillation for Flow Matching Models
- 方向:text-to-image / post-training / reward alignment / distillation
图像生成后训练最近也越来越像 LLM 社区了。
大家都开始谈:
- RL 对齐
- reward hacking
- 多目标权衡
- on-policy 采样
- 冷启动与蒸馏
这篇论文的切入点我觉得非常准。
它指出,Flow Matching 文生图模型在做多任务对齐时,常见有两个大坑:
- 标量 reward 太稀疏
- 多个异质目标一起训时,梯度互相干扰
最后就会出现很典型的 seesaw effect:
- 提高一个指标
- 另一个指标掉下去
- 模型开始学会投机拿分,而不是真的整体变好
Flow-OPD 的核心做法:先把不同目标训成各自擅长的 teacher,再慢慢蒸馏回一个 student
这个思路非常像“先分科,再统考”。
论文里的两阶段设计大致是:
- 先用单一 reward 把不同 teacher 分别推到各自 ceiling
- 再通过 on-policy distillation,把多种专长合回一个 student
此外还加了:
- Flow-based cold start
- task routing labeling
- trajectory-level dense supervision
- Manifold Anchor Regularization 作为通用质量锚点
这件事为什么重要?
因为它反映出一个越来越清楚的现实:
生成模型后训练的难点,不只是“有没有奖励”,而是“如何在不互相拉扯的情况下整合多种奖励”。
这和 LLM 的后训练越来越像。
模型不是只追一个指标,而是同时要顾:
- 指令跟随
- 审美质量
- OCR 正确率
- 结构一致性
- 人偏好
如果全都糊成一个 reward 去硬训,通常很快就会乱。
我对这篇论文的判断
它最值得关注的地方,不一定是具体提升了多少分,而是它代表了一条会越来越常见的方法论:
通用生成模型的后训练,未来更像多专家蒸馏与策略整合,而不只是单模型上直接做 RL。
这条线如果继续成熟,后面不只是文生图,视频、多模态生成、甚至 agent policy alignment 都可能借鉴这种“teacher specialization → student consolidation”的套路。
5)CPR:KGQA 要想真正可信,光有解释路径还不够,还得把覆盖率校准补上
- arXiv:2605.08077
- 标题:Conformal Path Reasoning: Trustworthy Knowledge Graph Question Answering via Path-Level Calibration
- 方向:KGQA / conformal prediction / trustworthy reasoning
知识图谱问答一直有个很吸引人的点:
它天然比纯文本生成更像“有证据可查”的推理。
因为模型往往会沿着图中的关系路径去找答案。
但问题是,“有路径”不等于“可信”。
现实里依然会出现:
- 覆盖率不稳定
- prediction set 太大
- calibration 失效
- 模型看起来给了推理路径,但统计意义上并不可靠
这篇论文要补的,正是这一层。
CPR 的核心想法:
把 conformal prediction 真正做进 path-level reasoning,而不是只在答案层面做一个松散外壳。
它做了两件关键事:
第一,做 query-level conformal calibration,但校准对象是 path-level score
这点很重要。
因为 KGQA 的本体不是单个答案 token,而是通往答案的候选路径结构。
如果只在最后答案层做 conformal,很多中间信息其实已经丢掉了。
CPR 把 path score 直接纳入校准对象,等于更贴近 KGQA 本身的推理单元。
第二,它加了一个 Residual Conformal Value Network 去学更有区分度的非一致性分数
这也是很关键的工程补丁。
因为 conformal 方法很多时候理论漂亮,但真进复杂任务后常见问题就是:
- score 太粗
- set 变得很大
- 虽然覆盖率上去了,但可用性下降
所以作者专门设计轻量模块去提升 path-level score 的可分性。
这篇论文最值得关注的地方是什么?
我觉得不是 KGQA 这个具体任务,而是它背后那种更普遍的趋势:
AI 系统正在尝试把“结构化推理”和“统计校准保证”真正接在一起。
这在未来会越来越重要。
因为只要系统进入高风险或高价值场景,大家就会追问:
- 不只是答案是什么
- 还要知道这条答案的可信边界是什么
- 在多大概率上会覆盖正确答案
- prediction set 大小是否还能用
这种“有结构解释 + 有统计保证”的组合,很可能会比单纯更强的生成能力更有长远价值。
最后总结
今天这 5 篇论文如果放在一起看,我觉得它们共同指向的是一件事:
AI 研究正在认真补“系统中间层”。
具体来说:
- AutoTTS 在补推理阶段的策略发现层
- 123D 在补自动驾驶的数据统一层
- Proxy3D 在补 VLM 的 3D 表示层
- Flow-OPD 在补图像生成的多目标后训练层
- CPR 在补结构化问答的可信校准层
它们都不是那种“把模型再大一圈”的工作。
但恰恰是这类工作,往往更能决定系统最后是不是:
- 真的能扩展
- 真的能迁移
- 真的能对齐
- 真的能被信任
如果用一句话概括今天这批论文,我会写成:
下一阶段 AI 的差距,越来越不只是主模型能力差距,而是谁先把连接能力、表示能力、训练能力和可信能力这些中间层做扎实。
如果你最近追论文不只是为了看 headline,而是想找那些更可能影响真实系统设计的方向,今天这组我觉得很值得留档。