今天这批论文如果放在一起看,我觉得最明显的一条线,不是“谁又把模型做得更大了”,而是:
大家越来越在认真处理 AI 系统里的“结构问题”。
这里的结构,不只是模型层数或参数量,而是更广义的那种结构:
- 多模态模型到底该不该继续依赖独立视觉编码器
- 视频生成是不是必须显式服从 3D 几何一致性
- 临床 AI 评测能不能从“找专家逐条打分”进化到更可扩展的 rubric 体系
- RoPE 这类看似已经固定的基础组件,是否其实还藏着一整块可学习空间
- 多分类学习里悬了很多年的 sample complexity 问题,到底能不能被真正补完
它们看起来横跨很不同的方向:
- 多模态
- 视频生成
- 医疗 AI 评测
- Transformer 结构
- 理论机器学习
但拼在一起,反而能看出一个越来越清晰的趋势:
AI 研究正在从“把能力堆出来”转向“把系统里的关键结构重新设计清楚”。
今天我挑 5 篇来盘,分别来自统一多模态、世界模拟视频生成、医疗 AI 评测、RoPE 改造和学习理论。
如果你最近更关心“下一步真正值得长期跟的方向是什么”,今天这组论文我觉得挺有代表性。
1)Tuna-2:多模态模型,真的还需要独立视觉编码器吗?
- arXiv:2604.24763
- 标题:Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation
- 方向:统一多模态模型 / 原生像素建模 / understanding + generation
这篇论文很适合接在最近那条多模态主线上看。
过去主流统一多模态模型通常有一个默认前提:
- 理解任务用一个预训练视觉编码器
- 生成任务可能再走另一个 latent 表示路径
- 模型最终在不同视觉表示之间做折中
问题是,这套做法虽然工程上实用,但一直存在一个绕不过去的矛盾:
理解和生成吃的不是同一套视觉表示。
于是就会有:
- 任务间表征错位
- 训练目标不完全一致
- 很难从原始像素端到端统一优化
Tuna-2 的核心主张很激进也很直接:
把独立 vision encoder 干掉,直接用 pixel embeddings 做统一多模态建模。
也就是说,它不再把视觉输入先交给一个模块化的预训练视觉主干,而是更像把视觉 patch embedding 当作原生输入入口。
作者认为这样有两个关键收益:
第一,理解和生成终于共享了一套更统一的视觉表示
这意味着模型不需要在“看图”和“生成图”之间来回切换不同语义空间。
对于统一多模态系统来说,这非常重要。
因为一个系统如果既要看、又要说、又要生成,表示空间越碎,长期越容易形成能力割裂。
第二,端到端像素学习可能比很多人想象得更能扩展
论文的实验结论很有意思:
- 带 encoder 的变体在训练早期收敛更快
- 但 encoder-free 的 Tuna-2 在规模上来之后,多模态理解尤其是细粒度视觉感知更强
这其实很像很多深度学习方向反复出现的一种现象:
模块化 inductive bias 在前期更省力,但端到端路线在足够规模和数据下,未必没有后劲。
我觉得这篇论文最值得关注的地方,不是“以后所有视觉编码器都会被替代”,而是它在认真挑战一个过去太容易被当成默认选项的设计:
统一多模态模型,到底该不该继续把视觉理解和视觉生成绑在两个不同前端上。
如果后续这条线继续跑通,它对多模态系统结构可能会有很大影响。
2)World-R1:视频生成要想更像世界模拟,3D 约束迟早得补上
- arXiv:2604.24764
- 标题:Reinforcing 3D Constraints for Text-to-Video Generation
- 方向:text-to-video / world simulation / reinforcement learning / 3D consistency
这篇论文切的点我觉得非常关键。
现在视频生成模型看起来已经很强了,很多 demo 第一眼也足够惊艳。
但只要你认真多看几秒,问题就经常暴露出来:
- 几何关系前后不一致
- 视角变化不稳定
- 物体结构会飘
- 场景虽然“像动起来了”,却并不真的像一个稳定世界
这说明一个越来越明确的事实:
高质量视频生成,不只是时间连续性问题,还是隐式世界建模问题。
World-R1 提出的思路是,不去大改底层架构,而是通过强化学习把 3D 约束“压”回视频模型里。
它的做法里有两个点很值得注意:
第一,它把 3D 一致性问题交给外部 foundation model 反馈来监督
作者用预训练 3D foundation models 和 vision-language models 提供反馈信号,去约束生成视频在结构上更一致。
也就是说,它不是只靠像素重建式目标,而是引入了更偏“世界合理性”的外部判断。
第二,它强调不改架构、而是靠 RL 对齐几何一致性
这点很工程化。
因为现在很多方法一提 3D priors,就容易把系统做得非常重:
- 改 backbone
- 加复杂结构分支
- 训练成本上升
- 可扩展性下降
World-R1 的价值在于,它试图证明:
几何一致性未必要靠架构大手术,也可以靠后训练阶段的奖励建模与优化策略补回来。
论文里还提到一个 periodic decoupled training 策略,用来平衡:
- 刚性几何一致性
- 动态场景流动性
这很重要。
因为视频生成里一个常见问题是:
- 几何太强,画面容易僵
- 动态太自由,结构又会散
所以真正难的不是单纯“加 3D”,而是怎么让视频既像一个有结构的世界,又保留自然动态。
我觉得这篇论文代表的是一个越来越清晰的趋势:
视频模型如果想往 world simulator 方向走,迟早要显式面对结构一致性,而不是只做更会动的像素生成。
3)Clinical Rubrics:临床 AI 评测,可能真的要从“模型评模型”走向“病例级 rubric 体系”
- arXiv:2604.24710
- 标题:Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters
- 方向:clinical AI evaluation / rubric-based assessment / LLM-clinician agreement
这篇论文我觉得特别有现实感。
现在大家都知道,临床 AI 真正上线时最难的不只是模型效果本身,而是:
你到底怎么评它,而且这个评测还得能跟上模型快速迭代。
传统方案的问题非常明显:
- 每个 case 都找专家人工打分,太贵
- 速度慢,难以支持频繁迭代
- 小样本专家审核很难覆盖复杂场景
- 如果没有稳定评测框架,系统改一版就像重新摸黑
这篇论文的思路是做 case-specific rubrics。
核心不是搞一个泛泛的总分,而是:
- 让临床医生针对具体病例写 rubric
- 再用 rubric 去稳定比较模型输出优劣
- 同时检验 LLM 生成的 rubric 是否能逼近医生判断
数据规模其实不小:
- 20 位 clinician
- 1,646 份 rubric
- 823 个病例
- 覆盖 primary care、psychiatry、oncology、behavioral health
我觉得这篇最值得注意的,是它把“临床专家判断”拆成了一种更可复用的结构化资产。
也就是说,评测不再只是一次性人工劳动,而是逐渐变成:
病例级、规则化、可自动化复用的评测基础设施。
结果也很有意思:
- clinician-authored rubrics 能有效拉开高低质量输出
- 后期实验中,LLM 与 clinician 的 ranking agreement,已经接近甚至超过 clinician-clinician agreement
- 而且成本大约低了三个数量级
这里当然不能轻易得出“以后不用医生了”的结论。
这篇论文真正稳的说法其实是:
临床专家应该继续定义基准,而 LLM rubric 可以在这个基准之上,把评测覆盖率和速度大幅拉高。
这对医疗 AI 特别关键。
因为高风险领域最缺的,从来不是“再多一个 benchmark 分数”,而是:
- 临床有效
- 能持续更新
- 能支持安全迭代
- 成本还能承受
如果你最近在看 AI 医疗、EHR assistant、临床文档自动化,这篇论文挺值得细读。
4)SIREN-RoPE:RoPE 这块看似固定的地基,可能还远没挖完
- arXiv:2604.24717
- 标题:Learning to Rotate: Temporal and Semantic Rotary Encoding for Sequential Modeling
- 方向:Transformer / RoPE / sequential modeling / recommender systems
这篇论文切的角度我挺喜欢,因为它盯的是一个大家太容易“默认接受”的组件:RoPE。
现在很多 Transformer 系统里,RoPE 已经几乎变成基础设施。
大家讨论更多的是:
- context length 能拉多长
- 插值怎么做
- 外推稳不稳
但这篇论文反过来问了一个更根本的问题:
我们是不是把 RoPE 的“旋转空间”想得太死了?
传统 RoPE 的做法,本质上是:
- 根据离散位置 index
- 用一个手工设计好的旋转结构
- 给 attention 引入相对位置信息
作者认为,这个 rotation manifold 本身其实也是一个可建模空间,而不是只能由固定位置编号来填充。
于是他们提出 SIREN-RoPE,用双分支 SIREN 去把多种异质信号注入旋转维度,比如:
- 连续时间戳
- 周期性时间模式
- 类别元数据
这个想法很有意思。
因为它相当于在说:
attention 里的旋转不一定只编码“第几个 token”,也可以编码“这个 token 在什么时间、什么上下文类型、什么动态关系里出现”。
作者把这个空间看成一种与语义 embedding 正交的“动态维度”,这个表述虽然有点理论味,但直觉上是成立的。
尤其在:
- feed ranking
- recommendation
- time-aware sequence modeling
- 带 metadata 的序列建模
这类场景里,离散位置本来就不是全部。
论文在生产级新闻流推荐数据上验证,能在 calibration 和 ranking 目标上带来持续改进,而且额外计算开销不大。
我觉得这篇论文最值得带走的不是它具体用了 SIREN,而是它提醒了一件很容易被忽略的事:
Transformer 里那些“看起来已经固定”的组件,未必真的已经被开发到头。
很多时候,模型主干能力已经很强,但基础编码机制里仍然可能藏着新的可学习维度。
5)多分类学习 sample complexity:一个老问题,终于又被往前推进了一大步
- arXiv:2604.24749
- 标题:The Optimal Sample Complexity of Multiclass and List Learning
- 方向:learning theory / multiclass classification / sample complexity
最后这篇偏理论,但我觉得非常值得放进今天这组里。
原因是:
很多人会把现在的 AI 研究理解成只剩工程堆栈和算力竞赛,但底层学习理论里,一些老问题其实还在稳步推进。
这篇论文讨论的是多分类学习的最优 sample complexity。
二分类里,VC dimension 对 sample complexity 的刻画已经非常成熟。
但多分类问题长期更麻烦,核心复杂度参数是 DS dimension,而相关 upper/lower bound 之间一直卡着一个 sqrt(DS) 的 gap。
这篇工作的意义在于,它基于 2026 年前人的一个代数刻画结果,进一步证明了一个长期 conjecture,并据此给出了 multiclass 以及 list learning 在 DS dimension 上的最优依赖关系。
对很多偏应用的人来说,这听起来可能有点远。
但我觉得它的重要性其实很实在。
因为 sample complexity 问题本质上是在回答:
- 这类学习问题到底需要多少数据才够
- 复杂度应该由什么结构量刻画
- 上界和下界之间到底还有没有真空
这种问题虽然不直接产出一个更能跑 benchmark 的模型,但它决定了我们怎样更准确地理解:
某类学习任务的难,到底难在什么维度上。
尤其今天很多大模型工作越来越经验主义,理论上这种把长期悬而未决的问题再往前推一步的工作,反而更显得珍贵。
最后总结
今天这 5 篇论文如果放在一起看,我觉得它们共同指向的是一件事:
AI 系统正在从“先把能力做出来”转向“把关键结构重新定义清楚”。
具体体现在:
- Tuna-2 在重问统一多模态系统到底要不要依赖独立视觉编码器
- World-R1 在重问视频生成要不要显式服从世界几何结构
- Clinical Rubrics 在重问高风险领域评测到底该怎样规模化
- SIREN-RoPE 在重问 Transformer 里的旋转编码空间是否还能继续学习
- 多分类 sample complexity 工作则在重问一个老理论问题的最优刻画到底是什么
这类论文有一个共同特征:
它们并不是简单把已有路线“再放大一点”,而是试图把一块默认存在的结构重新拆开、重建、再验证。
而这往往才是长期最有价值的进展。
如果你最近不只是想追新模型 headline,而是想判断未来哪些方向更可能形成持续影响,我觉得今天这组论文挺值得留档。