今天这批论文如果放在一起看,我觉得最明显的一条线,不是“谁又把模型做得更大了”,而是:

大家越来越在认真处理 AI 系统里的“结构问题”。

这里的结构,不只是模型层数或参数量,而是更广义的那种结构:

  • 多模态模型到底该不该继续依赖独立视觉编码器
  • 视频生成是不是必须显式服从 3D 几何一致性
  • 临床 AI 评测能不能从“找专家逐条打分”进化到更可扩展的 rubric 体系
  • RoPE 这类看似已经固定的基础组件,是否其实还藏着一整块可学习空间
  • 多分类学习里悬了很多年的 sample complexity 问题,到底能不能被真正补完

它们看起来横跨很不同的方向:

  • 多模态
  • 视频生成
  • 医疗 AI 评测
  • Transformer 结构
  • 理论机器学习

但拼在一起,反而能看出一个越来越清晰的趋势:

AI 研究正在从“把能力堆出来”转向“把系统里的关键结构重新设计清楚”。

今天我挑 5 篇来盘,分别来自统一多模态、世界模拟视频生成、医疗 AI 评测、RoPE 改造和学习理论。

如果你最近更关心“下一步真正值得长期跟的方向是什么”,今天这组论文我觉得挺有代表性。


1)Tuna-2:多模态模型,真的还需要独立视觉编码器吗?

  • arXiv:2604.24763
  • 标题:Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation
  • 方向:统一多模态模型 / 原生像素建模 / understanding + generation

这篇论文很适合接在最近那条多模态主线上看。

过去主流统一多模态模型通常有一个默认前提:

  • 理解任务用一个预训练视觉编码器
  • 生成任务可能再走另一个 latent 表示路径
  • 模型最终在不同视觉表示之间做折中

问题是,这套做法虽然工程上实用,但一直存在一个绕不过去的矛盾:

理解和生成吃的不是同一套视觉表示。

于是就会有:

  • 任务间表征错位
  • 训练目标不完全一致
  • 很难从原始像素端到端统一优化

Tuna-2 的核心主张很激进也很直接:

把独立 vision encoder 干掉,直接用 pixel embeddings 做统一多模态建模。

也就是说,它不再把视觉输入先交给一个模块化的预训练视觉主干,而是更像把视觉 patch embedding 当作原生输入入口。

作者认为这样有两个关键收益:

第一,理解和生成终于共享了一套更统一的视觉表示

这意味着模型不需要在“看图”和“生成图”之间来回切换不同语义空间。

对于统一多模态系统来说,这非常重要。

因为一个系统如果既要看、又要说、又要生成,表示空间越碎,长期越容易形成能力割裂。

第二,端到端像素学习可能比很多人想象得更能扩展

论文的实验结论很有意思:

  • 带 encoder 的变体在训练早期收敛更快
  • 但 encoder-free 的 Tuna-2 在规模上来之后,多模态理解尤其是细粒度视觉感知更强

这其实很像很多深度学习方向反复出现的一种现象:

模块化 inductive bias 在前期更省力,但端到端路线在足够规模和数据下,未必没有后劲。

我觉得这篇论文最值得关注的地方,不是“以后所有视觉编码器都会被替代”,而是它在认真挑战一个过去太容易被当成默认选项的设计:

统一多模态模型,到底该不该继续把视觉理解和视觉生成绑在两个不同前端上。

如果后续这条线继续跑通,它对多模态系统结构可能会有很大影响。


2)World-R1:视频生成要想更像世界模拟,3D 约束迟早得补上

  • arXiv:2604.24764
  • 标题:Reinforcing 3D Constraints for Text-to-Video Generation
  • 方向:text-to-video / world simulation / reinforcement learning / 3D consistency

这篇论文切的点我觉得非常关键。

现在视频生成模型看起来已经很强了,很多 demo 第一眼也足够惊艳。

但只要你认真多看几秒,问题就经常暴露出来:

  • 几何关系前后不一致
  • 视角变化不稳定
  • 物体结构会飘
  • 场景虽然“像动起来了”,却并不真的像一个稳定世界

这说明一个越来越明确的事实:

高质量视频生成,不只是时间连续性问题,还是隐式世界建模问题。

World-R1 提出的思路是,不去大改底层架构,而是通过强化学习把 3D 约束“压”回视频模型里。

它的做法里有两个点很值得注意:

第一,它把 3D 一致性问题交给外部 foundation model 反馈来监督

作者用预训练 3D foundation models 和 vision-language models 提供反馈信号,去约束生成视频在结构上更一致。

也就是说,它不是只靠像素重建式目标,而是引入了更偏“世界合理性”的外部判断。

第二,它强调不改架构、而是靠 RL 对齐几何一致性

这点很工程化。

因为现在很多方法一提 3D priors,就容易把系统做得非常重:

  • 改 backbone
  • 加复杂结构分支
  • 训练成本上升
  • 可扩展性下降

World-R1 的价值在于,它试图证明:

几何一致性未必要靠架构大手术,也可以靠后训练阶段的奖励建模与优化策略补回来。

论文里还提到一个 periodic decoupled training 策略,用来平衡:

  • 刚性几何一致性
  • 动态场景流动性

这很重要。

因为视频生成里一个常见问题是:

  • 几何太强,画面容易僵
  • 动态太自由,结构又会散

所以真正难的不是单纯“加 3D”,而是怎么让视频既像一个有结构的世界,又保留自然动态。

我觉得这篇论文代表的是一个越来越清晰的趋势:

视频模型如果想往 world simulator 方向走,迟早要显式面对结构一致性,而不是只做更会动的像素生成。


3)Clinical Rubrics:临床 AI 评测,可能真的要从“模型评模型”走向“病例级 rubric 体系”

  • arXiv:2604.24710
  • 标题:Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters
  • 方向:clinical AI evaluation / rubric-based assessment / LLM-clinician agreement

这篇论文我觉得特别有现实感。

现在大家都知道,临床 AI 真正上线时最难的不只是模型效果本身,而是:

你到底怎么评它,而且这个评测还得能跟上模型快速迭代。

传统方案的问题非常明显:

  • 每个 case 都找专家人工打分,太贵
  • 速度慢,难以支持频繁迭代
  • 小样本专家审核很难覆盖复杂场景
  • 如果没有稳定评测框架,系统改一版就像重新摸黑

这篇论文的思路是做 case-specific rubrics。

核心不是搞一个泛泛的总分,而是:

  • 让临床医生针对具体病例写 rubric
  • 再用 rubric 去稳定比较模型输出优劣
  • 同时检验 LLM 生成的 rubric 是否能逼近医生判断

数据规模其实不小:

  • 20 位 clinician
  • 1,646 份 rubric
  • 823 个病例
  • 覆盖 primary care、psychiatry、oncology、behavioral health

我觉得这篇最值得注意的,是它把“临床专家判断”拆成了一种更可复用的结构化资产。

也就是说,评测不再只是一次性人工劳动,而是逐渐变成:

病例级、规则化、可自动化复用的评测基础设施。

结果也很有意思:

  • clinician-authored rubrics 能有效拉开高低质量输出
  • 后期实验中,LLM 与 clinician 的 ranking agreement,已经接近甚至超过 clinician-clinician agreement
  • 而且成本大约低了三个数量级

这里当然不能轻易得出“以后不用医生了”的结论。

这篇论文真正稳的说法其实是:

临床专家应该继续定义基准,而 LLM rubric 可以在这个基准之上,把评测覆盖率和速度大幅拉高。

这对医疗 AI 特别关键。

因为高风险领域最缺的,从来不是“再多一个 benchmark 分数”,而是:

  • 临床有效
  • 能持续更新
  • 能支持安全迭代
  • 成本还能承受

如果你最近在看 AI 医疗、EHR assistant、临床文档自动化,这篇论文挺值得细读。


4)SIREN-RoPE:RoPE 这块看似固定的地基,可能还远没挖完

  • arXiv:2604.24717
  • 标题:Learning to Rotate: Temporal and Semantic Rotary Encoding for Sequential Modeling
  • 方向:Transformer / RoPE / sequential modeling / recommender systems

这篇论文切的角度我挺喜欢,因为它盯的是一个大家太容易“默认接受”的组件:RoPE。

现在很多 Transformer 系统里,RoPE 已经几乎变成基础设施。

大家讨论更多的是:

  • context length 能拉多长
  • 插值怎么做
  • 外推稳不稳

但这篇论文反过来问了一个更根本的问题:

我们是不是把 RoPE 的“旋转空间”想得太死了?

传统 RoPE 的做法,本质上是:

  • 根据离散位置 index
  • 用一个手工设计好的旋转结构
  • 给 attention 引入相对位置信息

作者认为,这个 rotation manifold 本身其实也是一个可建模空间,而不是只能由固定位置编号来填充。

于是他们提出 SIREN-RoPE,用双分支 SIREN 去把多种异质信号注入旋转维度,比如:

  • 连续时间戳
  • 周期性时间模式
  • 类别元数据

这个想法很有意思。

因为它相当于在说:

attention 里的旋转不一定只编码“第几个 token”,也可以编码“这个 token 在什么时间、什么上下文类型、什么动态关系里出现”。

作者把这个空间看成一种与语义 embedding 正交的“动态维度”,这个表述虽然有点理论味,但直觉上是成立的。

尤其在:

  • feed ranking
  • recommendation
  • time-aware sequence modeling
  • 带 metadata 的序列建模

这类场景里,离散位置本来就不是全部。

论文在生产级新闻流推荐数据上验证,能在 calibration 和 ranking 目标上带来持续改进,而且额外计算开销不大。

我觉得这篇论文最值得带走的不是它具体用了 SIREN,而是它提醒了一件很容易被忽略的事:

Transformer 里那些“看起来已经固定”的组件,未必真的已经被开发到头。

很多时候,模型主干能力已经很强,但基础编码机制里仍然可能藏着新的可学习维度。


5)多分类学习 sample complexity:一个老问题,终于又被往前推进了一大步

  • arXiv:2604.24749
  • 标题:The Optimal Sample Complexity of Multiclass and List Learning
  • 方向:learning theory / multiclass classification / sample complexity

最后这篇偏理论,但我觉得非常值得放进今天这组里。

原因是:

很多人会把现在的 AI 研究理解成只剩工程堆栈和算力竞赛,但底层学习理论里,一些老问题其实还在稳步推进。

这篇论文讨论的是多分类学习的最优 sample complexity。

二分类里,VC dimension 对 sample complexity 的刻画已经非常成熟。

但多分类问题长期更麻烦,核心复杂度参数是 DS dimension,而相关 upper/lower bound 之间一直卡着一个 sqrt(DS) 的 gap。

这篇工作的意义在于,它基于 2026 年前人的一个代数刻画结果,进一步证明了一个长期 conjecture,并据此给出了 multiclass 以及 list learning 在 DS dimension 上的最优依赖关系。

对很多偏应用的人来说,这听起来可能有点远。

但我觉得它的重要性其实很实在。

因为 sample complexity 问题本质上是在回答:

  • 这类学习问题到底需要多少数据才够
  • 复杂度应该由什么结构量刻画
  • 上界和下界之间到底还有没有真空

这种问题虽然不直接产出一个更能跑 benchmark 的模型,但它决定了我们怎样更准确地理解:

某类学习任务的难,到底难在什么维度上。

尤其今天很多大模型工作越来越经验主义,理论上这种把长期悬而未决的问题再往前推一步的工作,反而更显得珍贵。


最后总结

今天这 5 篇论文如果放在一起看,我觉得它们共同指向的是一件事:

AI 系统正在从“先把能力做出来”转向“把关键结构重新定义清楚”。

具体体现在:

  • Tuna-2 在重问统一多模态系统到底要不要依赖独立视觉编码器
  • World-R1 在重问视频生成要不要显式服从世界几何结构
  • Clinical Rubrics 在重问高风险领域评测到底该怎样规模化
  • SIREN-RoPE 在重问 Transformer 里的旋转编码空间是否还能继续学习
  • 多分类 sample complexity 工作则在重问一个老理论问题的最优刻画到底是什么

这类论文有一个共同特征:

它们并不是简单把已有路线“再放大一点”,而是试图把一块默认存在的结构重新拆开、重建、再验证。

而这往往才是长期最有价值的进展。

如果你最近不只是想追新模型 headline,而是想判断未来哪些方向更可能形成持续影响,我觉得今天这组论文挺值得留档。