[CV]《Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers》C Ge, H Jiang, T Wang, J Gu… [Adobe Research] (2026)
在视觉生成领域,高分辨率图像与长视频导致 Token 数量激增,传统 Diffusion Transformer 受困于全注意力机制的二次方计算成本。其本质原因是视觉数据需兼顾时空局部性与跨模态双向交互,导致语言模型的线性优化方案难以直接平移。
本文的核心洞见是:将多模态数据视为统一序列,通过线性复杂度的 Delta 注意力进行长程状态追踪,并周期性交织潜在注意力实现全局交互。配合模态感知短卷积捕捉局部结构,彻底摆脱了对位置编码的依赖,实现了时空维度的自由外推。
这项工作真正留下的遗产是验证了混合架构在视觉大模型中的计算效率优势,并确立了图像与视频预训练的 Chinchilla 缩放法则。它为超长视频生成打开了新门,但尚未跨过的门槛是 MoE 稀疏激活在扩散模型中的增益远低于语言模型。
arxiv.org/abs/2607.28611 机器学习 人工智能 论文 AI创造营








