VideoSEMA:可扩展高效类Mamba 视频理解模型
UC Irvine 提出一种分离时空注意力视频模型VideoSEMA,空间采用窗口局部注意力+全局平均类Mamba的可扩展高效注意力SEMA,时间使用标准softmax注意力。K400上,31M参数的VideoSEMA以87G FLOPs取得82.4% top-1准确率,超越更大规模的VideoMamba和TimeSformer;SSv2上以67.3% top-1领先同等参数模型。高分辨率扩展时,其准确率衰减远小于VideoMamba,在1024²分辨率下领先13.8个百分点。理论证明了在特定秩条件下分离注意力等价于全注意力。
整体架构:
采用分离式空间-时间注意力,空间分支用SEMA块在每帧内并行计算局部窗口注意力与全局平均的加和,以模拟Mamba的指数遗忘特性并实现线性复杂度,时间分支在空间位置间独立做全帧softmax注意力,通过交替处理获得高效时空建模。
SEMA注意力:
由两部分构成,一是基于局部分组的窗口注意力,捕获细粒度空间关系;二是对所有token值向量求平均并广播,近似全注意力的全局聚集,当token数趋于无穷时该近似成立,从而无需计算完整注意力矩阵,计算复杂度从平方降为线性O(n)。
处理过程:
模型输入先经3D卷积进行时空分块token化,追加可学习的分类token和时空位置嵌入,然后堆叠多个VideoSEMA块,块间用卷积层下采样空间维度形成层次结构,最后取分类token经层归一化和线性头输出预测。
并通过理论分析,构建了全注意力在分离时空中的条件分解,表明若时间得分矩阵和空间得分矩阵的秩不超过各自头维度,则可精确实现等价注意力;一般情况下给出基于秩受限近似的误差上界,误差由时间分布与空间条件分布的一范数误差控制。
实验表明在K400和SSv2上,VideoSEMA相比同量级或更大参数的Transformer和Mamba模型取得更优或竞争性能;消融证实时间模块选用softmax注意力优于卷积或Mamba;模型对高分辨率输入具有强鲁棒性,受益于空间SEMA的线性复杂度。
LLM 多模态 视频理解 VideoSEMA Mamba 大模型论文





