美团LongCat稀疏注意力重磅发布:百万Token长上下文终于从“纸面理想”变成“可原生训练+可落地部署”的现实,质量几乎追平全注意力!
DeepSeek Sparse Attention(DSA)虽通过Lightning Indexer实现了细粒度稀疏注意力,但在百万Token规模下,Indexer的分开销和输出导致的不连续内存访问,成为实际部署的核心瓶颈。美团LongCat团队提出的LongCat Sparse Attention(LSA),是一套硬件-算法协同设计的框架,包含三大正交策略:
Streaming-Aware Indexing(SI):将分散的KV条目选择性转成硬件友好的连续布局,实现合并HBM访问,大幅提升有效带宽。
Cross-Layer Indexing(CLI):利用相邻层注意力显著性高度稳定的特性,一次索引结果可复用到多连续层,并通过跨层蒸馏保证质量。
Hierarchical Indexing(HI):粗到细两阶段打分——先块级近似召回,再在候选内精细选Token,显著缩小Indexer计算量。
实验覆盖69B-A3B到560B-A27B规模,LSA在通用与长上下文基准上均接近全注意力水平;更关键的是,它支持原生百万Token训练,直接支撑了LongCat-2.0(1.6T总参数、约48B激活)的开发。团队还开源了LongCat-Flash-Lite-Sparse(69B-A3B),将原生上下文从128K扩展到1M,并在SWE-Bench等Agent任务上明显提升。
