详细分析一下Attention, Sparse or Linear?网页链接Zartbot老师的深度长文,这个老师写过很多深度文章。这也是一篇价值20个亿的文章(大模型训练的路线如果错了,成本相当高)。
"之所以重拾这个话题, 其实是被 Kimi K3 的模型表现勾起了好奇心. 我特别想搞清楚: K3 的收益究竟来自数据质量, 模型结构, 还是模型规模? 其中基于 Linear Attention 的 KDA 又贡献了多少? 同样的追问也适用于 Qwen 3.8 的 GDN 方案.
本文不预设任何立场, 也无意站队. 尽管之前因为分析过一些 Linear 相关的内容, 有支持 Linear 路线的大佬差点要找我吵架......
接下来我们从标准 SDPA 出发, 逐步拆解 Linear 和 Sparse 两条技术路线. 概括地说, 两者都是在国内算力受限情况下的工程权衡.
Sparse Attention 的思路是通过限制支持集来压低计算复杂度, 主要风险在于漏掉高质量的 token; Linear Attention 走的则是压缩全部历史的路线, 核心风险来自状态管理, 冲突, 以及不可逆的遗忘.
当模型规模进一步膨胀到 5T~10T 量级时, 在国内算力受限的大背景下, Attention 架构的演进路径会走向何方? 不妨先算一笔简单的账: 训练一个 10T 规模的模型, 所需训练数据大约在 200T~300T token 的量级; 如果全部使用国产算力, 可能需要近 20 万张卡, 整个集群的建设成本最保守估算在 400 亿~600 亿之间. 这个数字对某些已经上市的基模厂商来说也并不轻松. 按集群 3 年折旧计算, 单次基模预训练的成本大约是 20~30 亿.
那么在这个时候弄清楚 Linear 和 Sparse 的选择, 或者这个问题本身的价值就在20亿左右."





