2026 年的 Kimi K3:2.8 万亿参数。
单看参数量,一个 Kimi K3 相当于约 22580 个 GPT-2。
但这 7 年,大模型的进步远不只是“变大”。
《22580: From GPT-2 to Kimi K3, Explained》由 Baseten 工程师 ali 撰写。
他从 GPT-2 一路拆解到 Kimi K3,试图回答一个核心问题:
模型如何更高效地记忆、更新和找回信息?
整条演进路线可以概括为 6 个阶段:
1|GPT-2:标准 Transformer
每生成一个 token,都需要关注此前的上下文。KV Cache 避免了重复计算,但上下文越长,占用的显存也越多。
2|Linear Attention:把历史压缩成固定状态
它不再保留每个 token 的完整 KV,而是把信息累积进固定大小的“记忆矩阵”。
3|DeltaNet:精准修改记忆
写入新信息前,模型先读取原有内容,只写入两者之间的差值。
就像不必重抄整块白板,只修改需要更新的部分。
4|Gated DeltaNet:主动遗忘
DeltaNet 能更新特定信息,却不擅长整体清理过期内容。
加入门控后,模型可以决定保留多少旧状态、遗忘多少历史。
5|Kimi Linear:更精细地控制遗忘
过去整个状态共用一个遗忘比例;Kimi Linear 则为不同通道学习不同的衰减程度。
模型可以更精细地决定:哪些信息继续保留,哪些应该淡出。
6|Kimi K3:组合多种记忆与检索机制
K3 没有押注单一架构,而是组合了 :
KDA:维持固定大小的循环记忆
MLA:周期性检索完整上下文
MoE:只激活少量相关专家
AttnRes:选择性找回更早层的表示
所以 Kimi K3 的核心不只是参数更多,而是把新增的计算能力放在了真正需要记忆、检索、路由和遗忘的位置。
读完原文,最大的感受是:
大模型架构的演进,本质上是在设计一套越来越聪明的记忆管理系统。
固定容量的记忆必然需要淘汰机制。门控、路由、衰减和注意力,就是模型决定“记住什么、忘掉什么”的方法。
原文技术密度很高,但代码和架构图都很清楚。推荐给关注 Transformer、Linear Attention、MoE 和 Kimi 架构的朋友。给大家存了一个PDF版本👇🏻~


