但月之暗面认为,如果预训练底座不再增长,强化学习、工具调用和长程 Agent 也会逐渐碰到能力上限。
Kimi K3 因此同时扩展两条路线:模型达到 2.8 万亿总参数、约 1040 亿激活参数,支持原生多模态和 100 万 Token 上下文;后训练则覆盖不同任务、思考强度以及数百乃至数千次工具调用。
注意力方面,K3 以 Kimi Delta Attention(KDA)处理长序列,通过递归状态降低计算和缓存压力,再穿插 Gated MLA 补充全局 Token 之间的信息交互。
网络加深到 93 层后,K3 引入 Attention Residuals(AttnRes),让当前网络块选择性聚合此前不同深度的表示,改善早期信息在深层传递中逐渐被冲淡的问题。
MoE 负责扩展模型宽度。
K3 拥有 896 个路由专家,每个 Token 激活 16 个;Stable LatentMoE 先在压缩后的专家空间中计算,再返回主干。Quantile Balancing、SiTU-GLU 和 Per-Head Muon 则用于改善专家负载与训练稳定性。
K3 还从预训练开始联合学习文本和视觉,而不是后期外挂视觉模块。
上下文按 8K、64K、256K、1M 逐步扩展,并加入需要跨长文档和长视频寻找信息的训练任务。
后训练采用 SFT、RL 和 Multi-Teacher On-Policy Distillation。
通用能力、通用 Agent 和 Coding Agent 分别训练 low、high、max 三档策略,最后将九种 RL 策略整合进统一模型。
报告称,整套方案让 K3 的 Scaling Efficiency 相比 K2 提升约 2.5 倍。
它在多项代码、搜索、工具调用和视觉任务中表现突出,但整体仍落后于 Fable 5 和 GPT-5.6 Sol。
K3 的看点不只是 2.8T 参数,而是同时推进长序列、深网络、宽专家空间和长程 Agent 训练,并将完整权重开放出来。
对架构、训练和 Agent 系统设计感兴趣的朋友想深度报告的可以自取👇🏻,给大家上传附件啦~





