[CL]《Kimi K3: Open Frontier Intelligence》K T T Bai, Y Bai, Y Bao, M. C… [Kimi Team] (2026)
在超大规模模型领域,开源生态正面临“双重脱节”的难题。过去的方法受困于预训练规模难以突破 1T 参数大关,且在处理百万级长文本时,传统注意力机制的计算成本与显存压力呈平方级增长,本质原因是硬件效率瓶颈限制了模型在极长链条下的推理深度与智能体执行能力。
本文的核心洞见是:把长文本处理重新看作一种“高效循环与选择性检索”的混合过程。由此,Kimi Delta Attention (KDA) 这一关键操作通过线性复杂度的状态更新替代了冗余的 KV 缓存,配合 Attention Residuals 允许层间跨度检索,使模型在激活 104B 参数的同时,以 2.5 倍的效率增益实现了百万代币级别的原生多模态对齐。
这项工作真正留下的遗产是证明了 3T 级 MoE 模型在开源环境下的可行性,并确立了智能体强化学习(Agentic RL)作为模型进化的核心驱动力。它为后来者打开了通往长航时、自主执行复杂任务的通用人工智能之门,但尚未跨过的门槛是模型在顶尖科研级推理(如 HLE 榜单)上与闭源旗舰模型(如 GPT-5.6 Sol)之间仍存在的微弱代差。
arxiv.org/abs/2607.24653 机器学习 人工智能 论文 AI创造营








