昊梵体育网

Sebastian Raschka绘制的Kimi K3架构图来啦!“这是昨天发布

Sebastian Raschka绘制的Kimi K3架构图来啦!

“这是昨天发布的重磅开放权重模型 Kimi K3 的架构图,以及我的一些观察和思考。

1. 没错,它看起来相当复杂,但本质上是他们去年发布的 Kimi Linear 模型的放大版、生产级实现。模型规模从 480 亿参数扩大到 2.8 万亿参数;K3 目前遥遥领先,是规模最大的开放权重模型。

2. 与 Kimi Linear 相比,唯一新增的组件是 LatentMoE。我没有把它画进下面的架构图,因为图已经非常拥挤了。不过,它本质上与 Nemotron 3 Ultra 中的 LatentMoE 相同。如果感兴趣,可以在我的“大语言模型架构图鉴”中找到相关内容。其核心思路类似于多头潜在注意力,即通过降维投影来压缩大型线性层。

3. 与 Nemotron 3、DeepSeek V4 等模型类似,Kimi K3 的整体方向也是提升推理效率。也就是说,它使用了许多经过效率优化的组件来替代传统组件。例如:

MoE → LatentMoE常规注意力 → 多头潜在注意力和 Kimi Delta Attention

如果想了解更多细节,我的图鉴中也有相关的简短教程和介绍。

4. 唯一一项并非以效率优化为目的的组件改动,是注意力残差连接。DeepSeek V4 使用 mHC,即流形约束超连接,改进了残差路径;注意力残差同样旨在改进残差路径,但实现方式有所不同。

mHC 的做法是拓宽残差路径,而注意力残差——它也已经应用于 Kimi Linear——则会跨层连接残差信息。连接本身使用注意力分数,作为衡量重要性或贡献程度的权重。

根据技术报告,这一机制能够持续改善验证损失和下游任务表现,尽管提升幅度不大。代价是训练成本增加约 4%,推理成本增加约 2%。

5. 值得注意的是,Kimi K3 完全取消了 RoPE 层,所有位置都改用 NoPE,即不使用位置嵌入。这一点同样继承自 Kimi Linear。

在其他架构中,近期的趋势通常是在局部注意力层中使用 RoPE,例如滑动窗口注意力,而在全局注意力层中使用 NoPE。此前也有少数架构全程只使用 NoPE,但据我所知,Kimi K3 是首个采用这种设计的前沿级模型。

6. Kimi K3 现在还原生支持多模态,这一点非常不错。

技术报告中还有一些很有意思的训练细节,不过就目前而言,架构方面值得关注的内容大致就是这些。

总体来说,这是一次非常出色的发布。”How I AI