Kimi的技术创新亮点颇多。在训练效率上,它应用了全球首个在大型语言模型训练中跑通的Muon二阶优化器,在K2模型训练里,实现2倍的Token效率提升,训练成本降低超50%。还引入QK - Clip机制,让万亿参数模型训练稳定性提升60%,使大规模模型能在消费级显卡部署。
它还调整模型架构,将注意力头数量从128减至64,专家数量从32扩到64,长文本处理效率提升2.3倍,在国产GPU上推理速度更快。
Kimi K3更厉害,48小时用开源EDA工具设计出AI推理芯片原型,还自己写编译器。它对Transformer架构动“手术”,把注意力机制拆成两种角色,解决了传统模型处理长文本的难题。 真是很厉害啊!期待更厉害的!