Cursor 搞了个 Mixture-of-Kittens (MoK),用来提升 MoE 模型训练吞吐量
通过将所有 MoE 通信与计算融合于一个完全确定性的内核中,来加速 MoE 层
在生产环境中,它将端到端训练吞吐量提高了 1.41 倍,超过了之前基于 DeepEP 的技术栈
链接:cursor.com/blog/mixture-of-kittens


Cursor 搞了个 Mixture-of-Kittens (MoK),用来提升 MoE 模型训练吞吐量
通过将所有 MoE 通信与计算融合于一个完全确定性的内核中,来加速 MoE 层
在生产环境中,它将端到端训练吞吐量提高了 1.41 倍,超过了之前基于 DeepEP 的技术栈
链接:cursor.com/blog/mixture-of-kittens

