FT 报道字节在训练 10T 规模的模型。与此同时,其实现在高质量数据大家都说不够了。
我当时忙着撕逼,就没有补充一下新闻之外的一些推测:1比较 Kimi K3 算是今天中国能力最强的模型之一,2.8T 。所以如果真的搞 10T ,能想象到的是:一个 MoE 架构的多模态模型。
2今天多模态似乎已经不是重点了,而头条有抖音,有Seedance 。如此规模的参数,这个模型,在视觉和视频生成上可能会非常惊人。
3考虑抖音 TT 的数据,目前说的数据墙的问题,的确可能对字节不适用。而传闻也说 Seed 团队主导,报道称预训练阶段,目标对标前沿闭源系统。