昊梵体育网

10万亿参数!字节跳动正在训练中国已知最大AI模型,规模逼近Anthropic最

10万亿参数!字节跳动正在训练中国已知最大AI模型,规模逼近Anthropic最尖端的Mythos系统。张一鸣说不走蒸馏捷径,要硬磕底层架构创新。
8月7日《金融时报》报道,字节跳动正在训练一款超大规模AI模型,目标参数规模最高可能达到10万亿,目前处于预训练早期阶段。大模型预训练通常需要3到6个月,完成后还需微调,最终参数规模在后续阶段确定。如果按10万亿推进,将成为中国已知规模最大的AI模型,并接近甚至超过Anthropic下一代前沿模型的估计。业内估计Anthropic最先进的Mythos 5参数约8万亿,另一款Fable 5约5万亿。负责研发的Seed团队目前约2000名成员,分布在中国及海外。8月6日张一鸣在内部会议上明确表示,字节不会把蒸馏当作提升模型能力的捷径,即便这意味着眼下落后于国内竞争对手。此前《晚点LatePost》报道字节在讨论5万亿参数模型,由Seed Foundation负责人项亮主导。8月7日的最新消息显示目标已上调至10万亿。
翻译一下:10万亿参数是什么概念?月之暗面Kimi K3是2.8万亿,阿里Qwen3.8-Max是2.4万亿,字节直接干到10万亿,是K3的三倍多。而且张一鸣说不走蒸馏捷径——蒸馏是用大模型的输出训练小模型,见效快但有天花板。字节选了最难的路线:从底层架构原创突破。Seed团队2000人,这个规模在全球AI实验室里也是第一梯队。
字节这步棋的逻辑很清晰:豆包大模型日均Token调用量已突破180万亿,月活3.82亿,DAU超2亿,大模型业务ARR达40亿美元。有了应用场景和现金流,下一步就是冲模型本身的天花板。不走蒸馏意味着字节要跟OpenAI、Anthropic在同一赛道硬碰硬——比算力、比数据、比工程能力。中国大模型从跟跑到并跑用了两年,从并跑到领跑可能就在这10万亿参数的预训练里。当字节用10万亿参数硬磕底层创新、不走蒸馏捷径的时候,你说中国AI到底是在追赶还是在定义规则?