昊梵体育网

【字节拟训练5万亿参数大模型】8月7日消息,据《晚点 LatePost》报道,字

【字节拟训练5万亿参数大模型】8月7日消息,据《晚点 LatePost》报道,字节跳动正在讨论训练一个参数规模超5万亿的模型,它超过阿里的 Qwen 3.8-Max(2.4 万亿参数)和月之暗面的K3(2.8 万亿参数),也是目前国内已知参数规模最大的模型。该计划仍处于早期阶段,模型最终不一定会发布。

报道称,新模型将由Seed Foundation负责人项亮主导,与大语言模型预训练数据负责人沈科合作。为此,Seed正在重新梳理组织,划分职责,分配资源。

针对字节讨论训练超5万亿参数模型的原因,报道援引接近Seed人士消息称,Seed团队认为,与其在现有尺寸上继续追赶其他大模型,不如把参数规模一次推到同行的数倍,争取领先位置。

值得一提的是,在字节跳动近日举行的内部会议中,创始人张一鸣罕见表态,做模型要坚持长期主义、延迟满足感,而不是用别人的输出,换一时的榜单排名。

他明确指出,字节跳动“应该愿意为长期目标牺牲一部分短期收益”。

据了解,目前字节跳动内部对开源模型严禁蒸馏,甚至通过API检测等方式在内部加强相关限制,张一鸣认为,蒸馏会干扰真正意义上的长期技术突破。(快科技)