唐杰的最新X,告诉我们,现在的MoE模型训练的都还不够充分?
刚刚智谱的唐杰老师发了一篇X,我有一些自己的想法,我的理解是,其实现在的MoE模型,在执行任务上的训练还是不够充分。
针对于模型执行任务来说,现在大多数超大模型都是MoE了,专家的激活,哪些专家更好的使用、组合,是靠post-training不断优化的。那么这种持续的后训练,是否对于Dense模型也生效呢?或者说,提升有多大?
其实没有做过,现在最大的Dense模型貌似是405B的llama3,(24年7月发布?)但那个时候,大家对RL的探索也没那么强,RL是DeepSeek-R1带起来,那已经是25年1月了。
所以也没有人知道1T的Dense模型的上限在哪儿?1T的Dense的推理成本想想都觉得恐怖,但也许,超过1T的大模型,会有额外的智能涌现,不知道,也没做过相关的实验,是否会出现奇点?
正因为成本问题,现在大多数模型都采用Moe模型,才能不断通过后训练提高效果,让更多的专家,更好的组合起来。
但GLM5.3的提高,在实测下来,我的大部分场景体现不出来,因为我不做安全,不清楚,所以,也许模型的MoE专家的配合,靠后训练,可以真的不同领域单独提高。
参数拉高你的领域能力上限,后训练让你无限逼近
欢迎,讨论,批判,指正。
