昊梵体育网

#阿里发布Qwen3.8Flash#今晚阿里带来全新Qwen3.8‑Flash多模态MoE模型,主模型125B参数,搭配51B的N‑gram Embedding,每token仅激活6B,训练开销只有Qwen3.7‑Plus的九分之一。 可以看得出来,这次重点瞄准降本,在压低训练、推理成本的同时,编码还有办公场景的能力还得到强化。 现在各家大模型都 ​

阿里发布Qwen3.8Flash今晚阿里带来全新Qwen3.8‑Flash多模态MoE模型,主模型125B参数,搭配51B的N‑gram Embedding,每token仅激活6B,训练开销只有Qwen3.7‑Plus的九分之一。

可以看得出来,这次重点瞄准降本,在压低训练、推理成本的同时,编码还有办公场景的能力还得到强化。

现在各家大模型都在卷MoE架构,不再一味堆总参数量。在我看来,不是参数越大就越强,真正关键是实际激活算力。低成本还能稳住效果,对开发者、企业落地会十分友好,后续实际跑起来的真实表现,还需要大家上手实测检验。