昊梵体育网

Minimax的M3 Pro是个2.7T、60B激活参数的模型,如果从参数量上来

Minimax的M3 Pro是个2.7T、60B激活参数的模型,如果从参数量上来看,大概能达到Qwen 3.8 max的水平?

这两天汇丰调研了Minimax,提供了一些增量信息一个是M3 Pro是个2.7T-60B的模型,预计9-10月发布。目前还在训练中。如果看时间,距离正式发布还有两个月左右,个人估计国庆前后?

二是他们还在筹备一个5T级别的模型。看来是这次M3的400B的scalling实在是有点不足,得扩大scalling了。

三是多模态的H3快了。Minimax之前的优势主要就是在海螺的多模态上,包括海外给minimax定价,主要也是因为有多模态和全家桶的优势,一个plan可以支持TTS、生图/视频、ASR、音乐等,覆盖了龙虾用户的大部分需求,还便宜。

四是表示自家卡多、成本低。minimax去年9月开始屯卡,相较于目前的卡的现价便宜不少,训练和推理成本都相对比较低。

全文如下:目标: MiniMax追求卓越智能与成本效率,在激烈竞争中力求突围。需求依旧旺盛(如每日推理token达数万亿),且MiniMax推理效率出色(详见下文),开放平台有望取得不错的毛利率,并力争长期达到两位数百分比。

模型策略:1)文本模型: M3 Pro(参数量c3tn)计划9-10月发布,激活参数60bn(激活率2%),在token吞吐量、训练效率、KV缓存优化上均有改进。用8tn数据训练后,M3 Pro已触及此前需40tn数据训练才能达到的M3水平。公司还在研究5tn参数规模的模型。2)多模态模型:** MiniMax坚信原生多模态仍是重要方向,原因有三:一)GPM高于文本模型;二)能切实提升多模态TAM的用户生产力;三)多模态输入可反哺文本模型能力(即M3 Pro训练也用了一部分信息密度高的多模态数据)。Hailuo 3或将很快推出。

AI基础设施策略:1)自研: 自2025年9月起,MiniMax已自研算力与集群设施(仍计入资本开支)。目前可运行1万多卡集群上的模型训练任务,并将继续扩大集群规模,且能减轻对云服务商的依赖。2)成本效率:早期搭建的AI基础设施,帮助MiniMax在芯片与内存涨价背景下节省算力成本(例如集群利用率高于行业平均,几乎所有集群可同时运行训练与推理任务)。3)组织:此外,公司管理层也强调,跨学科人才储备能强化研发上层建筑——模型训练与算法团队坐在一起协同攻坚,避免各自为战。