昊梵体育网

小米 MiMo-V2.6 开源:双全模态模型登场,RSI 路线再落一子 9月22日,小米把 MiMo-V2.6 系列推向开源社区。该系列包含 Pro 与 Flash 两款原生全模态模型,也是小米在 RSI(递归自我改进)方向上的一次阶段性交卷。 评测成绩上,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index(AA 综合智 ​

小米 MiMo-V2.6 开源:双全模态模型登场,RSI 路线再落一子

9月22日,小米把 MiMo-V2.6 系列推向开源社区。该系列包含 Pro 与 Flash 两款原生全模态模型,也是小米在 RSI(递归自我改进)方向上的一次阶段性交卷。

评测成绩上,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index(AA 综合智能指数)中拿到 46 分,超过 Kimi K3、Qwen3.8 Max,坐上当前开源模型头把交椅;不过与最强闭源阵营的 Claude Fable 5.1、GPT-6 Astra 相比,仍有需要追赶的空间。

价格方面,MiMo-V2.6 系列沿用 V2.5 系列的 API 定价,做到能力上探、价格不动。官方测算显示,在同等智能水平下,MiMo-V2.6-Pro 的成本只有海外模型的 1/20 至 1/60,国产模型性价比纪录因此被再次改写。

训练环节,小米进行了 6 天 Live RL 训练。Flash 和 Pro 的花费分别约为 85 万美元、262 万美元,各自完成 30 步,累计约 75 万条轨迹;任务平均通过率分别取得 25% 和 12% 的相对增长。样本外长程软件工程评测 DeepSWE v1.1 中,Flash 由 48.8 提高到 65.68,增加约 17 分;Pro 由 58.4 提高到 72.57,增加约 14 分。

此次 RL 算力扩展沿着三条线推进:一是放大 Batch 并提升吞吐,结合大 Batch 与全异步架构,每次更新投入 1,568 个样本,可支持 1M 上下文训练,单步训练 Token 为 2.7~3.7B;二是扩充任务与复杂环境,训练体系横跨 Code、General、Visual、Cyber 等方向,并混合多个 Harness;三是加码 Grader 算力,借助 Group 内相对比较,为 Long-Horizon RL 任务生成奖励信号。

稳定性设计上,小米冻结了 MoE Router,以遏制专家负载漂移,同时布下 Reward Hacking 防线,涵盖奖励设计、对抗性评测、异常检测与验证器交叉校验。配套资源也同步开放,完整技术报告、训练环境和 RL 代码均已开源,方便研究者复现与核验。