假设你正在用世界模型做机器人仿真训练:物体离开视野再回来,位置不对;你发出一个左转指令,画面要卡半秒才响应。这种模型放在真实场景里,不是‘体验不好’,是‘会出事故’。
Matrix-Game 3.5 给出的答案是:从‘视觉模拟’切换到‘物理干预’范式。它把因果推理直接写进训练目标,而不是让模型只学会复现像素。下面拆解它具体怎么做。
空间索引记忆:从‘第5帧左上角’升级到‘沙发在客厅角落’哈佛、MIT 联合发布的 MemoBench 测试了一个基本能力——物体恒存:东西离开视野再回来,还在吗?位置变了没?三岁孩童都能拿满分的测试,十个主流世界模型最高分只有 0.58。问题出在记忆方式:Transformer 的时间索引记忆让早期信息被不断稀释,即便谷歌 Genie 3 也只能保持约一分钟的一致性。
Matrix-Game 3.5 把记忆从时间索引切换为空间索引。它实现业内首个几何对齐的 Patch 级长期记忆——每个局部 patch 独立存储、独立检索,通过 PRoPE 把相机投影矩阵编码进时空位置。模型知道的不是‘像素在画面上的位置’,而是‘这个像素在真实空间中对应的点’。再加上动静解耦:Patch Memory 记住静态场景结构,主体参考 Token 维持动态物体身份,避免移动的人被误识别为多个不同的人。物体重现时,先定位空间位置,再对齐视角,模型就认得准了。
因果推理内化:状态与动作联合生成,模型学的是‘如果做这个动作,世界会怎么变’传统世界模型做的是‘预测下一帧像素’——这是视觉模拟。Matrix-Game 3.5 把状态预测和动作生成放在同一个损失函数下联合训练。模型不只要猜‘下一帧长什么样’,还要猜‘如果做这个动作,世界会怎样改变’。实验证明联合训练后两者能力双双显著提升。这套范式下,因果推理不是从数据里‘涌现’的,而是被直接写进训练目标的。
真实世界的三大卡点:物理尺度数据、实时交互延迟、算力架构从游戏沙盒走进真实物理场景,世界模型要跨三道坎:
数据门槛:互联网视频没有深度标注,模型学到的永远是相对几何关系,不知道动了多少米、朝哪个方向。昆仑万维建了 Scene-Quality 自动评估系统,从几何可重建性和生成训练价值两个维度筛选数据,三条自动化管线产出 500 万以上高质量视频切片,覆盖 1200 多个游戏和物理场景,让模型第一次理解空间中的‘距离’和‘速度’。
交互门槛:机器人控制场景里延迟是安全红线。Matrix-Game 3.5 通过三步采样蒸馏(将扩散模型生成一帧从几十步压缩到3步)、DiT 推理优化(FFN INT8 量化+ KV Cache)、以及 MG-LightVAE 约 75% 结构化剪枝,三管齐下,5B 参数模型在单张 GPU 上跑出 720P、约 20FPS 的实时生成。
算力门槛:世界模型处理连续视频流,计算量远大于大语言模型。Matrix-Game 3.5 的交互框架除了角色参考适配器外,核心功能几乎不新增额外参数,可以快速嫁接到不同视频基础模型上,不用重写底层,不牺牲开放内容生成质量。
视觉模拟 vs 物理干预:你的世界模型能用在哪?现在可以给一个判断框架:
视觉模拟:输出画面,目标是‘下一帧长什么样’,成功标准是画面连贯。典型如传统自回归视频模型,适合内容生成、游戏场景渲染。物理干预:输出可执行的物理控制指令,目标是‘给定当前状态和预期结果,该做什么动作’,成功标准是‘指令执行后物理结果正确’。适合机器人训练、自动驾驶仿真。Matrix-Game 3.5 明显属于后者——它用空间记忆解决物体恒存,用联合生成内化因果,用工程优化突破延迟和算力瓶颈,让世界模型第一次具备了走出游戏沙盒的完整条件。
但请注意边界:素材中所有实验和工程数据均来自昆仑万维自研测试,尚未公开在真实机器人或自动驾驶车辆上的部署案例。这一代模型更适合作为仿真数据生成引擎和因果推理研究底座,而非直接商用。
如果你正在搭建机器人仿真训练环境,你会优先用这一代发布的世界模型做初始数据生成,还是坚持等更成熟的方案?理由是?欢迎在评论区分享你的判断。