李飞飞的 World Labs 刚收购了机器人仿真公司 SceniX,一周就拿出了 R2S2R 的成果 —— 真实任务搬进仿真,在仿真里训练评测,再部署回真机。
这笔收购真正透露的信号是:世界模型的核心命题正在变。
过去两年世界模型的进展,集中在生成越来越逼真、空间一致的三维环境。输入文字图片视频,能造出一个可以自由浏览的空间,换角度结构不崩,往前走桌椅不会消失。
但机器人面对的是完全不同的问题。一个纸箱画面再逼真,如果箱盖不会弯曲,就没法用来训练装箱。一根线缆纹理再准确,如果不会随受力滑动弯折缠绕,仿真里学会的动作也迁不回现实。
所以核心问题从 "世界看起来什么样",变成了 "机器人动一下之后,世界会发生什么"。
世界模型正在从生成观察的 Renderer,走向预测状态变化的 Simulator。
这件事国内也有团队在做,而且路线很完整。无问智科提出的 "采集世界 — 生成世界 — 模拟世界" 三位一体架构,和 World Labs 的方向不谋而合,但起点不一样:World Labs 从 3D 生成出发补仿真能力,无问智科从真实场景数据出发,把整条链路打通成闭环。
三个世界的逻辑很清晰。
采集世界是起点。但不是把机器人拉到训练场反复做预设动作那种采集,而是大规模无感野采,让设备进工厂、商业空间、家庭,记录真实作业中自然发生的物理交互。保留下来的不只是标准动作轨迹,还有物体差异、操作习惯、任务中断、异常状态和失败过程 —— 这些 "杂乱" 的东西恰恰构成了现实世界的复杂度。
采集上来的海量原始数据不会自动变成训练数据。无问智科用世界理解模型做自动化清洗、筛选、时空对齐、标注,把连续的长时序记录转换成结构化资产。甚至采集硬件本身也是算法反向定义的,需要什么模态、什么精度,决定传感器怎么组合。
生成世界解决的是规模问题。真实采集再大也覆盖不了所有状态,尤其是低频异常、危险工况和失败边界。Scan2Sim 把真实物体场景重建成交互级精度的物理孪生资产 —— 不只是外观纹理,门要有铰链和运动范围,抽屉要有滑轨,柔性物体要有真实形变属性。
然后 Gen2Sim 围绕几何、外观、结构、材质、光照、物理属性做可控扩展。和现实接近的叫 "物理表亲",面向长尾未知的叫 "物理远亲"。更关键的是生成方向不是工程师拍脑袋定的,评测发现模型在哪类材质、哪种空间关系上总失败,就反向生成对应场景补短板。
模拟世界是最后一环,也是最硬核的。场景重建生成之后得真正 "动起来",机器人动作之后物体怎么运动、接触怎么发生、线缆怎么弯曲、液体怎么流动,决定了仿真策略能不能迁移到现实。无问智科的 "无穹" 模拟器用的是显式可微分物理 + PINN + 隐式因果动力学的双空间方案,而且会用真实交互数据持续校准仿真参数。
三个世界串起来就是一个完整闭环:采集提供真实锚点,生成放大数据分布,模拟完成物理推演和训练评测;真机上暴露的新问题、新失败,再反过来修正物理参数、更新生成方向、定义下一轮需要采集的数据。
做科技媒体观察下来,物理 AI 数据基础设施的定义正在收敛。过去比的是采集了多少小时数据、有多少 3D 资产、画面有多逼真。
下一阶段的标准会变成:一个真实任务能拓展出多少有效的训练世界?数据堆叠是否真的提升了模型能力?模型的失败又能否快速变成下一轮迭代的输入?
从采数据到造世界,这是物理 AI 基础设施的范式跃迁。太平洋两岸的团队已经在同一条路上加速了。

