昊梵体育网

LAWM-3D:从人类视频中构建可泛化机器人世界 南开提出了从多视角人类视频中学

LAWM-3D:从人类视频中构建可泛化机器人世界
南开提出了从多视角人类视频中学习具备3D感知能力的潜在动作新框架LAWM-3D,旨在解决现有世界模型因依赖2D像素重建而产生动作语义不明、3D空间理解不足问题。EgoExo4D等数据集上,LAWM-3D在深度预测PSNR上达到35.62,相较基线提升显著。基于此预训练世界模型在WorldArena基准16项指标上取得zui优,并在泛化评估中PSNR达到21.465,验证了3D感知潜在动作对提升世界模型生成质量、物理一致性和泛化能力的关键作用。

视角不变的动作标记化与联合训练策略:
编码器接收多视角同步帧对,通过随机视角掩码策略,迫使模型在部分视角缺失的情况下仍能推断出一致的潜在动作。训练在混合的单视图与多视图数据上进行,使得模型在推理时即便退化为单视图输入,也能保持稳定3D运动理解。

切断外观捷径的非内射深度重建监督:
解码器接收当前帧与深度图拼接,预测未来帧的RGB和深度。由于深度图是几何相关的、未输入到编码器且对视角外观变化不敏感,该设计强制编码器在无法直接获取未来外观的情况下,仅从帧差中捕捉具有几何意义核心运动线索。

显式注入3D先验的多层级几何特征对齐:
直接让编码器的中间层特征向量对齐一个预训练的3D基础模型,不同于简单特征蒸馏,设计了方向对齐损失和尺度回归损失组合,分别约束特征方向一致性和空间偏移量,在特定中间层实现了空间语义结构与3D几何知识显式关联,为跨视角一致性提供了强几何约束。

两阶段世界模型范式:
利用学到3D感知潜在动作模型,从大规模人类操作视频中提取伪动作标签,预训练一个基于Cosmos-Predict2.5骨干世界模型,然后在下游机器人数据上进行微调,将潜在动作空间与真实机器人控制信号对齐,有效解决了机器人数据稀缺和动作空间异质性难题。

消融实验:
直接引入多视图数据而不加3D约束会导致性能下降,说明视角差异会带来额外干扰。单独添加几何对齐或深度解码均带来稳定提升,将多视图数据、几何对齐和深度解码三者结合时,模型取得了zui 佳性能,证明了这些组件的强互补性,且深度揭示了性能增益并非单纯来自更多数据,而是几何对齐让多视图冗余转化为物理一致表示。
LLM 世界模型 LAWM3D