[CV]《HumanCLAW: Can Vision-Language Models Act Through a Body?》S Li, J Gu, S Liu, K Hu… [Meta & University of Washington & Nanyang Technological University] (2026)
在具身智能领域,评估视觉语言模型(VLM)的决策水平一直受到低级运动控制干扰的难题。过去的方法难以区分任务失败究竟源于错误的逻辑判断还是物理失衡坠落,本质原因是推理决策与电机控制在反馈回路中被高度耦合。
本文的核心洞见是:将具身行动重新看作原子级技能的逻辑编排,并引入半物理仿真环境。由此,通过亚秒级闭环指令与预设全身运动块的映射,将平衡与执行误差剔除,使研究者能纯粹观测模型在物理交互中的行动智能。
这项工作真正留下的遗产是揭示了当前模型普遍缺失具身自我意识,即能看见目标却无法感知自身肢体状态。它为后来者打开了通向通用具身推理的新门,但尚未跨过的门槛是模型如何建立对自身物理边界与碰撞后果的本能预测。
arxiv.org/abs/2607.27180 机器学习 人工智能 论文 AI创造营








