近日,42 号电波专访了 INTACT 框架第一作者、浙大博士生孙俊涵。论文 7 月 28 日发出,图灵奖得主杨立昆在 X 上点了赞。杨立昆是 JEPA 的提出者。
INTACT 解决的问题,得从 JEPA 路线的硬伤说起。
JEPA 能预测下一帧状态,但要生成动作得靠搜索。代表模型 LeWM 每次决策评估 9000 条候选序列,单次推理 1.48 秒。这个搜索税太重了。专访里孙俊涵说得很直接:「LeCun 的 World Model,用状态加动作预测下一帧,但这个 predictor 在我眼里跟 Dreamer 的 decoder 是一回事,都是生成器。他没有真正把 encoder-encoder 架构的优势用起来。」
INTACT 的做法是:用一个共享算子同时处理「刚刚发生了什么」和「接下来要达成什么」,把物理意图和目标意图对齐到同一个动作语义下。结果是不需要搜索,直接输出动作。
数据有点反直觉。零搜索直接输出,宏平均成功率 95.33%。全套 CEM 搜索(300 条候选 × 30 轮迭代 = 9000 次),93.78%。不搜比搜还高 1.5 个百分点。推理从 1.48 秒降到毫秒级。
Cube E5 基准 300 次同起点审计更能说明问题。INTACT 零搜索 98.7%,LeWM 全搜索 67.0%。差了 31 个百分点。
专访里还问到一个细节:是不是所有任务都不需要搜索?孙俊涵的回答比论文结论更细致。接触密集型任务(比如 PushT 推块)确实能从局部搜索中受益,小范围验证把成功率从 85.78% 拉到 92.33%。但连续控制任务(比如 Reacher)正好相反,搜索范围放大反而暴跌 13 个百分点,从 97.67% 掉到 84.78%。
团队跑了一个 576 种规划器配置的审计矩阵。结论是:搜索不是不需要,而是大部分场景在帮倒忙。最优配置叫 Guarded A,只做 128 条候选 × 3 轮 = 384 条,是全套 CEM 的 4.27%,宏平均 96.86%,比纯 CEM 高 16 个百分点。孙俊涵的原话:「模型要有搜索的能力,但不代表一定要用。少搜、不搜,才是该去的方向。」
INTACT 的设计里有个非对称梯度机制,训练时物理意图分支和目标意图分支共享编码器但梯度不对称。专访里孙俊涵用了一个比喻解释这个设计:「若高三目标是清北,不能因为太辛苦中途把目标改成别的学校。容易了,但不是一开始想去的那个地方。」意思是不能因为训练容易就降低目标精度。
编码器消融实验验证了 INTACT 不只是预测器厉害。禁用动作器、纯靠 CEM 搜索的情况下,仅加物理逆监督 + 目标意图监督 + 降低 SIGReg,PushT 成功率从 42.22% 涨到 69.44%,全程没用 INTACT 预测器。共享编码器本身学到了更好的表征。团队还让一个 ViT-Tiny/14 编码器同时处理 4 个任务,每个任务只留小任务特定头,五轮训练后宏平均直接控制成功率 89.39%。
专访里我们追问了工业部署进展。孙俊涵确认团队内部已经在真实机器人上跑通,范围超出了论文里四个仿真 benchmark。在 RoboParty Lab 的技术版图里,INTACT 定位是 World Action Model,长期目标是逐步接替 VLA。
孙俊涵在专访最后给了一个判断:「INTACT 这种架构会是比 VLA 更好的未来,它真正理解语义。VLA 的语义理解和动作生成是脱节的。只有当自己能想出指令、身体能适应指令的时候,才是最好的。」
完整专访内容见 42 号电波公众号。
INTACTJEPA世界模型机器人大模型








