昊梵体育网

[RO]《Continue or Replan? Bernoulli-Conti

[RO]《Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution》W Xu, Z Liu, L Luo, Y Liang, C Yao… [Microsoft Research Asia & Peking University] (2026)

在机器人视觉语言动作模型(VLA)领域,如何平衡推理频率与执行精度是一个悬而未决的难题。过去的方法受困于「固定步长」的预测机制,本质原因是这种周期性重规划与任务实际进度脱钩,导致机器人在进入关键操作阶段时往往仍在使用过时的动作指令。

本文的核心洞见是:把执行长度的预测重新看作一系列连续的「继续或重规划」二元决策。由此,Bernoulli 延续策略这一关键操作使模型能够根据环境反馈动态调整步长,在平滑运动时减少推理,在精准操作前强制重规划,实现了对任务节奏的自适应把控。

这项工作真正留下的遗产是证明了执行频率本身也是一种可学习的策略,而非预设的超参数。它为后来者打开的新门是轻量级、即插即用的 VLA 性能增强范式,但尚未跨过的门槛是在更极端、非结构化的开放场景下,如何保证这种动态决策的绝对实时性与安全性。

arxiv.org/abs/2608.03483 机器学习 人工智能 论文 AI创造营