小鹏第二代VLA首次模型重大升级小鹏第二代VLA有记忆能预测会思考 昨天鹏鹏发布会我没着急发,今天分别写写:
【记住30秒:Infini-VLA】
先说 记不住过去 这个问题。
人类司机开车时,大脑里持续维护着一个动态场景模型。30秒前后视镜里有辆电动车在右侧晃了一下,虽然它现在被A柱挡住了,但你 知道 它还在那儿。
前面那辆车10秒前打了双闪开始减速,你会预判它可能要靠边,而不是等它刹停了才反应。
你不需要逐帧回忆这30秒的画面,几个关键事件就够了。
上一代VLA做不到这一点,它的核心是Transformer,Transformer理解上下文靠的是自注意力机制:每一帧的每个token都要和其他所有token计算关联强度。
这个机制有个硬伤,计算量和token数量的平方成正比。
30秒视频,每秒30帧,每帧哪怕只提取几百个token,总量也是上万。
上万个token两两计算注意力,注意力矩阵就是上亿个元素,车端芯片根本扛不住。
所以上一代模型实际能 看到 的上下文很短,通常只有最近几帧,几百毫秒到两三秒的信息。超过这个窗口的东西,模型就 忘了。
Infini-VLA的解法不是硬把上下文窗口拉到30秒,而是对历史信息做压缩。
具体来说,它大概率采用了这样一种机制:旧帧不会被原样保留,而是被压缩成一组数量少得多的 记忆token。
可以类比成你回忆今天早上开车出门的过程,你不会记得每一秒的画面,但你记得几个关键节点:
出小区时有个行人横穿在主路入口等了三辆车红绿灯口有辆大巴挡住了右侧视线
这些关键节点就是你的记忆token,信息密度远高于原始帧,但足够支撑你做判断。
技术上,这通常通过递归注意力或压缩记忆实现:每一帧新画面进来时,模型先做一次筛选,判断哪些信息有因果价值、哪些是噪声。
有价值的信息被整合进记忆token,无价值的信息被丢弃。
随着时间推移,记忆token本身也会不断更新和压缩,太久远且不再相关的信息逐渐淡出。
这样模型维持的不是30秒的原始视频,而是30秒内关键事件的浓缩表征,计算量可控。
真正难的不是 记住,是知道该记什么。
30秒视频流里绝大多数信息是噪声:路边静止的树、不变的车道线、远处的云。
如果模型把所有信息都塞进记忆,不仅浪费算力,噪声还会干扰决策。
一辆车30秒前打了转向灯,在它完成变道之前这个信息都有价值。
一个行人站在路边看手机,他的姿态变化值得关注。
但路边停着一排车如果没有任何移动迹象,就不需要持续占用记忆容量。
模型需要学会的是判断因果关系,而不是简单地存储画面。
现场演示里有一个场景:模型记住前方有车在做三点掉头,等待期间不冒进,等前车驶离后迅速起步。
没有长时序记忆的模型在等待期间会反复"忘记"前车在掉头,每次看到当前帧都重新判断,表现为犹豫、顿挫,甚至在不该动的时候往前窜。
这就是失忆型司机和有记忆的司机最直观的区别。
