昊梵体育网

最近从海内外不同维度体验小鹏 VLA 2.0 ,可以和大家聊聊新一代技术体系的一

最近从海内外不同维度体验小鹏 VLA 2.0 ,可以和大家聊聊新一代技术体系的一些思考:

1、VLA 这次词我们听的非常多,也有很多争议,那小鹏为什么在这时候要继续讨论「VLA 2.0」?

语言是离散、抽象的符号,但是驾驶是连续、高精度、毫秒级物理控制任务,两者天生存在 “鸿沟”。

所以在视觉里,它就天然有无数细微空间信息,比如车辆相对速度、障碍物轮廓、路面倾斜、物体运动趋势等等,很难完整压缩进一段文字,语言描述天然丢失连续时序与空间几何精度。每多一层语言解码,那推理延迟就要上涨几十毫秒。

所以虽然更大参数 VLA 拥有更强理解能力,但参数规模不等于有效驾驶能力。

因为大部分算力消耗在视觉特征翻译为语言 token、文本生成这类对开车没有直接价值的任务上。

而过去纯端到端模型体系不同,它把所有参数全部用于视觉特征直接映射车辆控制,算力全部服务驾驶目标。

单位算力产出的驾驶收益,轻量化直连端到端显著更高。

所以现在大家理解的VLA,模型开始放弃串行翻译,视觉特征直接连动动作,语言模型降级可能只识别路标文字、交警手势,不参与主决策链路,这也是小鹏内部评估后选择的解法,本质吸收了 “纯端到端实时性优势”,保留语言模块辅助能力。

2、那小鹏在新一代VLA 2.0 会如何理解?

小鹏认为的是基座大模型预训练吸收互联网通识常识,通过 VLA 后训练迁移到驾驶任务,带来传统端到端不具备的零样本泛化,这样可以实现涌现式常识推理。

所以在推理阶段,VLA 2.0 已经彻底删除文字解码、文本生成环节,视觉特征直连控制动作,规避模态转换损耗,推理时延进行压缩。

这样的好处是首先把所有推理全部推理在统一视觉 Token 隐空间完成,完整保留 3D 占用、相对速度、物体形变等比较精细几何信息。

同时不再给模型灌输任何物理公式,只给模型布置一个持续任务。比如你看着当前画面、车辆速度、之前踩油门刹车的操作,猜下一瞬间世界会变成什么样。

模型反复观看几亿条视频,前车急刹、距离快速缩短。不需要任何人告诉它惯性是什么。

在无数次观察 “预测 - 纠错” 循环里,神经网络就能更快、自动总结规律,刹车带来哪些惯性、高速下距离衰减不是线性的、碰撞后物体存在哪些形变等等这样的物理规律。

这套规律储存在海量权重里,也就形成一种天然“直觉”。

和过去依靠人工编写上百条动力学规则、障碍物运动模型不同,现实路况变量无穷,现在利用多模态 Token 预训练任务,让模型自发沉淀连续时空因果权重,这也是一个天然的数据积累,而且它的通用性极高,因为不仅是车,机器人等不同工具它也需要天然的物理“直觉”。

而老式端到端我们训练的框架一般是当前视觉后输出转向、刹车、油门,它更像一个反射型模型。看到危险画面、立刻执行避让,但不会主动想象未来。

现在相当于增加了一个整个时序预测的世界模型方案,通过观察来预测未来多帧画面、障碍物占用空间、还有轨迹轨迹。等于模型多了一项能力,先脑补未来会发生什么,最后挑选一个风险最低的。

这也是我们上手VLA 2.0的一个最显性的优点,很多决策策略时延非常低,同时它对潜在的风险、安全边界有更好的约束,它虽然还存在一个瑕疵,但它不像过去非常规则类的0和1的处理,一些经典的场景例如快速鬼探头的让行、并行会车、人车复杂的连续起步脱困、和复杂路面的理解场景,都是属于VLA 2.0 的高光场景。

在这基础上,VLA 2.0 的控制也得到非常大的提升。

3、VLA 全球化的挑战在哪?

这次VLA 2.0最大的变化是小路穿行、会车等能力提升,这方面最先感受得到的是控车、起步刹停的动作非常细腻,这种细腻处理非常流畅,也解决了很多过去点刹或者顿刹的问题。会车的难点是对象车意图的多变性,有些是前车突然停靠、准备掉头这种复杂动机,一种是和对象车在窄路的会车意图理解,这点VLA 2.0对博弈意图的推理表现有很大提升,流畅性表现也很不错。而来到德国,我们也才发现这边的红绿灯、行人两轮车的路权、有轨电车的礼让逻辑等,都有很多不同。

这些也是我们过去没有的视野,过去我们在国内觉得具体问题具体分析,做好具体问题就可以。但是现在全球化的竞争框架下,视野和解决逻辑显然不同。

小鹏通过预训练大基座 + 本地化轻量化后训练,会成为小鹏这套 VLA + 世界模型架构最显性、最难以追赶的全球化护城河。

像进入欧洲、东南亚等新市场,底层通用的表征可以不动,通用的物理规律也是习得的,只需要非常少量的本地化数据做轻量化后训练就可以。

相当于不需要从头教模型怎么开车,只修正地域差异化知识。本地路权规则、交通参与者行为习惯、驾驶礼仪、非机动车动的规则就行,过去模型缺少通用的训练基座,那基本和从头训练没有差别,同时国内也没有FSD一样有非常庞大的全球车队,可以通过海量真实数据堆起来适配,所以小鹏通过基座预训练+后训练的方式,成为一套新体系下的独有能力。

而回头看,这又和小鹏自研的大算力芯片完成闭环,只有更高硬件、更高效的计算范式,才能完整释放后训练带来的泛化红利。

VLA 2.0 的核心价值,不再基于单点模型优化,而在于完成了从通用预训练基座、后训练迁移能力、世界模型到软硬协同体系的全方位升级,同时完成了面向全球市场的一整套技术闭环和商业化的验证。小鹏NGP德国表现惊艳中外媒体小鹏MONAL03德国NGP实测