全部车市号

不看天书,只讲人话!小鹏第二代VLA大升级,到底升级了啥?

高动能

2026-09-01

近日,小鹏第二代VLA大模型迎来首次重大升级,与之配套的XOS 6.3.0版本将在小鹏G9L上全球首发。对于智能驾驶系统来说,本次大模型升级的底层逻辑,讲人话就是三个字——“抢时间”。

 

 

我们先阐述理论:相比此前系统主要基于对物理世界的静态三维空间感知,升级之后的VLA大模型深化了对时间维度的理解。从能够识别车辆、行人、道路和交通信号等元素,到第二代VLA将记忆时长延伸至前30秒,使模型能够将连续发生的道路事件串联起来,形成完整的时序理解,而非将路况割裂为独立的画面。

 

 

换成容易理解的说法:过去的智能驾驶系统处理路况的方式,有点像看一张张静止的照片。系统能认出照片里的车、人、红绿灯,但照片和照片之间发生了什么,它并不清楚。而真实的道路是连续变化的,只看当下这一瞬间,有时候不够用。

这次升级的核心变化,就是让系统重新“理解时间”,不仅可以识别当下,还可以推演过去,以及预演未来。

 

 

小鹏给第二代VLA增加了一个长时序记忆功能,系统能推演过去30秒里路上发生了什么。这样一来,前面那辆车是什么时候开始减速的,旁边那辆是不是一直在变道,这些信息都能串联起来,而不是当成孤立的事件处理。

 

 

打个比方,以前系统看到前车刹车灯亮了,识别的信号是前车正在刹车;现在它能结合前十几秒的记忆判断:它从半分钟前就开始频繁点刹,前方可能正在堵车。

除了看得更完整,系统思考与决策的速度也在改变。以前的工作模式是“看一眼、算一下、输出结果、开始执行”,步骤是分开的。

 

 

现在采用的则是新的流式处理,相当于眼睛在看的同时“大脑”同步思考,并且随时准备行动,三个环节并行进行。简单来说,就是在行动步骤上,让机器的思考与决策逻辑,更加贴近人类思维。

 

 

据悉,升级之后系统端到端响应速度提升了300%。遇到突发情况,比如前车突然刹停、行人从路边折返、旁边车辆强行加塞,系统的反应节奏更紧凑了。用开车的经验来说,就是从“愣一下再处理”变成了“下意识地决策与应对”。

 

 

这次升级还加入了一个预测功能,官方叫X-Foresight。简单来说,系统不仅看现在,还会根据周围车辆的速度、运动方向、道路环境等因素,并试图推测未来6秒内可能发生什么。比如,旁边车道的车正在加速靠近,系统会预判它可能要变道。再比如,看到路边有人站在斑马线附近低头看手机,系统会提前留神他会不会突然走出来。

 

 

这种预判不是为了代替驾驶员做决定,而是让系统提前进入准备状态,留出更多反应余地。除了驾驶本身,这次升级还带来了一个叫Master Agent的整车控制中枢。你可以把它理解为一个协调员,能听懂比较自然的语音指令,还能把一句话拆成几个任务,分配给车上不同的系统去执行。

发布会上演示了“语音靠边停车”和“语音就近泊入”这两个新功能。用户在行驶中直接说靠边停一下,系统会自己找合适的位置,控制车速、打灯、转向、靠边、停稳,一整套动作自动完成。

 

 

这意味着系统从最初的“听得懂”进步到了理解用户为什么下这套指令,然后自己安排处理。

值得一提的是,小鹏Robotaxi上的一些高阶能力,正在通过这套系统下放到普通量产车上。搭载第二代VLA的Robotaxi最近拿到了广州市的远程测试许可,可以在指定道路上进行主驾无人的测试。

 

 

新技术通常先给新车用,但小鹏这次还做了套图灵VLA 2.0 Lite,通过压缩模型体积的方式,让算力较低的老平台也能运行。官方表示,这个精简版在减少资源占用的同时,尽量保留了核心能力,不会明显牺牲识别精度。这套Lite系统预计9月开始推送,小鹏G9L Max版会首发搭载。

当然,小鹏做这些不只为汽车。他们把人形机器人IRON也纳入了同一个技术体系。这台机器人身上装了三颗小鹏自研的图灵AI芯片,算力达到2250 TOPS,物理AI基座模型可以直接在机器人本地运行,不需要远程遥控,也能自主完成一些复杂操作。

 

 

从只能看“单张照片”,到能预演“连续视频”;从只会执行指令,到能自己安排任务;从只搭载于汽车,到机器人也能用——小鹏第二代VLA的这次升级,本质上是让AI加强对物理世界的理解,从静态走向动态,从单一走向多元。

声明:本文由车市号作者撰写,仅代表个人观点,不代表网上车市。文中部分图片来源网络,感谢原作者。

发表评论

请您注册或者登录车市社区账号即可发表回复

全部评论(0)

竟然没评论,快去评论~~