智选车
2026-08-27
开过智能辅助驾驶的人大概率都有过这种体验,过路口时它会突然犹豫一下;旁边的车刚有一点加塞苗头它就猛踩刹车;明明前车已经在减速了,它非要等凑近了才反应。之所以会出现这种情况,主要还是因为有些车载AI更像个只会看当下的新手,认得出车和人,却读不懂动态的路况。
这次小鹏第二代VLA大模型迎来首次重大升级,核心就是给AI加上“时间感”,让它从只会看懂3D空间,升级成能理解4D时空。听起来很玄,但落到实际驾驶里,其实就是解决了“没记性、反应慢、没预判”这三个老毛病。
以前的智驾模型本质上是一帧一帧看世界,每一秒都在重新识别眼前有什么,前后画面割裂。就像你看PPT猜剧情,永远不知道上一页发生了什么,自然也猜不到下一页会怎样。
这次升级后的Infini-VLA长时序架构,相当于给AI一段30秒的“长记忆”。它能把过去半分钟里车辆、行人的移动轨迹联系起来,知道旁边这辆车之前就一直在往左靠,大概率是要变道;看到路边的行人之前一直在往前走,突然减速就可能要横穿马路。有了前因后果,决策自然就不会一惊一乍。
与此同时,推理模式也从看完再思考变成边看边想。官方说端到端响应速度提升300%,换成用户体感就是,以前遇到突发情况,AI要先看清楚→算明白→再执行,总慢半拍;现在是流式推理,信息进来的同时就在做决策,跟老司机边观察边打方向的逻辑差不多,遇到加塞、急停这种场景,动作会更连贯,不会先愣一下再刹车。
最值得说的其实是X-Foresight预测能力,能预判未来6秒的路况。很多人说智驾开着不如人舒服,核心差别就在这:人类司机开车是看着前面三辆车,提前松油门、留距离;以前的AI是盯着前面一辆车,人家动了它才动。
现在能预判6秒,相当于提前把周边交通参与者的下一步动作算了一遍,过路口能预判信号灯变化,环岛能知道哪辆车要出去,不用等别人动了再反应,行驶质感会更像真人。
此外,这次还上车了Master Agent,它把车机和智驾打通,相当于给整车装了个统一的大脑。
以前的车机更像是个语音遥控器,你得说精确指令,比如“打开自适应巡航”“设置车速100”“搜索XX停车场”,说错一个词它都听不懂。现在的Master Agent基于全模态模型,能理解模糊意图,比如你说“靠边停一下买瓶水”,它自己会找合适的位置靠边停;你说“回公司顺路买咖啡寄快递”,它自己拆解任务、规划路线,不用你一步步操作。
说白了,就是从你让它做什么,变成你说需求,它帮你完成。这次同步上线的语音靠边停车、语音就近泊车,其实就是这个能力的具象化,不用手动切换模式、不用选车位,说一声就行,系统自己调度智驾、底盘、座舱一起完成。
以前是各个功能各干各的,现在有了统一的大脑,能理解意图、拆解任务、协同执行。以后再加新功能,就不是多一个语音指令,而是大脑又多了一项能力。
值得一提的是,这次小鹏同步放出了VLA 2.0 Lite蒸馏版,9月将会推送给G9L Max车型。简单来说就是把大模型的能力压缩,放到算力更低的平台上,不用顶配硬件也能用上核心能力。
物理AI的模型蒸馏比大语言模型难很多,因为要保证感知和决策的精度不能掉,能跑通这条路,至少说明高阶智驾不会永远是顶配专属,中低配车型和老车主也有机会用到。
另外一个容易被忽略的点是,这套模型在德国做了本地化测试,几乎没有加多少本地训练数据,效果就和国内差不多。这其实更能体现模型能力,智驾的真正门槛从来不是在某一条路开得好,而是换个国家、换种路况、换套交规,还能不能开得稳。如果明年能顺利在欧洲落地,将进一步证明这套基座模型的泛化能力。
顺便提一句,最近小鹏机器人融资9亿多美元,估值超63亿,本质上也是这套物理AI底座的复用。同样的模型,放在车上是智驾,放在机器人身上就是运动控制。这也说明小鹏做的不是车载智驾功能,而是通用的物理AI能力,汽车只是第一个落地的载体。
现在行业里都在卷VLA、卷大模型、卷参数,但很少有人说清楚,模型变大到底是为了什么?小鹏这次给出的答案是“理解时间”——记住过去、反应现在、预判未来。
客观来说,这确实是智驾接下来走的正确方向,从能识别物体到能理解动态,从快速响应到提前决策,最终目标都是让AI开车更像人,而不是更像机器。
不过,30秒记忆、6秒预测到底能否解决城区智驾的那些痛点,Master Agent能否真的听懂人话,还得等实车交付后用户的反馈,大家不妨可以期待一下。
声明:本文由车市号作者撰写,仅代表个人观点,不代表网上车市。文中部分图片来源网络,感谢原作者。
竟然没评论,快去评论~~