驾仕派
2026-09-17
不久前小鹏第二代VLA大模型迎来首次重大升级,全新XOS 6.3.0版本将于小鹏G9L全球首发,并从9月起陆续推送,覆盖所有Ultra/Ultra SE车型。
此外,第二代VLA Lite蒸馏版于9月同步开启首批推送,面向单图灵芯片Max车型,G9L Max首发搭载。
小鹏称,此次模型升级的核心,是让AI开始真正理解时间:从过去对物理世界的静态3D空间理解,进一步走向动态4D时空理解。
要如何理解这句话?此次小鹏第二代VLA大模型升级,实际上又更新和优化了哪些东西?对于小鹏自身及行业又有何意义?
01
把“时间”加入模型,第二代VLA再进化
先来看全新XOS 6.3.0版本的核心升级:端侧模型参数量提高3.5倍,具备30秒时序记忆,并能推演6秒未来场景,端到端响应提速300%。此外,新版本还引入了整车大脑Master Agent,实现VLA + VLM的驾舱融合,并把部分Robotaxi的L4级体验下放到量产车型。
其中,最值得关注的变化,是小鹏开始把“时间”加入模型,让模型真正理解物理世界。具体来看,就是第二代VLA全新引入Infini-VLA长时序架构,可以记住前30秒的世界,让驾驶判断开始拥有更长的上下文理解。
这相当于让模型开始拥有“时间感”,传统智驾就像是“金鱼的记忆”,只能根据眼前这一帧做判断,但在拥有长时序建模能力后,系统就可以结合此前的动态变化理解当前场景。
同时更长的历史记忆也是小鹏X-Foresight做未来6秒推演的基础。今年6月,小鹏正式发布X-Foresight,把预测式世界模型直接融入VLA架构,如今不到3个月就已实现上车,速度相当快。
而这也意味着,小鹏第二代VLA不仅能记得刚才发生了什么,还能对接下来可能发生的情况进行预测,从而提前做出决策,更接近人类司机在真实世界驾驶的思维方式。
除此之外,新版模型还加入了MoT混合架构,可以针对不同任务动态分配模型能力。像是城区道路、园区、泊车这些不同场景可以让不同“专家”负责,以此提升模型在不同驾驶人物之间更稳定地切换。
那落到实际体验上,XOS 6.3.0主要都有哪些提升?
官方表示,新版本将Robotaxi的L4级能力,进一步下放至量产车,加入“语音靠边停车”“语音控制就近泊入”功能,说一句“靠边停车”,车辆就自动完成变道、减速、停靠,全程不用碰方向盘,还能听懂“去机场接人找个附近能充电的商场”这种模糊指令,自己拆解任务、规划路线,并在执行过程中展示出来,思考过程不再是“黑箱”。
社交平台上,有一些抢先升级新版本的用户分享了自己的用车感受:
座舱层面,主要是新增分屏功能、UI重新梳理,以及部分功能体验进一步优化;智驾层面,整体体验更“无感”,从上车开启智驾,再到抵达目的地,整个过程非常顺滑和自然,驾驶员需要介入的存在感进一步降低。
可以看到,新版本现阶段的实际体验其实并没有太多想象中的颠覆性变化,目前用户能感知到的,仍然是智驾流畅度、座舱交互和功能细节的持续优化。至于Master Agent作为“整车大脑”之后能够释放多大的能力,以及长时序VLA和未来预测真正能够把智驾带到什么程度,都还需要更多真实道路场景和后续OTA来验证。
不过,至少从XOS 6.3.0开始,小鹏智驾的进化方向已经越来越清晰:模型开始拥有更长的记忆,也开始尝试理解时间和预测未来。对于智驾而言,这可能比单纯增加几个功能更值得关注。
02
2026年是世界模型元年,小鹏优势在“技术复用”
小鹏正在做的事情,也是2026年全球AI行业最前沿,也最具热点的赛道,即“世界模型”。
相比让AI开始理解“时间”,在我看来,把“世界模型”加入第二代VLA才是小鹏这次全新版本更值得关注的部分。2026年,全球布局AI的巨头和企业纷纷把战火烧向了“世界模型”这一赛道。
不久前的2026年外滩大会上,香港大学计算与数据科学学院副院长、副教授罗平表示:“世界模型或许不是通往物理智能唯一的门票,但它绝对是目前人类赋予机器空间想象力、常识推演与行动预测最具希望的核心基建。”
那什么是“世界模型”?
世界模型是一种让AI具备环境认知、推演与决策能力的底层技术框架,核心目标是让AI像人类一样,能够在行动之前先在“脑海”中想象后果、预判未来,从而做出更优选择。
简单来说,就是让机器真正理解物理世界的运行规律,而不仅仅是“看到”世界。这正是世界模型试图回答的问题。
IT桔子盘点了国内33家做“世界模型”的大公司的报告,从阿里巴巴、腾讯、华为、字节跳动、小米等互联网巨头,到蔚来、小鹏、理想等车企,再到智驾供应商Momenta、地平线等智驾供应商,都发布了自己关于世界模型的技术路线。
可以看到,目前几乎所有头部玩家都在做世界模型,尽管技术路线各有分化,但行业已达成共识——世界模型将成为未来AI制胜的关键。
那在这一轮竞争中,小鹏的亮点和优势在哪里?在行业里又算什么水平?
首先从技术路线来看,在今年6月举行的CVPR 2026上,小鹏集团通用智能中心负责人刘先明透露,小鹏正在研发具备主动思考、可控生成和长时序推演能力的世界模型。他解释称,世界模型和小鹏的第二代VLA并非相互替代和相互竞争的关系,而是通过不同训练信号共同提升模型对物理世界的理解能力和物理世界的行动能力。
这意味着,小鹏是在原有VLA模型架构的基础上进一步引入世界模型,让模型具备更强的时序理解、环境推演和行动预测能力。
这个思路是对的。但如果单看小鹏这次提出的“让AI理解时间”,从技术本身来看并不是一个新概念,说白了就是让模型拥有更强的长时序建模能力,延长“上下文”。
类似的思路早在大语言模型领域就已经提出,以ChatGPT、DeepSeek为代表的大语言模型,都在持续卷自己的上下文处理能力。以前的AI总是聊着聊着就断片,就像突然失忆了一样,但现在AI的记性却越来越好,其实就是因为“上下文”能力变强了。
蔚来智能驾驶负责人任少卿也曾在《晚点》的采访中提出,自动驾驶需要“时空认知”,并表示要通过强化学习来激发模型的长时序能力,延长 “上下文”,让模型学会更长链条的推理,让车真正变成能处理 30 秒、60 秒连续过程的智能体。
一句话总结,让AI具有长期记忆,是整个人工智能行业的共识,也是其成为真正能持续理解、规划和进化的智能体的关键。
回到小鹏,它的亮点主要在于以下几方面:
1、把具体的“30秒记忆+6秒预判”数字公开,把原本比较抽象的长时序能力转化成消费者更易感知的具象指标。所以别再说小鹏不会营销了,至少在开技术发布会这件事上,小鹏绝对是教科书级别的答案;
2、技术迭代和落地非常迅速。去年11月,小鹏集团董事长兼CEO何小鹏宣布公司全面向物理AI转型,并将2026年明确定性为“物理AI全面量产元年”。随后,小鹏就在2026年密集发布其物理AI基座模型体系,涵盖X-World、X-Cache、X-Foresight及X-Mind四大技术。如今,“长时序架构+预测式世界模型”也均已实现上车量产;
3、通过蒸馏训练,将第二代VLA基座模型的部分能力下沉到算力要求更低的平台,让先进智驾能力进一步覆盖更广车型与更多老车主,实现技术普惠。
除此之外,小鹏的基建很扎实,已形成覆盖模型、数据、算力、芯片、本体的完整体系。同时小鹏的参数扩大和数据飞轮的技术路线也符合Scaling Law,持续提升模型的泛化性,为其出海做准备。
更重要的是,小鹏的野心不只是“智驾”,围绕“物理AI”这条主线,小鹏正在把同一套底层技术能力向汽车、人形机器人、飞行汽车和Robotaxi等不同载体延伸。
更重要的是,这不是口号,小鹏已经开始加速商业化落地。
9月8日,小鹏宣布机器人生产线正式启用,全球首台高阶通用人形机器人完成自动化总装并下线。按照小鹏此前规划,人形机器人将在2026年底进入规模量产阶段,首先应用于小鹏门店、园区等场景,并计划于2027年面向中国及海外市场上市交付。
飞行汽车也在推进量产。小鹏此前表示,计划于2026年实现首款飞行汽车量产。截至目前,小鹏汇天已获得超过7000个订单,并建设了规划年产能1万台、建筑面积约12万平方米的飞行汽车工厂。
今年3月5日,陆地航母飞行器已经在广州飞行汽车量产工厂完成批量试产下线及多机试飞,5台飞行器同日完成生产下线并进行多机试飞。
Robotaxi同样是小鹏验证VLA能力的重要场景。何小鹏此前透露,搭载第二代VLA的Robotaxi已经开启公开道路测试,计划于2026年启动试运营,2027年开启全球交付,大众汽车将成为首发客户。
与此同时,小鹏也在推进VLA海外落地。小鹏集团此前宣布,搭载小鹏第二代VLA大模型的小鹏NGP,将于2027年起在全球推出。
所以,小鹏真正的护城河在于这套“物理AI”技术底座大规模复用后带来的复利。换句话说,小鹏“物理AI”的故事能走多远,最终取决于这套技术底座的边界有多大。
文|小小何
图|网络
声明:本文由车市号作者撰写,仅代表个人观点,不代表网上车市。文中部分图片来源网络,感谢原作者。
竟然没评论,快去评论~~