全部车市号

小鹏第二代视觉语言动作大模型升级从空间理解到时空理解

速度计Speedweekly

2026-08-30

2026年8月27日,小鹏集团在广州举办以“TIME 时间”为主题的物理AI分享活动,宣布第二代VLA(视觉语言动作)大模型迎来首次重大升级。全新XOS 6.3.0版本将全球首发于小鹏G9L,并全系标配。此次升级的核心,是让AI从过去对物理世界的静态3D空间理解,跃迁至动态4D时空理解——模型第一次拥有了“时间感”。

真实世界不是一帧帧孤立画面的简单叠加,而是连续变化、因果交织的演进过程。传统模型能识别车辆、行人、信号灯,但面对突发刹车、行人折返、旁车强行加塞等复杂场景,仅靠“看见”远远不够。小鹏第二代VLA全新引入Infini-VLA长时序架构,让AI记住前30秒的世界,将连续发生的道路事件串联成完整的时序记忆,决策不再依赖碎片化快照。同时,模型采用Streaming Inference流式自回归推理,从离散推理走向连续推理,端到端响应速度提升300%,真正做到“边看、边想、边行动”。更关键的是,X-Foresight预测世界模型首次上车,可预判6秒内周边交通参与者的可能行为,让车辆提前规划最优路径。记忆过去、感知现在、预判未来,三个维度共同构筑起完整的时空理解能力。

能力的跃迁离不开模型规模的支撑。全新版本端侧模型参数量扩大3.5倍,是业内主流VLA的15倍以上,配合超前轨迹预判、超长有效时序和极速响应,多维综合安全能力提升20倍。更大的参数量带来更强的泛化能力,也为全球化部署铺平道路——近期小鹏在德国完成本地化验收测试,基于中国数据训练的模型在几乎不增加本地训练数据的情况下,德国城市道路实际体验与国内高度接近,目标明年上半年率先在欧洲获得监管许可。

本次升级不止于智能驾驶。小鹏首次推出Master Agent整车大脑,将VLA与VLM(视觉语言模型)深度融合,让车辆从“听懂一句话”走向“理解用户真正想完成什么”。Master Agent基于自研Omni全模态模型,能解析自然语言和模糊语义,自动拆解意图并调度智驾、底盘、座舱、车身控制等垂直Agent协同执行,实现从理解到行动的闭环。新版本还带来“语音靠边停车”“语音控制就近泊入”功能,用户口头下达停车指令,车辆即可在智驾状态下自主寻找位置并完成泊入——这正是小鹏将Robotaxi的L4级能力逐步下放至量产车的缩影。

小鹏的定位不止于自动驾驶车企,而是“物理AI世界的出行探索者”。第二代VLA基于统一技术底座贯通L2至L4能力,搭载该系统的Robotaxi近日已获广州市远程测试资质,可在主驾无安全员状态下开展道路测试。这一能力同样向机器人延伸——通用人形机器人IRON搭载3颗图灵AI芯片,有效算力达2250 TOPS,物理世界基座模型已在端侧部署,无需远程遥控即可自主完成复杂任务。8月24日,小鹏机器人业务完成首轮股权融资,超9亿美元、投后估值超63亿美元,刷新国内具身智能行业单轮私募纪录,IDG资本领投,腾讯、阿里战略跟投,资本市场高度认可其技术路线与商业价值。

在性能提升的同时,小鹏坚持科技普惠。通过学习式Token压缩与蒸馏训练,第二代VLA基座模型能力得以部署到算力更低的平台,蒸馏版图灵VLA 2.0 Lite预计9月开启推送,G9L Max版本将首发搭载,让更多用户享受到高阶城区辅助驾驶。

物理AI是一场长期工程,真正的护城河在于AI基础设施的持续沉淀。小鹏依托百万车队和十亿级数据资产,构建起覆盖数据、训练、仿真、评估、部署和算力的完整AI Infra体系。当前单次模型训练数据吞吐量已达1亿clips,比半年前增长10倍,数据飞轮正加速转动——数据越多,问题发现越充分,模型进化越快,进而产生更多高质量数据。算力、工具链与模型能力的协同增长,已呈现出明显的规模效应和复利效应。

从AI汽车到通用人形机器人,再到飞行汽车等更多智能本体,小鹏的物理世界基座模型正不断拓展与真实世界交互的边界。模型会迭代,产品会变化,但持续迭代模型的能力和支撑产品进化的基础设施,才是产生长期价值的根基。随着时间维度被真正纳入AI的理解框架,物理智能的下一章正在被改写。


声明:本文由车市号作者撰写,仅代表个人观点,不代表网上车市。文中部分图片来源网络,感谢原作者。

发表评论

请您注册或者登录车市社区账号即可发表回复

全部评论(0)

竟然没评论,快去评论~~