42号车库
2026-09-18
截至今年 8 月底,零跑汽车已经交付了 35 万辆激光雷达版车型。在 9 月 16 日举行的 2026 零跑技术日上,零跑汽车创始人、董事长兼 CEO 朱江明宣布,35 万老用户都将免费升级至最新的世界模型辅助驾驶版本,并终身免费。
根据规划,2027 年第一季度零跑 D19,以及 27 款 C10、B10 的车主将率先用上世界模型。到 2027 年第二季度,世界模型将上车 27 款 C16、B01;到明年第三季度,零跑 D99,以及 26 款 C16、C10、C11 和27 款 C11 的车主也将收到世界模型的辅助驾驶。到明年第四季度,24 款 C16、C10、C11,25 款 B10、B01,26 款 Lafa5,以及 A10、A05 也将配备世界模型的辅助驾驶。
此外,世界模型辅助驾驶也不是高端车专属,10 万元以内的车型,也能拥有。
对于老车主来说,世界模型辅助驾驶能力是配置表之外,且在销售时未作承诺的一项功能。
这份面向存量用户的免费升级承诺,代表着一种态度——零跑不背刺老车主。朱江明透露,最早一万多名激光雷达版用户,车型由于硬件平台不一致,算法移植重构至少需要花 5,000 万元,但零跑还是会为这批用户免费升级。
零跑科技电子产品线负责人周洪涛介绍:「世界模型不是某种技术范式,而是一种目标。」这个目标是让模型理解周围的世界,并预判接下来会发生什么。
此前,零跑已经落地了两段式架构的车位到车位城市领航,但遇到了三个明显的痛点:模块间传递信息会产生损耗,多模块串联会叠加延时,依赖规则处理的特殊场景又很难穷尽。LWM 世界模型辅助驾驶的出现,则是用一段式端到端架构,让环境理解与驾驶决策更紧密地结合。
世界模型辅助驾驶的训练体系分为云端和车端。云端先训练基座世界模型,通过视频预测、像素重建、语义理解、3D 物理占据等任务,学习场景的结构与变化。车端模型复用云端基座的理解能力,加入导航、车辆实时状态等信息,再结合驾驶数据进行端到端后训练,形成能够实时运行的驾驶模型。另一条链路是利用云端模型生成罕见场景,进行闭环仿真,帮助车端模型应对实车数据中难以充分覆盖的问题。
这里的「端云结合」,指向训练、仿真和能力复用的分工:云端扩充模型见过的世界,车端完成实时驾驶决策。
在模型设计上,周洪涛介绍了零跑所做的三项取舍:保留图像原始的透视关系,省去 BEV,也就是鸟瞰视角转换的环节,以减少算力开销;设计记忆存储模块,让模型利用历史信息;将惯性与实时理解解耦,以改善驾驶舒适性。
此外,新架构减少了 90% 的代码量,但仍保留红绿灯等交通法规的规则兜底,并以激光雷达作为安全冗余。驾驶策略更多交给模型学习,系统仍然保留必要的约束。
实际上,就在 2026 零跑技术日的前几天,42 号车库与零跑汽车世界模型智驾负责人冯铭月进行了一次深度交流。从用户最关心的硬件适配与体验差异聊起,他进一步解释了模型设计的取舍,以及团队如何随着方案验证逐步增加投入。
冯铭月首先明确,采用高通 8650 和 8797 芯片、且搭载激光雷达的零跑车型都会适配世界模型辅助驾驶。对于 200 TOPS 的 8650 平台,零跑目标是满足日常通勤需求;同时,更高算力平台的综合表现会更好,差异主要体现在极端场景和功能丰富度上。例如,640 TOPS 的 8797 平台计划支持语音控车功能,8650 芯片的车型则不支持。
因此,为 8650 芯片的车型减少车端算力,是非常重要的一步。
在感知上,零跑抛弃了 BEV,采用了人眼透视的原理,简单说就是「近大远小」。
冯铭月举了一个例子,一辆车从侧前方 cut in,航向角和位置的变化可能很小,但在相机图像里,它占据的画面会发生明显变化。保留原始图像视角,让模型直接利用这些变化输出轨迹,既是为了利用驾驶线索,也省去了转换到 BEV 视角所需的算力。
从世界模型辅助驾驶的早期验证到现在,也就 9 个月的时间。冯铭月回忆,去年年底世界模型项目起步,当时只有不到 20 人,其中 6、7 个人负责模型,其他人负责控制和车辆集成。当时为了尽快看清模型的上限,工程师团队还曾经把一台搭载 3090 芯片的工控机搬进测试车后备箱进行早期测试验证。
2026 年 3 月,零跑世界模型辅助驾驶团队跑出了第一版 Demo。当时,大曲率弯道等场景还存在问题,但模型呈现出的博弈交互能力,让零跑决定继续投入。到今年 6 月,参与世界模型项目的已有六七十人,算法也在这一阶段从工控机迁移到了 8797 芯片上。
到现在,零跑世界模型辅助驾驶的算法团队已超过 400 人,整个智驾团队已超过 800 人。由此可见,在最近两个月时间里,世界模型团队的规模迅速扩张,目标就是为了明年一季度的量产上车。
以下为 42 号车库与冯铭月的对话全文,略经编辑。
只用了 9 个月
42 号车库:这套世界模型辅助驾驶从立项到现在,做了多久?
冯铭月: 从项目浮出水面到现在,大概九个月。最早的时间点是去年 11 月、12 月。在那之前,团队已经做过一些调研,觉得这套方案可行,才开始向老板汇报,希望做这样一个项目。刚开始投入的人不多,十几到二十人。六七个同学做模型,另一些同学做控制、车辆集成,打通车上的链路。
我们一开始很担心,把所有部署问题解决了以后,才发现效果没有达到预期,那就走弯路了。所以我们希望先快速验证方案,快速试错。
42 号车库:为什么世界模型的验证可以做到这么快?
冯铭月: 我们把一台 3090 工控机直接搬到了车上,放在后备箱里。它比较大,甚至拆掉了一部分座位。车开起来会颠,我们还做了一个架子,把工控机固定在那里。这样做,是为了省下前期工程化的时间。
我们从十一二月份开始,到三月份,主要就是证明方案的有效性,看它的上限到底怎么样。如果上限就不满足要求,可能说明选择的技术范式本身有问题。
42 号车库:3 月份的第一个版本,能力已经非常好了吗?
冯铭月: 那个版本还充满问题,比如大曲率弯道就拐得不太好。但大家看到了它在博弈交互,以及对物理世界认知上的能力。
举个例子,我们测试时发现,在一些极窄的空间里,面对可跨越的低矮路沿,模型会选择压过去;如果路沿再高一些,即使对向车不断挤过来,它宁愿停在那里,也不会猛地上去。我们没有专门为这个行为写规则。
从这些场景和交互能力里,我们觉得这套方案是可行的,上限很高。于是从 3 月开始,投入了更多同学。
42 号车库:早期验证的阶段,为什么会更关注模型的上限?
冯铭月: 当时体验还是会遇到问题,但整体效果超出了预期。大家更关注的是,这套方案最高能做到什么程度。
有些下限上的问题,可以通过工程工作,或者非常简洁的兜底逻辑去处理。最难的是判断上限。我们看到这套方案有前途,就比较果断地投入了资源。
42 号车库:从 3 月之后,零跑世界模型辅助驾驶在推进哪些部分?
冯铭月: 一是提升效果,二是把工控机拿掉,将整套算法迁移到 8797 芯片上。我们要验证两件事:效果是不是按照预期提升,以及它是不是能够满足量产要求。这个阶段,更多做量产、控制和平滑处理的同学加入进来。
到 6 月,参与项目的大概有六七十人。
6 月的 Demo 跟 3 月相比,变化很大。朱总上车体验时,没有用我们推荐的路线,而是自己导航去了西湖那边。他体验后很满意,我们基本兑现了 3 月时对 6 月效果的预期。
42 号车库:那么 6 月之后呢,现在应该都在做量产了吧?
冯铭月: 我们上一代辅助驾驶内部叫作 2.0 的项目,基本完成了该做的 OTA。6 月以后,更多人力开始投入新项目。现在可以认为,智驾团队基本都在聚焦这一个项目,算法同学已经超过 400 人。从 6 月到 9 月,我们就在不断打磨这款产品。
抛弃 BEV
42 号车库:为什么零跑没有选择把多模态大语言模型改成 VLA 的路径?
冯铭月: 从一开始,我们就不太倾向于这条路径。多模态大语言模型已经在数字世界证明了效果,但我们认为,把它拿到物理世界中,是不是一个扎实的解决方案,还需要验证。它需要的资源,以及验证的难度和周期,也都比较高。
我们更关注人开车时是怎样的状态。你可以把多模态大语言模型理解为一个有很多互联网知识的优等生,但一个大学生、研究生、博士生,和一个初中生一起学开车,不一定学得更快。
我们做智驾,是在物理世界里学习怎样开车,所以更愿意从驾驶本身关联的事情出发,做具体的技术取舍。
42 号车库:说到技术取舍,放弃 BEV 视角转换是不是就是其一?
冯铭月: BEV 是一套很成熟的感知框架,它解决了感知中的一些问题。图像里近大远小,同样相差一个像素,在不同位置可能代表完全不同的距离。BEV 把这样的差异消除了。
但我们的思考是,人开车并不是站在一个俯视的、上帝视角上。近大远小这件事,本身就是有用的。
比如高速行驶时,一辆车切入当前车道,它的航向角和位置变化可能非常微小,对模型提供的信号也很小。但在图像里,一辆车从右侧进入你的正前方,像素变化是很明显的。
从这个例子能看出来,透视关系在开车时有用。所以我们保留图像视角,直接从图像输出轨迹,不再做中间的视角转换。这是其中一个具体的技术判断。
同时,BEV 转换本身还是相当耗算力的,这一步节约算力,让世界模型可以部署到 8650 芯片平台。
42 号车库:之前零跑做的是两段式架构,现在已经是一段式了吗?
冯铭月: 以之前的两段式方案为例,它先做感知,再做后面的规划控制。我们遇到过尬停、点刹和顿挫的问题,一个原因就是感知有误差,规控对感知不够自信。
比如感知的误差可能是左右 10 厘米,规控并不知道当前这个场景到底准不准,就要按照这样的误差范围设置边界。有些边界还是硬边界,达到那个距离就不能再往前。
但如果直接看图像,周视相机观察的是车与旁边物体之间还有没有缝隙。对于一段式、基于世界模型的端到端方案,这些图像信息能够直接参与后面的决策。我们观察到,它在一些很窄的地方也会选择通过,这和人观察缝隙的感觉比较类似。
42 号车库:新老两套架构的差别非常大,过去的经验还能复用吗?
冯铭月: 任何新东西都不是凭空产生的,都是在总结上一套方案的缺点。我们不会为了 VLA 而 VLA,也不会因为多模态大语言模型在其他领域表现很好,就强行把它搬过来。
从规则时代,到感知模型化,再到两段式把规划也模型化,我们很清楚每个阶段遇到了什么问题。设计现在这套方案时,我们参考的就是:上一代到底碰到了哪些问题,怎样通过新的方案把它们解决掉。
即使现在的方案和两段式有很大区别,我们的动机和判断,依然来自之前发现的那些问题。
千卡 H200 算力级别,但人更重要
42 号车库:零跑用多大规模的算力训练世界模型?
冯铭月: 我们的算力是千卡 H200 级别。
算力和人是相关的。评估一个算法同学,我们会看他对模型的判断力。做 AI,一定要允许犯错,不可能有人设计一套架构,一次就成功。
判断力好的人,可能试五次就找到了正确路径;另一个人可能试一百次也没找到。当然,卡越多,对算法工程师来说肯定越好。
但如果把要达到的效果固定下来,资源多,试错机会就多;卡比较少,对人的要求就会非常高,因为没有那么多试错空间。
从两段式走过来的过程里,我们培养了一个实干型的团队,大家是真正在解决问题的。现在做一段式、世界模型的方案,之前做两段式时表现很好的那批人,同样做出了很大贡献。
42 号车库:零跑正在做的车都是「好而不贵」的,但业内更多的车企,就在用「又好又贵」的雷达、传感器,您怎么看零跑现有硬件的能力?
冯铭月: 增加传感器是在做加法,补盲能让系统看到更多人观察不到的地方,理论上有机会做到超过人的安全性。
但我觉得当前这套传感器方案的潜力,还没有充分发挥出来。人开车看前方,变道时看后视镜,而车上的周视相机已经覆盖了很多这样的视角。
现有相机能捕捉的范围很大,但我们已经把它做得足够好、超过人了吗?我觉得也不一定。所以当前硬件仍然有潜力可挖。
42 号车库:零跑做世界模型辅助驾驶,您和团队最希望这套系统能够给用户带来怎样的变化?
冯铭月: 最重要的是安全性。我们希望改变用户的心智,让用户有信心使用它。
以前做两段式测试,碰到一个很难的场景,效果不好,有些测试同学报完问题,会补一句:「这种情况下,我是不会开智驾的,用户大概率也不会开。」在以前某个阶段,这可能可以作为一个借口。但我们希望继续把这些场景做好,让用户有信心打开智驾。
安全性和效率之间,我首先会选择安全性。在安全性做得足够好、保证安全性不下降的情况下,再尽量把效率做好。现在还有很多可以做的地方。我们希望真正交到用户手里的时候,比今天体验到的更好。
声明:本文由车市号作者撰写,仅代表个人观点,不代表网上车市。文中部分图片来源网络,感谢原作者。
竟然没评论,快去评论~~