全部车市号

千里智驾开源 WA-JEPA 让未来预测直接参与驾驶规划

聚牛科技

2026-09-18

当行业争相用生成式模型渲染逼真的未来行车画面,以此构建自动驾驶世界模型时,千里智驾联合多所高校团队走出了一条差异化路线。近日,千里智驾联合电子科技大学、东南大学、北京邮电大学、天津大学正式发布并开源 WA-JEPA 世界 - 动作模型。该模型跳出 “生成图像” 的固有思路,在隐空间预测与驾驶决策强相关的场景运动信息,实现场景理解、未来推演与轨迹规划一体化,并且在开环、闭环两大评测基准上拿下最优成绩,为自动驾驶世界模型研究提供全新基线。
生成式世界模型的困局:为像素付出过高算力
自动驾驶世界模型的核心价值,是让车辆提前预判环境变化,进而做出安全合理的驾驶动作。当下主流技术路线,大多依靠生成模型预测未来视频帧,输出完整画面。这类方案的优势直观可见:模型可以输出人眼能看懂的道路影像,方便研究人员观察模型对场景的理解。

但像素级生成也带来难以回避的短板。模型需要耗费大量算力去学习纹理、光影、路面污渍等大量和驾驶决策无关的视觉细节。车辆做规划,真正关心的并不是路边树木的纹理,而是行人什么时候横穿马路、前车是否会减速、周边车辆的行驶意图。大量计算资源被消耗在像素渲染上,带来推理成本高、预测易失真的问题。

原始 V-JEPA 架构凭借视频语义掩码预训练,擅长提取视频高维隐表征,无需重建像素即可学习场景时序规律。但原生 V-JEPA 并非面向自动驾驶规划任务设计,无法直接完成交通参与者运动预测和自车轨迹输出,难以落地到驾驶决策环节。WA-JEPA 正是针对这一痛点,对 V-JEPA 范式进行重构,打造原生面向自动驾驶的世界 - 动作模型。

三大核心改造,构建隐空间预测 + 动作联合建模新架构
WA-JEPA 放弃还原未来画面,将预测目标锁定在高维隐空间里的场景语义、物体运动关系,同时把环境预测与自车动作规划融合,完成三项关键技术创新。
第一,未来掩码预训练。模型基于历史连续行车视频,对未来时间步的表征进行掩码,迫使模型学习时序场景演化规律,仅依靠过往画面推演未来场景状态,不需要人工标注语义标签。

第二,引入条件流匹配机制。传统确定性回归方法容易出现预测 “平均化” 问题,面对多模态交通场景,比如行人可能走也可能停,模型会输出一个折中、保守的预测结果。条件流匹配学习未来表征从噪声到真实目标状态的演化过程,更好地捕捉交通场景中的多可能性,提升不确定性场景下预测的真实性。

第三,世界表征与驾驶动作联合预测。模型使用同一个预测器,同时输出未来场景表征和自车行驶轨迹。不同于 “先预测环境、再单独规划路径” 的串行方案,环境变化预判和车辆动作规划同步完成,让规划动作天然感知环境未来的演变趋势,打通世界模型到驾驶决策的链路。

在模型体量上,WA-JEPA 仅有约 4.81 亿可训练参数,在世界模型领域属于紧凑规模。模型第一阶段训练仅需要原始连续驾驶视频,不需要目标检测、语义分割这类昂贵的人工标注数据,可以充分挖掘海量无标注路采数据,大幅降低自动驾驶世界模型训练的数据门槛。

开环闭环双榜领跑,零样本闭环评测验证迁移能力
研究团队在统一评测协议下完成 WA-JEPA 验证,分别在开环规划基准 NAVSIM-v2 和闭环仿真 HUGSIM 上取得亮眼结果。 在 NAVSIM-v2 开环规划基准,WA-JEPA 取得 91.7 EPDMS,对比最强端到端基线提升 1.6,对比最强世界 - 动作模型基线提升 1.3。 在包含 436 个真实交通场景的 HUGSIM 闭环仿真测试中,模型没有针对评测场景做专项训练、微调,零样本 HD-Score 达到 0.4462,为同复现协议下最优成绩。

开环指标验证模型单步规划轨迹的合理性;闭环仿真则更贴近真实行车,模型根据输出轨迹持续和仿真环境交互,一旦预判失误就会触发碰撞等危险事件。零样本条件下闭环评测夺冠,意味着 WA-JEPA 学到的是通用的交通场景演化逻辑,不是对测试场景的过拟合记忆,具备跨场景迁移潜力。

全面开源,为自动驾驶世界模型提供公开基线

千里智驾同步对外释放 WA-JEPA 全套成果,包含学术论文、源代码、模型权重以及完整评测流程。整套材料全部开源,学术界和产业界研究者可以直接复现实验结果,也能基于该模型继续迭代,方便行业横向对比不同世界模型方案的优劣。

世界模型被视作下一代自动驾驶的核心技术底座,目前行业路线分化明显,像素生成路线、隐空间预测路线各有探索。WA-JEPA 的价值在于证明:自动驾驶世界模型不必执着生成逼真画面。抓住驾驶任务本质,在隐空间预测交通参与者运动关系,联合建模环境与车辆动作,同样可以实现高精度的场景预判与规划。

这套开源方案,为产业探索轻量化、低成本、强泛化的自动驾驶世界模型提供了新的参照范式。随着后续持续迭代,这类世界 - 动作模型,有望推动端到端自动驾驶从 “感知当下” 迈向 “理解并预判未来”。

声明:本文由车市号作者撰写,仅代表个人观点,不代表网上车市。文中部分图片来源网络,感谢原作者。

发表评论

请您注册或者登录车市社区账号即可发表回复

全部评论(0)

竟然没评论,快去评论~~