聚牛科技
2026-09-18
但像素级生成也带来难以回避的短板。模型需要耗费大量算力去学习纹理、光影、路面污渍等大量和驾驶决策无关的视觉细节。车辆做规划,真正关心的并不是路边树木的纹理,而是行人什么时候横穿马路、前车是否会减速、周边车辆的行驶意图。大量计算资源被消耗在像素渲染上,带来推理成本高、预测易失真的问题。
原始 V-JEPA 架构凭借视频语义掩码预训练,擅长提取视频高维隐表征,无需重建像素即可学习场景时序规律。但原生 V-JEPA 并非面向自动驾驶规划任务设计,无法直接完成交通参与者运动预测和自车轨迹输出,难以落地到驾驶决策环节。WA-JEPA 正是针对这一痛点,对 V-JEPA 范式进行重构,打造原生面向自动驾驶的世界 - 动作模型。
三大核心改造,构建隐空间预测 + 动作联合建模新架构第二,引入条件流匹配机制。传统确定性回归方法容易出现预测 “平均化” 问题,面对多模态交通场景,比如行人可能走也可能停,模型会输出一个折中、保守的预测结果。条件流匹配学习未来表征从噪声到真实目标状态的演化过程,更好地捕捉交通场景中的多可能性,提升不确定性场景下预测的真实性。
第三,世界表征与驾驶动作联合预测。模型使用同一个预测器,同时输出未来场景表征和自车行驶轨迹。不同于 “先预测环境、再单独规划路径” 的串行方案,环境变化预判和车辆动作规划同步完成,让规划动作天然感知环境未来的演变趋势,打通世界模型到驾驶决策的链路。
在模型体量上,WA-JEPA 仅有约 4.81 亿可训练参数,在世界模型领域属于紧凑规模。模型第一阶段训练仅需要原始连续驾驶视频,不需要目标检测、语义分割这类昂贵的人工标注数据,可以充分挖掘海量无标注路采数据,大幅降低自动驾驶世界模型训练的数据门槛。
开环闭环双榜领跑,零样本闭环评测验证迁移能力开环指标验证模型单步规划轨迹的合理性;闭环仿真则更贴近真实行车,模型根据输出轨迹持续和仿真环境交互,一旦预判失误就会触发碰撞等危险事件。零样本条件下闭环评测夺冠,意味着 WA-JEPA 学到的是通用的交通场景演化逻辑,不是对测试场景的过拟合记忆,具备跨场景迁移潜力。
全面开源,为自动驾驶世界模型提供公开基线千里智驾同步对外释放 WA-JEPA 全套成果,包含学术论文、源代码、模型权重以及完整评测流程。整套材料全部开源,学术界和产业界研究者可以直接复现实验结果,也能基于该模型继续迭代,方便行业横向对比不同世界模型方案的优劣。
这套开源方案,为产业探索轻量化、低成本、强泛化的自动驾驶世界模型提供了新的参照范式。随着后续持续迭代,这类世界 - 动作模型,有望推动端到端自动驾驶从 “感知当下” 迈向 “理解并预判未来”。
声明:本文由车市号作者撰写,仅代表个人观点,不代表网上车市。文中部分图片来源网络,感谢原作者。
竟然没评论,快去评论~~