近日,千里智驾携手电子科技大学、东南大学、北京邮电大学及天津大学,共同发布并开源了世界—动作模型WA-JEPA,为自动驾驶模型在场景理解、未来预测及动作生成方面开辟了新的技术路径。
针对当前部分自动驾驶世界模型通过生成未来视频来学习环境变化的做法,这类方法虽然能直观呈现未来画面,但需要消耗大量算力去还原纹理与光影细节。WA-JEPA则另辟蹊径,它并未将“生成逼真的未来画面”设定为目标,而是依托V-JEPA的视频语义表征能力,在高维隐空间中精准预测道路结构、交通参与者关系及运动趋势等与驾驶规划更紧密相关的信息。
为了解决原始V-JEPA架构不适应自动驾驶规划设计的问题,WA-JEPA进行了三项关键改造:首先,采用未来掩码预训练,使模型能够根据历史画面推演尚未发生的场景变化;其次,引入条件流匹配技术,学习未来表征从噪声到目标状态的变化过程,有效规避了确定性回归容易产生的“平均化预测”问题;最后,将未来场景表征与自车动作置于同一预测器中进行联合生成,从而实现模型在预测世界变化的同时完成车辆轨迹规划。
在模型规模上,WA-JEPA包含约4.81亿个可训练参数,在世界模型研究中保持了相对紧凑的体量。其第一阶段训练仅需连续驾驶视频,无需依赖目标检测或语义分割等额外的人工感知标注,极大提升了大规模驾驶数据的利用效率。
在性能表现方面,依据论文采用的统一评测协议,WA-JEPA在NAVSIM-v2开环规划基准中取得了91.7 EPDMS的成绩,分别比对比实验中的最强端到端基线和最强世界—动作模型基线提升了1.6和1.3。在HUGSIM的436个闭环场景测试中,模型在未经针对性训练或微调的情况下,获得了0.4462 HD-Score,成为同一复现协议下的最佳结果,展现出显著的零样本迁移能力。
目前,千里智驾已同步开放相关论文、代码、模型权重及评测流程,旨在为世界—动作模型在自动驾驶领域的复现、比较及后续研究提供公开基线。
