不靠生成画面预测未来,千里智驾开源 WA-JEPA 双榜跑出最佳成绩

9月18日消息(报道:李楠)近日,千里智驾联合电子科技大学、东南大学、北京邮电大学、天津大学发布并开源世界—动作模型WA-JEPA,为自动驾驶模型如何理解场景、预测未来并生成驾驶动作,探索了一条新的技术路径。 当前,部分自动驾驶世界模型通过生成未来视频来学习环境变化。这类方法能够呈现直观的未来画面,但也需要投入大...

9月18日消息(报道:李楠)近日,千里智驾联合电子科技大学、东南大学、北京邮电大学、天津大学发布并开源世界—动作模型WA-JEPA,为自动驾驶模型如何理解场景、预测未来并生成驾驶动作,探索了一条新的技术路径。

当前,部分自动驾驶世界模型通过生成未来视频来学习环境变化。这类方法能够呈现直观的未来画面,但也需要投入大量计算资源还原纹理、光影等视觉细节。WA-JEPA没有把“生成逼真的未来画面”作为目标,而是基于V-JEPA的视频语义表征能力,在高维隐空间中预测道路结构、交通参与者关系及运动趋势等与驾驶规划更相关的信息。

针对原始V-JEPA并非为自动驾驶规划设计的问题,WA-JEPA进行了三项关键改造:首先,通过未来掩码预训练,让模型根据历史画面推演尚未发生的场景变化;其次,引入条件流匹配,学习未来表征从噪声到目标状态的变化过程,降低确定性回归容易产生“平均化预测”的问题;最后,将未来场景表征与自车动作放入同一预测器中联合生成,让模型在预测世界变化的同时规划车辆轨迹。

WA-JEPA整体包含约4.81亿个可训练参数,在世界模型研究中保持了相对紧凑的规模。其第一阶段训练只需连续驾驶视频,不依赖目标检测、语义分割等额外人工感知标注,有助于更充分地利用大规模驾驶数据。

在论文采用的统一评测协议下,WA-JEPA在NAVSIM-v2开环规划基准中取得91.7 EPDMS,较对比实验中的最强端到端基线和最强世界—动作模型基线分别提升1.6和1.3。在HUGSIM的436个闭环场景中,模型未经针对性训练或微调,取得0.4462 HD-Score,为同一复现协议下的最佳结果,展现出一定的零样本迁移能力。

目前,千里智驾已同步开放论文、代码、模型权重及评测流程,希望为世界—动作模型在自动驾驶领域的复现、比较与后续研究提供公开基线。

在看来,这条路线最大的价值,是它把“世界模型”从生成任务里拉回了决策任务。生成未来画面是一种很直观的演示方式,但它衡量的是模型“画得像不像”,而不是“开得对不对”。WA-JEPA 把预测目标收窄到道路结构、交通参与者关系与运动趋势,等于主动放弃可展示性,换来了与驾驶规划直接对接的表征。对一家要把模型装进车里的公司来说,这个取舍比分数本身更重要。

来源:速途网
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

相关推荐