解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换
详细介绍

图 1:WAM-Diff2 的多任务性能、解码效率与长时域规划结果总览。
视觉 – 语言 – 动作(VLA)模型已成为端到端自动驾驶的主流技术路线,但基于自回归(AR)解码的现有架构面临双重结构性瓶颈:其一,逐 Token 串行生成导致推理延迟随序列长度线性增长,严重制约实时部署;其二,训练阶段依赖真实前缀的 teacher forcing 机制,使模型在推理时暴露于自身生成的误差之上,引发长时序累积的曝光偏差(exposure bias)。
VLA 模型将自然语言回答、目标定位与未来轨迹统一为 Token 序列,使单一网络能够同时承担驾驶场景理解、视觉感知与运动规划,已成为端到端自动驾驶的重要技术路线。然而,主流驾驶通用模型大多构建于自回归视觉 – 语言模型之上,存在两方面结构性局限。
2.1 Block-Causal 注意力:连接顺序生成与并行生成的连续桥梁
图 2:WAM-Diff2 整体架构与三级 AR-to-Diffusion 层次化蒸馏流程。
图 3:三级蒸馏、蒸馏损失、Token 重合率与教师范式的消融结果。
在统一多任务模型下,Block-32 的标准实现达到 124.8 Tokens/s,较自回归基线的 44.5 Tokens/s 提升 2.8 倍。在此基础上,团队针对 Block-Causal 注意力模式定制 FlashInfer 计算内核,通过提升共享内存吞吐进一步加速 1.7 倍;进而利用 CUDA Graphs 封装固定去噪步数的执行图,消除 CPU 逐算子发射开销,再加速 3.1 倍。
图 4:不同去噪步数下的性能变化,以及多基准上的速度与精度 Pareto 曲线。
WAM-Diff2 在 DriveBench、LingoQA、COCO、NAVSIM 与 Bench2Drive 五个基准上接受评估。在统一多任务协议下,全部结果来自同一冻结检查点:2B、Block-32 模型取得 48.80 DriveBench、65.80 LingoQA、36.30 COCO mAP、87.44 NAVSIM-v1 PDMS 与 87.50 NAVSIM-v2 EPDMS,同时将标准解码吞吐由 44.5 提升至 124.8 Tokens/s。上述结果表明,模型以可控的性能代价换取显著的并行收益,并未退化为仅会规划的专用网络。
表 1:统一多任务模型在理解、感知、规划与解码效率上的综合结果。
表 2:WAM-Diff2 在 NAVSIM-v1/v2 上的任务专用规划结果。
表 3:WAM-Diff2 在 Bench2Drive 闭环评测与多能力测试中的结果。
图 5:WAM-Diff2 在驾驶理解与视觉感知任务上的定性可视化结果。
图 6:WAM-Diff2 在 Bench2Drive 上的典型失败案例。
图 7:自回归基线与 WAM-Diff2 的逐轨迹点 L2 误差及误差降幅。
WAM-Diff2 展示了一条区别于从头训练扩散模型的技术路线:先依托成熟自回归 VLA 获得理解、感知与规划能力,再借助 Block-Causal 注意力与三级层次化蒸馏,将上述能力平滑迁移至可并行执行的离散扩散架构。在实现最高 15.1 倍解码加速的同时,模型完整保留了自回归基线的多任务性能,并在长时域规划中展现出更强的误差抑制能力。
