DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous DrivingDriveVLA-W0:用世界建模(预测未来图像)为视觉-语言-动作模型提供稠密自监督信号,以弥补动作维度低、监督稀疏的“监督赤字”;分别实例化为离散 token 的自回归世界模型与连续特征上的扩散世界模型,并加轻量动作专家以满足实时推理;NAVSIM v1/v2 与 680× 内部数据集上验证。
Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End DrivingDrive-JEPA:把视频联合嵌入预测架构(V-JEPA)适配到端到端驾驶——在大规模驾驶视频上预训练 ViT 编码器以产出与轨迹规划对齐的预测表示;再用候选中心规划器蒸馏模拟器生成的多样轨迹与人类轨迹,并配动量感知选择机制促进稳定安全行为。
V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised LearningV-JEPA 2.1:在图像与视频上同时学稠密、高质量视觉表示并保留全局场景理解——用遮蔽式稠密预测损失(可见与遮蔽 token 都进训练信号)促进显式时空接地,用深层自监督在多层编码器上分层施加目标,用多模 tokenizer 统一图像与视频训练,并随容量与数据扩展。
DriveFuture: Future-Aware Latent World Models for Autonomous DrivingDriveFuture:让当前潜状态建模过程以未来世界状态为条件——训练时先由当前潜状态与 ego 动作预测未来潜世界状态,再用真值未来潜做交叉注意力精化,所得未来感知潜作为扩散轨迹规划器的显式条件;推理时条件换成预测的未来潜。
Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard NegativesBeyondDrive:面向失败感知的模仿学习——论证“几何接近即行为安全”的隐含假设造成目标错配:模仿损失几乎相同的轨迹安全结果可能截然不同(一条可恢复、一条碰撞)。用流匹配式负轨迹生成器合成安全关键但贴近专家的轨迹以显式建模安全不对称,配多样性感知采样策略。
Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous DrivingAuto-JEPA:主张规划不必重建完整未来世界,只需关注影响未来 ego 动作的场景特征——用联合嵌入预测学习连续未来驾驶意图嵌入,再用该意图从固定轨迹记忆中检索可执行轨迹并由场景条件选择模块排序;视觉编码器冻结、无感知标注、无学习式轨迹生成器;NAVSIM v1 91.3 PDMS、v2 89.1 EPDMS。
World4Drive: End-to-End Autonomous Driving via Intention-Aware Physical Latent World ModelWorld4Drive:用视觉基础模型构建潜在世界模型,在无感知标注下生成并评估多模规划轨迹——先抽取驾驶意图与含空间语义先验的世界潜表示,再据意图预测多个意图驱动的未来潜状态,最后用世界模型选择器评估并选出最优轨迹。
Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving?BEV-Planner:诊断 nuScenes 开环端到端评估的两个问题——场景相对简单导致模型过度依赖 ego 状态(速度等)而少用感知信息;现有指标不足以评估规划质量。提出评估轨迹是否沿道路行驶的新指标,并给出一个竞争力强的简单基线。