Research KB 登录
PPR-2510.12796 DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous DrivingDriveVLA-W0:用世界建模(预测未来图像)为视觉-语言-动作模型提供稠密自监督信号,以弥补动作维度低、监督稀疏的“监督赤字”;分别实例化为离散 token 的自回归世界模型与连续特征上的扩散世界模型,并加轻量动作专家以满足实时推理;NAVSIM v1/v2 与 680× 内部数据集上验证。 Paper extracted n/a
PPR-2512.10226 Latent Chain-of-Thought World Modeling for End-to-End DrivingLCDrive:把链式思维(CoT)表达在动作对齐的潜空间而非自然语言——推理时交替产生动作提案 token(与输出动作同词表)与世界模型 token(由潜世界模型接地、表达这些动作的未来后果);先用真值未来 rollout 冷启动监督,再后训练。 Paper extracted n/a
PPR-2601.22032 Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End DrivingDrive-JEPA:把视频联合嵌入预测架构(V-JEPA)适配到端到端驾驶——在大规模驾驶视频上预训练 ViT 编码器以产出与轨迹规划对齐的预测表示;再用候选中心规划器蒸馏模拟器生成的多样轨迹与人类轨迹,并配动量感知选择机制促进稳定安全行为。 Paper extracted n/a
PPR-2603.14482 V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised LearningV-JEPA 2.1:在图像与视频上同时学稠密、高质量视觉表示并保留全局场景理解——用遮蔽式稠密预测损失(可见与遮蔽 token 都进训练信号)促进显式时空接地,用深层自监督在多层编码器上分层施加目标,用多模 tokenizer 统一图像与视频训练,并随容量与数据扩展。 Paper extracted n/a
PPR-2605.09701 DriveFuture: Future-Aware Latent World Models for Autonomous DrivingDriveFuture:让当前潜状态建模过程以未来世界状态为条件——训练时先由当前潜状态与 ego 动作预测未来潜世界状态,再用真值未来潜做交叉注意力精化,所得未来感知潜作为扩散轨迹规划器的显式条件;推理时条件换成预测的未来潜。 Paper extracted n/a
PPR-2605.19771 Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard NegativesBeyondDrive:面向失败感知的模仿学习——论证“几何接近即行为安全”的隐含假设造成目标错配:模仿损失几乎相同的轨迹安全结果可能截然不同(一条可恢复、一条碰撞)。用流匹配式负轨迹生成器合成安全关键但贴近专家的轨迹以显式建模安全不对称,配多样性感知采样策略。 Paper extracted n/a
PPR-2605.31476 IDOL: Inverse-Dynamics-Guided Future Prediction for End-to-End Autonomous DrivingIDOL:在 BEV 潜空间做世界模型规划,用逆动力学作为未来预测与轨迹优化之间的桥——先由 BEV 世界模型预测多个未来潜场景状态,再用逆动力学模型从相邻潜状态解码运动含义,以把描述性的未来推理转成可执行的运动更新,弥合“预测了未来但规划未受益”的缺口。 Paper extracted n/a
PPR-2607.29031 Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous DrivingAuto-JEPA:主张规划不必重建完整未来世界,只需关注影响未来 ego 动作的场景特征——用联合嵌入预测学习连续未来驾驶意图嵌入,再用该意图从固定轨迹记忆中检索可执行轨迹并由场景条件选择模块排序;视觉编码器冻结、无感知标注、无学习式轨迹生成器;NAVSIM v1 91.3 PDMS、v2 89.1 EPDMS。 Paper extracted n/a
PPR-2507.00603 World4Drive: End-to-End Autonomous Driving via Intention-Aware Physical Latent World ModelWorld4Drive:用视觉基础模型构建潜在世界模型,在无感知标注下生成并评估多模规划轨迹——先抽取驾驶意图与含空间语义先验的世界潜表示,再据意图预测多个意图驱动的未来潜状态,最后用世界模型选择器评估并选出最优轨迹。 Paper extracted n/a
PPR-2312.03031 Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving?BEV-Planner:诊断 nuScenes 开环端到端评估的两个问题——场景相对简单导致模型过度依赖 ego 状态(速度等)而少用感知信息;现有指标不足以评估规划质量。提出评估轨迹是否沿道路行驶的新指标,并给出一个竞争力强的简单基线。 Paper extracted n/a