Research KB 登录
PPR-2409.00588 Diffusion Policy Policy OptimizationDPPO:用策略梯度对扩散式策略(如 Diffusion Policy)做微调的方法框架与最佳实践,证明其在常见连续控制基准上比面向扩散策略的其他 RL 方法与对策略参数化的 PG 微调更强、更高效,并给出“结构化且在流形上探索、训练稳定、策略稳健”等机制解释。 Paper extracted n/a
PPR-2412.18607 DrivingGPT: Unifying Driving World Modeling and Planning with Multi-Modal Autoregressive TransformersDrivingGPT:基于交错的图像与动作 token 构造多模驾驶语言,用标准下一 token 预测同时学世界建模与规划;在 VQ token 空间首次同时展示动作条件视频生成与端到端规划,并在 nuPlan 与 NAVSIM 上超过强基线。 Paper extracted n/a
PPR-2502.13144 RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement LearningRAD:用 3D 高斯泼溅构建真实物理世界的照片级数字副本,让端到端驾驶策略在其中大规模试错学习、覆盖分布外场景;设计专门奖励引导策略响应安全关键事件并理解因果,并把模仿学习作为正则项纳入 RL 训练;报告相比模仿式方法碰撞率低约 3 倍,并给出未见 3DGS 环境的闭环评测基准。 Paper extracted n/a
PPR-2504.01941 End-to-End Driving with Online Trajectory Evaluation via BEV World ModelWoTE:把 BEV 世界模型用于在线轨迹评估——在世界模型中推演各候选轨迹的未来 BEV 状态并据此评估轨迹,使规划在选择阶段直接使用预测后果;作者群与 LAW 重叠,是“未来潜进打分”的一支。 Paper extracted n/a
PPR-2506.08052 ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous DrivingReCogDrive:把 VLM 的驾驶认知与扩散规划器结合——用模仿人类驾驶认知顺序(生成/精化/质控三阶段)的分层数据流水线注入驾驶先验,并把 VLM 学得的先验注入扩散规划器以生成连续可行轨迹,避免把物理动作放在语言空间输出导致的格式违规、不可行与慢推理。 Paper extracted n/a
PPR-2506.09985 V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and PlanningV-JEPA 2:先在百万小时级互联网视频上预训练无动作的联合嵌入预测架构,获得运动理解与人类动作预期能力;再用少量机器人交互轨迹做动作条件后训练,在物理世界做理解、预测与规划,是驾驶 JEPA 系(Drive-JEPA、DA-WAM 等)的骨干来源。 Paper extracted n/a
PPR-2506.13757 AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-TuningAutoVLA:把推理与动作生成统一进单个自回归生成模型——从原始视觉与语言指令直接做语义推理与轨迹规划,把连续轨迹离散化为可行动作 token 以接入语言模型;用监督微调赋予快思考(仅轨迹)与慢思考(含推理)两模式,再用强化微调提升效率。 Paper extracted n/a
PPR-2506.24113 Epona: Autoregressive Diffusion World Model for Autonomous DrivingEpona:自回归扩散世界模型——用解耦的时空分解把时序动态建模与细粒度未来生成分离,用模块化的轨迹与视频预测把运动规划与视觉建模整合进端到端框架,从而支持变长、长时程预测并纳入轨迹规划;配链式前向训练缓解误差累积。 Paper extracted n/a
PPR-2507.04049 DIVER: Reinforced Diffusion Breaks Imitation Bottlenecks in End-to-End Autonomous DrivingDIVER:把扩散式多模轨迹生成与强化学习结合——以地图元素与周围智能体为条件从每条真值参考轨迹生成多条参考轨迹以突破单模模仿限制,并把扩散过程视为随机策略用 GRPO 目标优化轨迹级多样性/安全奖励,直接缓解模式坍缩、提升避撞并鼓励超越专家的探索。 Paper extracted n/a
PPR-2510.08562 ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous DrivingResAD:不直接预测未来轨迹,而预测相对确定性惯性参考的残差偏移——惯性参考作为强物理先验,迫使模型把容量集中在学“必要且由上下文驱动的偏离”(交通规则、障碍),并缓解轨迹数据时空不平衡导致的优化负担与远距预测被过度优先的问题。 Paper extracted n/a