RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement LearningRAD:用 3D 高斯泼溅构建真实物理世界的照片级数字副本,让端到端驾驶策略在其中大规模试错学习、覆盖分布外场景;设计专门奖励引导策略响应安全关键事件并理解因果,并把模仿学习作为正则项纳入 RL 训练;报告相比模仿式方法碰撞率低约 3 倍,并给出未见 3DGS 环境的闭环评测基准。
End-to-End Driving with Online Trajectory Evaluation via BEV World ModelWoTE:把 BEV 世界模型用于在线轨迹评估——在世界模型中推演各候选轨迹的未来 BEV 状态并据此评估轨迹,使规划在选择阶段直接使用预测后果;作者群与 LAW 重叠,是“未来潜进打分”的一支。
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-TuningAutoVLA:把推理与动作生成统一进单个自回归生成模型——从原始视觉与语言指令直接做语义推理与轨迹规划,把连续轨迹离散化为可行动作 token 以接入语言模型;用监督微调赋予快思考(仅轨迹)与慢思考(含推理)两模式,再用强化微调提升效率。
Epona: Autoregressive Diffusion World Model for Autonomous DrivingEpona:自回归扩散世界模型——用解耦的时空分解把时序动态建模与细粒度未来生成分离,用模块化的轨迹与视频预测把运动规划与视觉建模整合进端到端框架,从而支持变长、长时程预测并纳入轨迹规划;配链式前向训练缓解误差累积。