GAIA-1: A Generative World Model for Autonomous DrivingGAIA-1:用视频、文本与动作输入生成真实感驾驶场景,并对 ego 行为与场景特征提供细粒度控制——把世界建模表述为无监督序列建模,把输入映射为离散 token 并做下一 token 预测;报告涌现出高层结构/场景动态、上下文意识、泛化与几何理解。
CAT: Closed-loop Adversarial Training for Safe End-to-End DrivingCAT:不靠策略层算法设计,而从环境增强入手做闭环对抗训练——用新重采样技术把日志重放的现实驾驶场景经概率分解转为安全关键场景(对抗交通生成建模为标准运动预测子问题的乘积),以此持续提升驾驶智能体安全性并显著降低迭代训练计算成本。
OccWorld: Learning a 3D Occupancy World Model for Autonomous DrivingOccWorld:在 3D 占用空间学世界模型,同时预测 ego 运动与周边场景演化——在 3D 占用上训练基于重建的场景 tokenizer 得离散场景 token,再用 GPT 式时空生成 transformer 生成后续场景与 ego token;理由是占用比 3D 框/分割更细粒度、更易获得、且对视觉与 LiDAR 都通用。
Driving Into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous DrivingDrive-WM:用视图分解做联合时空建模,生成高保真多视角驾驶视频;据生成能力首次展示把世界模型用于安全规划——可基于不同驾驶机动推演多个未来,并按图像式奖励确定最优轨迹。
DriveWorld: 4D Pre-Trained Scene Understanding via World Models for Autonomous DrivingDriveWorld:用世界模型对多相机驾驶视频做时空 4D 预训练——记忆状态空间模型含动态记忆库(学时序潜动态以预测未来变化)与静态场景传播(学空间潜静态以提供场景上下文),并用任务提示解耦下游任务特征。
Vista: A Generalizable Driving World Model with High Fidelity and Versatile ControllabilityVista:面向可泛化、高保真、可控的驾驶世界模型——用两种新损失促进运动实例与结构信息学习,用潜替换注入历史帧先验以支持长时一致 rollout,并把高层意图(命令、目标点)到低层机动(轨迹、角度、速度)的多类控制经高效学习策略纳入;大规模训练后在未见环境泛化与下游规划上验证。