| FRM-2405.17398 |
Vista 五层重建(骨架):核心对象是可泛化、高保真且动作可控的驾驶视频世界模型——第一阶段把 SVD 改造成预测模型(首帧作条件、弃用噪声增强),用“潜替换”注入最多三帧动态先验(位置/速度/加速度由三帧决定),并加动力学增强损失(按运动差异加权)与结构保持损失(频域高通)保细节;第二阶段以统一 Fourier 嵌入 + UNet 交叉注意力(零初始化投影 + LoRA)学四类异构动作控制(角度速度/轨迹/命令/目标点),并以模型自身预测不确定性作通用奖励。 |
Formalization
|
|
| FRM-2512.10226 |
Latent-CoT-Drive 五层重建(骨架):核心对象是把驾驶 VLA 的思维链从自然语言换到“动作对齐的潜语言”——推理轨迹由动作提案 token(与最终输出同一词表、每 10 步构成 1 秒块)与潜世界模型 token(同一 1 秒窗口的 ego 中心世界状态)交错组成,多分支(默认 2)展开成反事实未来并作为最终动作的条件;公理层含『自然语言不适合表达时空几何与多智能体交互』『文本链的生成延迟与动作—文本对齐弱』。 |
Formalization
|
|
| FRM-2605.31476 |
IDOL 五层重建(骨架):核心对象是以逆动力学为桥梁的潜 BEV 世界模型规划——先用候选条件的潜 BEV 世界模型滚出多条候选未来潜状态序列,再用逆动力学模型对相邻潜状态解码出“空间动力学图(变化发生在哪)”与“全局动力学特征(整体变什么)”,以双分支融合(空间交叉注意力 + MLN 校准)把想象出的转移转成规划相关的查询更新,并用重锚定防迭代漂移;公理层含『仅预测未来不足以保证更好规划,除非预测演化能转成可执行运动更新』与『纯池化逆动力学特征对规划过粗』。 |
Formalization
|
|
| FRM-2605.09701 |
DriveFuture 五层重建(骨架):核心主张是潜世界模型的关键不在于模拟未来状态、而在于以未来状态条件化当前决策——先由共享 BEV 编码器与轨迹编码器经可学未来查询预测“轨迹条件下的未来潜状态”,训练时用条件源随机化(真值/等加速度运动学代理/空 token)支撑推理期无真值轨迹与 CFG,再用单层交叉注意力把该预测潜与带 stop-gradient 的真实未来观测潜接地,最后以其显式条件化一个扩散轨迹规划器;公理层含『把未来潜当预测目标/辅助信号会使当前与未来特征在潜空间纠缠』。 |
Formalization
|
|
| FRM-2607.29031 |
Auto-JEPA 五层重建(骨架):核心对象是“只学影响未来自车动作的场景特征”的动作导向潜世界模型——冻结的 V-JEPA 2 视觉编码器 + 24 层 transformer 预测器把视觉、ego 运动史与导航命令压成 8 个连续潜 token(驾驶意图),训练时与冻结轨迹自编码器给出的真值轨迹潜表示做联合嵌入对齐,推理时以该意图为检索键从非参数轨迹记忆中取 300 条候选、经场景打分器排序与可行驶区门控过滤;公理层含『规划无需重建完整未来世界』与『预测目标与检索候选须同处一个潜空间』。 |
Formalization
|
|
| FRM-2601.22032 |
Drive-JEPA 五层重建(骨架):核心对象是把 V-JEPA 式潜预测预训练接到端到端驾驶,并用规则仿真器提供多模伪教师——先在 330 小时驾驶视频上自监督预训练 ViT 编码器,再由 learnable 查询的 transformer 解码器出提案,并以“词表(8192 聚类中心)+ NAVSIM v2 EPDM 离线评分筛出的多模高质量轨迹”作为伪教师替代单条人类轨迹监督,最后用带舒适项的 momentum-aware 打分选轨迹;公理层含『单场景仅一条人类轨迹难以学多模行为』与『像素空间世界模型贵、潜世界模型难扩展』。 |
Formalization
|
|
| FRM-2510.12796 |
DriveVLA-W0 五层重建(骨架):核心对象是把世界建模(预测未来图像)当作给 VLA 驾驶模型的密集自监督信号,以修补“监督赤字”——动作监督稀疏低维、令大容量 VLA 表示能力被闲置;该范式按 VLM 主干类型分别实例化为离散视觉 token 的自回归世界模型与连续视觉特征的扩散世界模型,另配轻量 MoE 动作专家(含 query-based / 自回归 / 流匹配三种解码方案)解决实时推理延迟。 |
Formalization
|
|
| FRM-2406.08481 |
LAW 五层重建(骨架):核心对象是一个可插入既有框架的潜世界模型自监督任务——把当前帧视觉潜表示与 ego waypoint 向量拼接经 MLP 构成动作感知潜表示,由 transformer 式潜世界模型预测下一帧的视觉潜表示,并以真实下一帧提取的潜表示做 MSE 监督,从而在无需人工标签的前提下优化场景特征与轨迹预测;公理层含『自监督表示学习在 NLP/CV 的成功可迁移到驾驶』与『未来帧潜表示可由当前潜表示与 ego 轨迹预测』。 |
Formalization
|
|
| FRM-2405.04390 |
DriveWorld 五层重建(骨架):核心对象是面向 4D 场景理解的驾驶世界模型预训练——记忆状态空间模型把沿时间传达的信息拆成时序感知的潜动态(动态记忆库:后验/先验状态分布匹配 + 运动感知层归一化)与空间感知的潜静态(静态场景传播:取某帧 BEV 特征作潜结构、不做形变对齐),以 3D/4D 占据预测为 pretext,并用 LLM 文本产生的任务提示解耦各下游任务的表示;公理层含『既有视觉预训练多为 2D/3D pretext 忽略时序』与『占据比深度/2D 重建给出更完备几何先验』。 |
Formalization
|
|
| FRM-2507.00603 |
World4Drive 五层重建(骨架):核心对象是免感知标注的意图感知物理潜世界模型——意图编码器把轨迹词表端点聚成 3 命令 × 6 意图,物理世界潜编码器用视觉基础模型(Grounded-SAM 伪语义 + 度量深度前向投影)注入空间语义先验,世界模型按各意图预测未来潜状态并由选择器以潜距离选模、ScoreNet 打分;训练全靠与真实未来观测的潜空间自监督对齐,公理层含『既有方法直接取相机特征作潜表示而缺空间语义理解』。 |
Formalization
|
|