| FRM-2510.04333 | RAP 五层重建(骨架):核心对象是“训练端到端规划器不需要光真实”这一主张及其实现——用轻量 3D 栅格化(对标注图元做栅格化)替代昂贵的光真实渲染,构造反事实恢复机动与跨智能体视角合成等增强,并用 Raster-to-Real 特征空间对齐弥合 sim-to-real 差距;公理层含『模仿学习缺恢复数据,闭环下小错误不可纠正并累积』与『驾驶依赖几何与动力学而非纹理光照』。 | Formalization |
| FRM-2601.05083 | Driving on Registers 五层重建(骨架):核心对象是极简纯 transformer 的端到端驾驶架构——以“相机感知的 register token”(每相机 R 个 register、得 N×R 个场景 token)把多相机特征压成紧凑场景表示、仅用 LoRA 微调预训练 ViT,再由两个轻量 transformer 解码器先生成候选轨迹、再模仿 oracle 打可解释子分数(安全/舒适/效率),从而支持推理期的行为条件驾驶。 | Formalization |
| FRM-2605.19771 | BeyondDrive 五层重建(骨架):核心对象是让模仿学习显式吸收失败——提出“安全不对称”性质(模仿误差几乎相同的两条轨迹安全性可截然不同,一条可恢复、一条致碰撞),故用流匹配的负轨迹生成器合成“安全关键但贴近专家”的硬负样本、以多样性感知采样提高失败模式覆盖,再用排斥距离损失同时吸引预测靠近专家并推离硬负样本,从而在轨迹空间建立可判别的安全边界。 | Formalization |
| FRM-2504.01941 | WoTE 五层重建(骨架):核心对象是把 BEV 世界模型用于在线轨迹评估——轨迹预测器(TransFuser 式多模态 BEV 编码 + K-Means 轨迹锚 + 精化)给出多条候选,BEV 世界模型据各候选预测未来 BEV 状态,奖励模型再用未来状态为每条轨迹打分、取最高者为最终输出;选择 BEV 级(而非图像级)世界模型是为了延迟更低,且可直接用现成 BEV 空间交通仿真器监督。 | Formalization |
| FRM-2506.13757 | AutoVLA 五层重建(骨架):核心对象是把推理与动作生成统一在单一自回归模型里的驾驶 VLA——把连续轨迹经 K-disk 聚类离散成 2048 个“物理可行”动作 token 直接并入语言词表,用监督微调赋予快思考(仅输出轨迹)与慢思考(CoT 增强)双模式,再以 GRPO 强化微调削掉直白场景中不必要的推理;公理层含『VLA 常见病是物理不可行动作、结构复杂与推理冗长』。 | Formalization |
| FRM-2603.14482 | V-JEPA 2.1 五层重建(骨架):这是 V-JEPA 系列训练配方的改进而非驾驶方法——针对 V-JEPA 2 在需要像素级理解的稠密任务上的严重不足,改用“稠密预测损失”(可见上下文与掩蔽 token 全部参与损失、显式强制时空接地)+“深层自监督”(在多个中间编码器层分层施加自监督目标)+“多模态 tokenizer”(统一图文与视频训练)+ 模型与数据缩放四项要素,在分割/深度/短期动作预判等稠密任务上达最优、同时保持全局视频理解。 | Formalization |
| FRM-2506.09985 | V-JEPA 2 五层重建(骨架):这是 FAIR 的通用世界模型工作而非驾驶方法——先在逾 100 万小时互联网视频上做“无动作”联合嵌入预测预训练(得到强运动理解与人类动作预判),再把其与语言模型对齐以做视频问答,最后用不足 62 小时无标注机器人视频后训练出潜动作条件世界模型 V-JEPA 2-AC,并在两个实验室的 Franka 机械臂上零样本做图像目标规划;库内引用它的价值在于它是 Drive-JEPA / Auto-JEPA 的预训练权重来源。 | Formalization |
| FRM-2502.13144 | RAD 五层重建(骨架):核心对象是以 3DGS 构建光真实数字副本、在其上做闭环强化学习的端到端驾驶框架——策略通过大规模试错探索状态空间、学习分布外场景;奖励由动态碰撞、静态碰撞、位置偏离与朝向偏离四项构成(任一触发即终止 episode,因事后 3DGS 渲染的传感数据含噪);训练分感知预训练、规划预训练(IL 初始化以防 RL 冷启动不稳)与强化后训练(RL 引导安全、IL 作正则贴合人类)三阶段。 | Formalization |
| FRM-2310.12432 | CAT 五层重建(骨架):核心对象是以环境增强视角做安全端到端驾驶的闭环对抗训练——用贝叶斯因式化把“场景为安全关键”的联合分布拆成“交通先验 × ego 估计 × 碰撞似然”三项(前提是 ego 反应单向依赖未来交通流),从而把对抗交通生成归结为标准运动预测子问题的乘积,使物理攻击更可行、迭代学习管线算力成本显著更低;公理层含『仅用真实数据集检索的场景不足以训练/评测,因事故易发事件极罕见』。 | Formalization |
| FRM-2404.07762 | NeuroNCAP 五层重建(骨架):核心对象是以 Euro NCAP 为蓝本的安全关键场景闭环评测——用从真实驾驶传感序列学习的神经(NeRF 式)仿真器重构可配置的新场景,按目标 actor 行为分 stationary/frontal/side 三类,把 ego 与目标 actor 初始化到“若维持当前速度与转向约 4 秒后碰撞”,每场景随机抖动后跑 100 次;结果显示 UniAD/VAD 在开环名义场景表现良好,却在闭环安全关键场景下碰撞率高达 98–99%,暴露规划与辅助输出不一致这一设计缺陷。 | Formalization |
| FRM-2308.01898 | UniSim 五层重建(骨架):核心对象是把单条记录日志转成高保真闭环多传感器仿真的神经传感仿真器——用神经特征网格分别重建静态背景与动态 actors 并合成为新视点下的 LiDAR 与相机数据,支持增删 actor 与改变其摆放,并以动态对象的可学习先验与卷积网络补全外推视图中未见区域;公理层含『准确评估需在闭环中测试』与『闭环须依新场景配置与自车决策改写传感数据』。 | Formalization |
| FRM-2408.00415 | DriveArena 五层重建(骨架):核心对象是首个面向真实场景驾驶智能体的高保真闭环仿真系统——模块化的 TrafficManager(基于 LimSim 的多车分层决策与规划、协作因子与轨迹权重集,支持 OpenStreetMap 任意城市路网,ego 可开环或闭环受控)与基于扩散的 Dreamer(条件编码含地图/物体布局、文本、相机参数、ego 位姿与参考图,用跨视图注意力保多视图一致、用图像自回归保时序一致并支持无限流式生成)循环耦合,使只处理真实图像的智能体可在其中闭环导航。 | Formalization |
| FRM-2409.00588 | DPPO 五层重建(骨架):核心对象是“用策略梯度微调扩散策略”的算法框架与最佳实践——把去噪过程视为多步 MDP 并嵌入环境 MDP,构成一个更大的“扩散策略 MDP”,使每步策略似然成为可解析求值的 Gaussian 似然,从而可直接套用任意策略梯度方法(并以 PPO 实例化);论文报告 RL 微调与扩散参数化之间存在协同,带来结构化、on-manifold 的探索、稳定训练与策略鲁棒性。 | Formalization |
| FRM-2510.08562 | ResAD 五层重建(骨架):核心对象是把轨迹预测任务重构为“相对确定性惯性参考的残差预测”——用恒速模型给出物理先验基线,令模型容量集中在交通规则、障碍等情境驱动的偏离上,并以逐点残差归一化(PRNorm)抑制远距不确定 waypoint 的大幅误差主导学习信号;多模性则通过对初始速度施加零均值高斯扰动、经恒速模型传播出 K 条惯性参考簇来获得(同时增强对 GPS/IMU 噪声的鲁棒性)。 | Formalization |
| FRM-2507.04049 | DIVER 五层重建(骨架):核心对象是以强化学习引导扩散生成多模轨迹的框架——策略感知扩散生成器(PADG)以地图元素与周围智能体为条件、由单一真值轨迹与轨迹锚引导生成“多个参考真值”以覆盖不同驾驶风格,再把扩散过程当作随机策略用 GRPO 目标的轨迹级多样性/安全奖励去引导,以破解模仿学习固有的模式坍缩;并针对 L2 类开环指标无法刻画多样性提出多样性度量。 | Formalization |
| FRM-2506.08052 | ReCogDrive 五层重建(骨架):核心对象是把 VLM 的驾驶认知先验与扩散规划器耦合、并以扩散版 GRPO 做安全后训练的三阶段框架——先用“生成/精炼/质控”三级流水线造出模仿人类认知顺序的驾驶 QA 数据训练 VLM,再把其认知 token 注入扩散规划器生成连续稳定轨迹,最后用 DiffGRPO 以 NAVSIM 仿真器的 PDMS 作奖励做强化;公理层含『把规划当语言建模会产出违格式/不可行动作且推理慢』与『多模专家演示下纯模仿会学出平均轨迹』。 | Formalization |
| FRM-2506.24113 | Epona 五层重建(骨架):核心对象是把驾驶世界建模重构为“时间域上的顺序未来预测”的自回归扩散世界模型——既不像视频扩散那样对固定长度帧序列做全局联合分布建模(破坏因果时序),也不像 token 式自回归那样逐 token 预测(弱化空间相关并扭曲高频),而是分离出策略 π(TrajDiT 预测轨迹)与整帧条件分布 p(VisDiT 生成下一帧),由多模态时空 transformer 编码历史,并用 chain-of-forward 训练抑制自回归误差累积;世界模型因此可同时充当实时运动规划器。 | Formalization |
| FRM-2412.18607 | DrivingGPT 五层重建(骨架):核心对象是把驾驶仿真与轨迹规划统一为单一序列建模问题——用 VQ-VAE 把前视图像压成图像 token、把“帧间相对”轨迹分量按分位数裁剪后分箱成动作 token,交错成一种多模态驾驶语言(统一词表大小 D+3M),由自回归 transformer 以标准 next-token 预测同时承载世界建模与端到端策略两个子任务;公理层含『因果式长动作视界会让模型复制历史动作而非基于观测驾驶』与『视频扩散世界模型缺乏纳入动作模态的灵活性』。 | Formalization |
| FRM-2311.17918 | Drive-WM 五层重建(骨架):核心对象是首个与既有端到端规划器兼容的多视图驾驶世界模型——以“视图因式化”的联合时空建模在图像扩散模型上挂时序层与多视图层(冻结图像权重、只微调新增层)生成一致的多视图视频,并把它用于规划:规划器从真实多视图图采候选轨迹,按动作条件生成各候选的未来视频,用基于生成视频感知结果的图像奖励(地图奖励 × 物体奖励)选最优轨迹并迭代成树式 rollout。 | Formalization |
| FRM-2311.16038 | OccWorld 五层重建(骨架):核心对象是在 3D 占据空间里做世界建模——以 VQ-VAE 式自监督场景 tokenizer 把 3D 占据压成离散高层 token(BEV 化 + 类别嵌入 + 码本),再以 GPT 式但“一次预测一组 token”的空间-时序生成 transformer(空间自注意力 + 2×2 窗口层次化下采样 K 次 + 各尺度子世界模型)同时生成未来占据与 ego 轨迹;公理层含『物体框预测无法捕捉更细粒度场景信息』与『占据只给低层级理解、需自监督 token 化』。 | Formalization |
| FRM-2309.17080 | GAIA-1 五层重建(骨架):核心对象是把驾驶世界建模铸成无监督序列建模的生成式世界模型——视频、文本、动作分别编码为离散/连续 token(图像每帧 576 token,文本来自 T5-large,动作仅速度与曲率两个标量),按“文本—图像—动作”交错成一个序列,用自回归 transformer 预测下一个图像 token,再由单独训练的视频解码器还原到像素空间;公理层含『压缩应朝向语义而非高频』与『预测自车动作的多种未来结果是安全导航的关键问题』。 | Formalization |
| FRM-2405.17398 | Vista 五层重建(骨架):核心对象是可泛化、高保真且动作可控的驾驶视频世界模型——第一阶段把 SVD 改造成预测模型(首帧作条件、弃用噪声增强),用“潜替换”注入最多三帧动态先验(位置/速度/加速度由三帧决定),并加动力学增强损失(按运动差异加权)与结构保持损失(频域高通)保细节;第二阶段以统一 Fourier 嵌入 + UNet 交叉注意力(零初始化投影 + LoRA)学四类异构动作控制(角度速度/轨迹/命令/目标点),并以模型自身预测不确定性作通用奖励。 | Formalization |
| FRM-2512.10226 | Latent-CoT-Drive 五层重建(骨架):核心对象是把驾驶 VLA 的思维链从自然语言换到“动作对齐的潜语言”——推理轨迹由动作提案 token(与最终输出同一词表、每 10 步构成 1 秒块)与潜世界模型 token(同一 1 秒窗口的 ego 中心世界状态)交错组成,多分支(默认 2)展开成反事实未来并作为最终动作的条件;公理层含『自然语言不适合表达时空几何与多智能体交互』『文本链的生成延迟与动作—文本对齐弱』。 | Formalization |
| FRM-2605.31476 | IDOL 五层重建(骨架):核心对象是以逆动力学为桥梁的潜 BEV 世界模型规划——先用候选条件的潜 BEV 世界模型滚出多条候选未来潜状态序列,再用逆动力学模型对相邻潜状态解码出“空间动力学图(变化发生在哪)”与“全局动力学特征(整体变什么)”,以双分支融合(空间交叉注意力 + MLN 校准)把想象出的转移转成规划相关的查询更新,并用重锚定防迭代漂移;公理层含『仅预测未来不足以保证更好规划,除非预测演化能转成可执行运动更新』与『纯池化逆动力学特征对规划过粗』。 | Formalization |
| FRM-2605.09701 | DriveFuture 五层重建(骨架):核心主张是潜世界模型的关键不在于模拟未来状态、而在于以未来状态条件化当前决策——先由共享 BEV 编码器与轨迹编码器经可学未来查询预测“轨迹条件下的未来潜状态”,训练时用条件源随机化(真值/等加速度运动学代理/空 token)支撑推理期无真值轨迹与 CFG,再用单层交叉注意力把该预测潜与带 stop-gradient 的真实未来观测潜接地,最后以其显式条件化一个扩散轨迹规划器;公理层含『把未来潜当预测目标/辅助信号会使当前与未来特征在潜空间纠缠』。 | Formalization |
| FRM-2607.29031 | Auto-JEPA 五层重建(骨架):核心对象是“只学影响未来自车动作的场景特征”的动作导向潜世界模型——冻结的 V-JEPA 2 视觉编码器 + 24 层 transformer 预测器把视觉、ego 运动史与导航命令压成 8 个连续潜 token(驾驶意图),训练时与冻结轨迹自编码器给出的真值轨迹潜表示做联合嵌入对齐,推理时以该意图为检索键从非参数轨迹记忆中取 300 条候选、经场景打分器排序与可行驶区门控过滤;公理层含『规划无需重建完整未来世界』与『预测目标与检索候选须同处一个潜空间』。 | Formalization |
| FRM-2601.22032 | Drive-JEPA 五层重建(骨架):核心对象是把 V-JEPA 式潜预测预训练接到端到端驾驶,并用规则仿真器提供多模伪教师——先在 330 小时驾驶视频上自监督预训练 ViT 编码器,再由 learnable 查询的 transformer 解码器出提案,并以“词表(8192 聚类中心)+ NAVSIM v2 EPDM 离线评分筛出的多模高质量轨迹”作为伪教师替代单条人类轨迹监督,最后用带舒适项的 momentum-aware 打分选轨迹;公理层含『单场景仅一条人类轨迹难以学多模行为』与『像素空间世界模型贵、潜世界模型难扩展』。 | Formalization |
| FRM-2510.12796 | DriveVLA-W0 五层重建(骨架):核心对象是把世界建模(预测未来图像)当作给 VLA 驾驶模型的密集自监督信号,以修补“监督赤字”——动作监督稀疏低维、令大容量 VLA 表示能力被闲置;该范式按 VLM 主干类型分别实例化为离散视觉 token 的自回归世界模型与连续视觉特征的扩散世界模型,另配轻量 MoE 动作专家(含 query-based / 自回归 / 流匹配三种解码方案)解决实时推理延迟。 | Formalization |
| FRM-2406.08481 | LAW 五层重建(骨架):核心对象是一个可插入既有框架的潜世界模型自监督任务——把当前帧视觉潜表示与 ego waypoint 向量拼接经 MLP 构成动作感知潜表示,由 transformer 式潜世界模型预测下一帧的视觉潜表示,并以真实下一帧提取的潜表示做 MSE 监督,从而在无需人工标签的前提下优化场景特征与轨迹预测;公理层含『自监督表示学习在 NLP/CV 的成功可迁移到驾驶』与『未来帧潜表示可由当前潜表示与 ego 轨迹预测』。 | Formalization |
| FRM-2405.04390 | DriveWorld 五层重建(骨架):核心对象是面向 4D 场景理解的驾驶世界模型预训练——记忆状态空间模型把沿时间传达的信息拆成时序感知的潜动态(动态记忆库:后验/先验状态分布匹配 + 运动感知层归一化)与空间感知的潜静态(静态场景传播:取某帧 BEV 特征作潜结构、不做形变对齐),以 3D/4D 占据预测为 pretext,并用 LLM 文本产生的任务提示解耦各下游任务的表示;公理层含『既有视觉预训练多为 2D/3D pretext 忽略时序』与『占据比深度/2D 重建给出更完备几何先验』。 | Formalization |
| FRM-2507.00603 | World4Drive 五层重建(骨架):核心对象是免感知标注的意图感知物理潜世界模型——意图编码器把轨迹词表端点聚成 3 命令 × 6 意图,物理世界潜编码器用视觉基础模型(Grounded-SAM 伪语义 + 度量深度前向投影)注入空间语义先验,世界模型按各意图预测未来潜状态并由选择器以潜距离选模、ScoreNet 打分;训练全靠与真实未来观测的潜空间自监督对齐,公理层含『既有方法直接取相机特征作潜表示而缺空间语义理解』。 | Formalization |
| FRM-2507.17596 | PRIX 五层重建(骨架):核心对象是仅用相机的端到端规划——ResNet 骨干配可跨尺度共享权重自注意力的上下文重标定 Transformer(CaRT)产出多尺度特征,再以 Token Memory 与 Planner Grid 两种学习表示(后者不是几何 BEV,仅靠语义与轨迹损失锚定到 ego 帧、不使用相机内外参)条件化一个带锚点的两步扩散规划头,输出 8 个 waypoint;公理层含『部署受模型规模、LiDAR 与密集 BEV 阻碍』与『固定相机装置下几何可被参数吸收』。 | Formalization |
| FRM-2505.09315 | TransDiffuser 五层重建(骨架):核心对象是在不用任何轨迹锚点或场景先验的前提下解决扩散式规划的模式坍缩——把场景编码器(冻结的 Transfuser 骨干)与动作/ego 状态嵌入作为多模态条件输入去噪解码器,并在去噪过程中加批级多模态表示去相关正则(惩罚表示相关矩阵的非对角项、逼近对角形);公理层含『既有扩散规划器靠预定义词表或场景先验缓解坍缩,而这些归纳偏置在部署中不可得』与『规划性能取决于多模态表示质量』。 | Formalization |
| FRM-2312.03031 | “Is Ego Status All You Need”五层重建(骨架):这是诊断性而非提出式论文——核心对象是指出 nuScenes 开环端到端规划的三大问题(含 ego 状态的模型被 ego 状态主导、感知信息被闲置;L2 与碰撞率不足以刻画规划质量;开环中其他智能体不响应 ego 使碰撞度量有偏且忽略 yaw),并据此给出极简基线 BEV-Planner(仅 BEV + ego 查询交叉注意 + L1,不用任何感知标注)与基于地图先验的新指标 CCR(路缘碰撞率)。 | Formalization |
| FRM-2408.03601 | DRAMA 五层重建(骨架):核心对象是把 Mamba(状态空间模型)引入端到端运动规划——编码器用多尺度卷积与四个 Mamba 融合模块替代 Transformer 自注意力来融合相机与 LiDAR BEV 特征(训练复杂度由 T²D 降为 TD²),解码器用可学的 Mamba-Transformer 层输出确定性轨迹,并以差异化 dropout 率作用的特征状态丢弃(FSD)缓解传感噪声与 ego 状态缺失;公理层含『自注意力对序列长度二次复杂』与『传感/导航输入本就不完美』。 | Formalization |
| FRM-2503.07656 | DriveTransformer 五层重建(骨架):核心对象是把端到端驾驶压成三种统一注意力算子的纯 transformer 框架——sensor cross attention 让任务查询直接取原始传感特征(3D 位置编码、不建 BEV)、task self-attention 让 agent/map/ego 查询在每层直接互交(任务并行、无手工顺序)、temporal cross attention 以各任务的 FIFO 查询队列注入历史(流式、含 ego 坐标变换补偿);公理层含『串行感知-预测-规划导致累积误差与训练不稳』与『手工任务顺序限制协同』。 | Formalization |
| FRM-2402.11502 | GenAD 五层重建(骨架):核心对象是把端到端驾驶重铸为生成建模——先用实例中心场景 tokenizer 把周围场景变成含地图语义的实例 token,再用 VAE 在结构化潜空间学未来轨迹先验,并让 GRU 在潜空间里推进时间演化、由 MLP 逐点解出 waypoint;因运动预测与规划共享输出空间,二者用同一套潜空间与生成器完成;公理层含『渐进式流水线无法全面建模交通演化过程』与『轨迹高度结构化、存在可学先验』。 | Formalization |
| FRM-2212.10156 | UniAD 五层重建(骨架):核心对象是规划导向的模块化流水线——TrackFormer(检测 + 多目标跟踪,含显式 ego 查询)、MapFormer(地图全景分割)、MotionFormer(场景中心的多模联合预测,含 agent/场景锚与目标点交互)、OccFormer(保留实例身份的占用预测)四模块以统一 query 串联,Planner 以命令嵌入条件化 ego 查询输出轨迹,并在推理期用牛顿法按占用图避碰优化;公理层含『框架应面向规划这一终极目标设计』与『端到端下不可假设真值感知』。 | Formalization |
| FRM-2303.12077 | VAD 五层重建(骨架):核心对象是全向量化的场景表示与规划约束——以地图向量(车道线/道路边界/人行横道)与多模智能体运动向量取代稠密栅格化表示,ego 查询依次与智能体、地图查询交互后由规划头加驾驶命令输出轨迹,训练期再用碰撞、越界与车道方向三条实例级向量约束正则规划;公理层含『稠密栅格计算密集且缺实例级结构』与『向量化实例可作显式规划约束』。 | Formalization |
| FRM-2205.15997 | TransFuser 五层重建(骨架):核心对象是用自注意力做多模态融合的模仿学习驾驶架构——在多个分辨率上用 transformer 模块融合透视视图图像与 LiDAR BEV 直方图特征,得 512 维环境表示后经单层 GRU 自回归预测差分 waypoint,另加深度/语义/HD 地图/车辆检测四个辅助任务;公理层含『几何式融合在动态体密集场景下模仿学习欠佳』与『单步观测已足』,并以 PID 控制器、creeping 与安全启发式兜底 IL 的 inertia 问题。 | Formalization |
| FRM-2504.19580 | ARTEMIS 五层重建(骨架):核心对象是把规划建成逐点自回归的条件序列生成——每个 waypoint 由“规划时间嵌入 + 当前 ego 状态 + 历史规划查询”拼成的查询经带共享与私有专家的 MoE 块(配批量重分配加速)与 BEV 特征交互后、从预测的高斯分布采样得到;路由走内生场景特征而非驾驶命令,且刻意不用专家平衡损失;公理层含『命令分布不均衡且偶与专家轨迹不一致』与『只用当前 ego 状态以防因果混淆』。 | Formalization |
| FRM-2503.11650 | Centaur 五层重建(骨架):核心对象是以不确定性为目标的测试时训练——把打分式规划器看作词表上的分类器,先按 5 个方向锚(sharp/slight left、forward、slight/right)对采样候选聚类求和归一化,再以该 5 类分布的 Shannon 熵(Cluster Entropy)作无监督目标,在推理前用历史梯度缓冲(F=4)的平均做单步参数更新;公理层含『预编程回退层/代价函数无法随新数据学习而过度保守』与『词表巨大时朴素熵偏向邻居多的轨迹』。 | Formalization |
| FRM-2505.15111 | iPad 五层重建(骨架):核心对象是把“候选未来计划”(proposal)置于特征提取与辅助任务的中心——ProFormer 以提案预测位姿为锚做变形自注意力与空间交叉注意力、迭代精化提案查询(跨迭代共享权重,用带折扣的 MoN 损失逐轮监督),替代 BEVFormer 式固定稠密网格;两个轻量提案中心辅助任务(可通行/在途建图、对首个致因与可能碰撞智能体的未来预测)同时供可解释性与不确定性表达。 | Formalization |
| FRM-2506.06659 | DriveSuprim 五层重建(骨架):核心对象是把选择式规划的“精确选优”拆成粗到精两段——粗筛在整词表上按 Hydra-MDP 式打分取 top-k,精化解码器再对含大量 hard negative 的候选逐层输出细粒度分数;为缓解困难场景的数据不平衡引入 ego 旋转等价的视图增广(伪全景裁剪 + 真值同步反向旋转),并用 EMA 教师裁剪软标签做自蒸馏稳定训练。 | Formalization |
| FRM-2603.29163 | SparseDriveV2 五层重建(骨架):核心对象是把静态轨迹词表推到超稠密——先把轨迹分解为几何路径与速度剖面两组因子、以组合覆盖动作空间(词表比先前方法稠密 32×),再用粗粒度因子化打分筛出 top-K 路径与 top-K 速度、组合后只对小子集做细粒度打分;其经验前提是对 Hydra-MDP 的 scaling 研究显示锚点越密性能越好、在算力约束前不饱和;作者据此主张动态生成并非必要。 | Formalization |
| FRM-2405.19620 | SparseDrive 五层重建(骨架):核心对象是把端到端驾驶重建为“对称稀疏感知 + 并行运动规划”——检测/跟踪/在线建图共用对称结构学得全稀疏场景表示,ego 与周围智能体以同一套多模轨迹头并行预测,再经分层规划选择(命令筛子集 + 碰撞感知重打分把碰撞轨迹分数置 0)输出安全轨迹;公理层含『模块化系统的信息损失与误差累积』『昂贵 BEV 特征与直白设计是效率瓶颈』『运动预测与规划高度相似』。 | Formalization |
| FRM-2402.13243 | VADv2 五层重建(骨架):核心对象是把规划建成场景条件概率分布——先以最远点采样把连续动作空间离散成大规模规划词表(默认 4096 条,全部取自驾驶演示因而天然满足运动学约束),再用受 NeRF 启发的概率场函数(傅里叶位置编码 + transformer 解码器)预测每候选概率,以分布损失(KL→交叉熵)、冲突损失与场景 token 损失训练;公理层含『场景—动作无确定关系、解空间非凸时确定式回归有安全风险』与『概率对动作连续且对小扰动不敏感』。 | Formalization |
| FRM-2406.06978 | Hydra-MDP 五层重建(骨架):核心对象是三范式对比下的多教师蒸馏——把『多模规划 + 单目标学习 + 不可微后处理』改为『多模规划 + 多目标学习』,在 VADv2 式固定词表上以模仿损失对齐人类、以离线仿真分数经 BCE 蒸馏规则教师,推理期按网格搜索权重组装子分数选轨迹;公理层含『仅模仿不足以关联环境』『不可微后处理基于不完美感知』『固定词表使离线批量仿真可行』。 | Formalization |
| FRM-2506.06664 | GTRS 五层重建(骨架):核心对象是统一粗/细粒度轨迹评估的三支柱框架——基于 Diffusion Policy 的动态候选生成器、用超稠密词表(16384)+ 词表 dropout 训练并在较小子集(8192)推理的泛化打分器、以及传感器扰动与仅训练期精化(top-k + EMA 教师软监督、目标裁剪)的增广打分器;公理层含『静态词表粗离散、动态候选覆盖窄』与『超稠密训练/小子集推理可诱导泛化』。 | Formalization |
| FRM-2503.12820 | Hydra-MDP++ 五层重建(骨架):核心对象是在固定离散规划词表上的多教师蒸馏——700K 轨迹 K-means 得词表,分类式解码器先模仿日志轨迹,再以离线仿真的 PDM 指标系统为教师做多头蒸馏,教师指标在传统 NAVSIM 项外扩入红绿灯合规(TL)、车道保持(LK)与扩展舒适(EC);公理层含『模仿不足需与环境关联』与『固定动作空间可离线生成度量真值』。 | Formalization |
第 1 / 2 页
下一页