FRM-2507.17596
PRIX 五层重建(骨架):核心对象是仅用相机的端到端规划——ResNet 骨干配可跨尺度共享权重自注意力的上下文重标定 Transformer(CaRT)产出多尺度特征,再以 Token Memory 与 Planner Grid 两种学习表示(后者不是几何 BEV,仅靠语义与轨迹损失锚定到 ego 帧、不使用相机内外参)条件化一个带锚点的两步扩散规划头,输出 8 个 waypoint;公理层含『部署受模型规模、LiDAR 与密集 BEV 阻碍』与『固定相机装置下几何可被参数吸收』。
Formalization
2026-09-14 11:22 UTC
FRM-2505.09315
TransDiffuser 五层重建(骨架):核心对象是在不用任何轨迹锚点或场景先验的前提下解决扩散式规划的模式坍缩——把场景编码器(冻结的 Transfuser 骨干)与动作/ego 状态嵌入作为多模态条件输入去噪解码器,并在去噪过程中加批级多模态表示去相关正则(惩罚表示相关矩阵的非对角项、逼近对角形);公理层含『既有扩散规划器靠预定义词表或场景先验缓解坍缩,而这些归纳偏置在部署中不可得』与『规划性能取决于多模态表示质量』。
Formalization
2026-09-14 11:21 UTC
FRM-2312.03031
“Is Ego Status All You Need”五层重建(骨架):这是诊断性而非提出式论文——核心对象是指出 nuScenes 开环端到端规划的三大问题(含 ego 状态的模型被 ego 状态主导、感知信息被闲置;L2 与碰撞率不足以刻画规划质量;开环中其他智能体不响应 ego 使碰撞度量有偏且忽略 yaw),并据此给出极简基线 BEV-Planner(仅 BEV + ego 查询交叉注意 + L1,不用任何感知标注)与基于地图先验的新指标 CCR(路缘碰撞率)。
Formalization
2026-09-14 11:20 UTC
FRM-2408.03601
DRAMA 五层重建(骨架):核心对象是把 Mamba(状态空间模型)引入端到端运动规划——编码器用多尺度卷积与四个 Mamba 融合模块替代 Transformer 自注意力来融合相机与 LiDAR BEV 特征(训练复杂度由 T²D 降为 TD²),解码器用可学的 Mamba-Transformer 层输出确定性轨迹,并以差异化 dropout 率作用的特征状态丢弃(FSD)缓解传感噪声与 ego 状态缺失;公理层含『自注意力对序列长度二次复杂』与『传感/导航输入本就不完美』。
Formalization
2026-09-14 11:20 UTC
FRM-2503.07656
DriveTransformer 五层重建(骨架):核心对象是把端到端驾驶压成三种统一注意力算子的纯 transformer 框架——sensor cross attention 让任务查询直接取原始传感特征(3D 位置编码、不建 BEV)、task self-attention 让 agent/map/ego 查询在每层直接互交(任务并行、无手工顺序)、temporal cross attention 以各任务的 FIFO 查询队列注入历史(流式、含 ego 坐标变换补偿);公理层含『串行感知-预测-规划导致累积误差与训练不稳』与『手工任务顺序限制协同』。
Formalization
2026-09-14 11:19 UTC
FRM-2402.11502
GenAD 五层重建(骨架):核心对象是把端到端驾驶重铸为生成建模——先用实例中心场景 tokenizer 把周围场景变成含地图语义的实例 token,再用 VAE 在结构化潜空间学未来轨迹先验,并让 GRU 在潜空间里推进时间演化、由 MLP 逐点解出 waypoint;因运动预测与规划共享输出空间,二者用同一套潜空间与生成器完成;公理层含『渐进式流水线无法全面建模交通演化过程』与『轨迹高度结构化、存在可学先验』。
Formalization
2026-09-14 11:19 UTC
FRM-2212.10156
UniAD 五层重建(骨架):核心对象是规划导向的模块化流水线——TrackFormer(检测 + 多目标跟踪,含显式 ego 查询)、MapFormer(地图全景分割)、MotionFormer(场景中心的多模联合预测,含 agent/场景锚与目标点交互)、OccFormer(保留实例身份的占用预测)四模块以统一 query 串联,Planner 以命令嵌入条件化 ego 查询输出轨迹,并在推理期用牛顿法按占用图避碰优化;公理层含『框架应面向规划这一终极目标设计』与『端到端下不可假设真值感知』。
Formalization
2026-09-14 11:18 UTC
FRM-2303.12077
VAD 五层重建(骨架):核心对象是全向量化的场景表示与规划约束——以地图向量(车道线/道路边界/人行横道)与多模智能体运动向量取代稠密栅格化表示,ego 查询依次与智能体、地图查询交互后由规划头加驾驶命令输出轨迹,训练期再用碰撞、越界与车道方向三条实例级向量约束正则规划;公理层含『稠密栅格计算密集且缺实例级结构』与『向量化实例可作显式规划约束』。
Formalization
2026-09-14 11:17 UTC
FRM-2205.15997
TransFuser 五层重建(骨架):核心对象是用自注意力做多模态融合的模仿学习驾驶架构——在多个分辨率上用 transformer 模块融合透视视图图像与 LiDAR BEV 直方图特征,得 512 维环境表示后经单层 GRU 自回归预测差分 waypoint,另加深度/语义/HD 地图/车辆检测四个辅助任务;公理层含『几何式融合在动态体密集场景下模仿学习欠佳』与『单步观测已足』,并以 PID 控制器、creeping 与安全启发式兜底 IL 的 inertia 问题。
Formalization
2026-09-14 11:17 UTC
FRM-2504.19580
ARTEMIS 五层重建(骨架):核心对象是把规划建成逐点自回归的条件序列生成——每个 waypoint 由“规划时间嵌入 + 当前 ego 状态 + 历史规划查询”拼成的查询经带共享与私有专家的 MoE 块(配批量重分配加速)与 BEV 特征交互后、从预测的高斯分布采样得到;路由走内生场景特征而非驾驶命令,且刻意不用专家平衡损失;公理层含『命令分布不均衡且偶与专家轨迹不一致』与『只用当前 ego 状态以防因果混淆』。
Formalization
2026-09-14 11:16 UTC