Research KB 登录

DIS-001 Disambiguation

术语 cross-attention 的双 referent 路由:LDM 通用条件接口(CPT-009)与 DiT block 设计变体(CPT-010)。

id
updated
type disambiguation
term cross-attention
refs CPT-009, CPT-010

Routing

  • CPT-009 — LDM 的通用 cross-attention 条件机制:domain encoder \(\tau_\theta\) 把任意条件模态投影为 Key/Value 注入扩散 U-Net(PPR-2112.10752)。
  • CPT-010 — DiT block 设计轴的 cross-attention 变体:t/c 嵌入拼成 2-token K/V 序列,self-attention 后追加 cross-attention 层(PPR-2212.09748)。

两个 referent 同属 attention 注入条件这一机制家族,但条件对象与宿主架构不同;论文层面的亲缘陈述见 CPT-010 的 Disambiguation 节。质的差异与量化比较不属本卡(Definition 20:纯路由)。

关联(11)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
  • FRM-2503.07656 DriveTransformer 五层重建(骨架):核心对象是把端到端驾驶压成三种统一注意力算子的纯 transformer 框架——sensor cross attention 让任务查询直接取原始传感特征(3D 位置编码、不建 BEV)、task self-attention 让 agent/map/ego 查询在每层直接互交(任务并行、无手工顺序)、temporal cross attention 以各任务的 FIFO 查询队列注入历史(流式、含 ego 坐标变换补偿);公理层含『串行感知-预测-规划导致累积误差与训练不稳』与『手工任务顺序限制协同』。
  • FRM-2606.26017 G2DP 五层重建:核心对象是 CPT-013 时空代价体(占据概率栅格 × 路线进度图融合)在推理期的可微引导;公理层为能量重加权目标分布、Top-K 车体聚合与末段注入等六个作者前提;论证主干是 Table 4 在同一 DiT 骨干下隔离『稠密网格 vs 稀疏实例』的引导模态消融(稀疏臂按 PPR-2501.15564 附录 C 实现、以 oracle 邻车供给)。
  • CPT-009 Cross-attention conditioning
  • CPT-010 DiT cross-attention conditioning
  • CPT-011 DiT in-context conditioning
  • VER-002 核验 CLM-002 adaLN-Zero 胜出:Table 4 四行与 Gflops/params 列逐项一致、Figure 5 排序声明一致,'同配置同预算'经审计修正。supported。
  • SYN-001 DiT 四种 conditioning 设计系统对比:adaLN-Zero 以可忽略算力增量取得 FID 19.47 全维最优;推导出'交互强度-质量'非单调与'算力效率优先'两条结构观察(单来源外推,显式标注)。