Research KB 登录

CPT-010 Concept

DiT cross-attention conditioning

id
updated
type concept
name DiT cross-attention conditioning
aliases cross-attention block (DiT), DiT cross-attention variant
defined-by PPR-2212.09748

Definition

DiT 四种 conditioning 设计之一(PPR-2212.09748 §3.2 “DiT block design”):把 timestep t 与 class label c 的嵌入向量拼接为长度 2 的序列,与 image token 序列分离;标准 ViT block 修改为在 multi-head self-attention 之后追加一个 multi-head cross-attention 层(论文自述 similar to the original design from Vaswani et al.,亦 similar to the one used by LDM for conditioning on class labels)。条件信息以 token 级交互注入:Query 来自 image tokens,Key/Value 来自 2-token 条件序列——这是它与 adaLN 系(CPT-007/CPT-002,token 无关仿射、对全部 token 施加同一函数)的本质机制差异。

Empirical Role

  • CLM-002 / EVI-002:四种 conditioning 消融(DiT-XL/2 @ 400K,无 guidance,ft-MSE decoder)中 FID-50K 为 26.14——排序 in-context 35.24 > cross-attention 26.14 > adaLN 25.21 > adaLN-Zero 19.47,且该排序训练全程保持(Figure 5)。
  • 算力:四种设计中最贵——137.62G,比 adaLN(118.56G)高约 15%(§3.2 “Cross-attention adds the most Gflops, roughly a 15% overhead”)。
  • 参数量:598M(Table 4)。
  • 论文结论:质量与算力均劣于 adaLN-Zero,故未入选(§5 此后所有模型均用 adaLN-Zero)。

Disambiguation

  • 与 CPT-009(LDM 通用 cross-attention):同术语、不同 referent——CPT-009 是 LDM 的通用条件接口(domain encoder \(\tau_\theta\) 把任意模态投影为 K/V 序列注入 U-Net,PPR-2112.10752);本卡是 DiT block 设计轴上的一个变体(class-conditional ImageNet、2-token K/V、追加于 self-attention 之后)。论文明确承认二者的亲缘(§3.2 “similar to the one used by LDM”)。术语级路由见 DIS-001。
  • 与 adaLN / adaLN-Zero(CPT-007/CPT-002):token 级交互 vs token 无关仿射;本变体算力最贵而质量居中,adaLN-Zero 以可忽略的 Gflops 增量取得最低 FID(CLM-002)。
  • 与 in-context conditioning(CPT-011):四设计的另一成员——条件 t/c 嵌入拼入输入序列走 self-attention 内融合,block 零修改;质量最差(FID 35.24)但参数最少(CLM-002/EVI-002)。

Notes

  • 论文对四种 conditioning 设计仅文字描述 + Figure 3 图示,无逐 block 公式;本卡机制描述即 §3.2 原文要点的忠实转述(cross-attention 本身是 Vaswani 2017 标准组件)。
  • 本卡为 DIS-001 路由补齐的 referent;established 2026-09-05,源于“DiT 四种 conditioning 设计”问答暴露的 concept gap(D14 循环)。

关联(21)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • CLM-002 同配置同预算下,条件注入机制的选择对生成质量有决定性影响:adaLN-Zero 调制式注入同时最优质量与最低计算开销,优于 cross-attention 与 in-context。
  • EVI-002 Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。
  • CPT-002 adaLN-Zero
  • CPT-007 adaptive layer norm (adaLN)
  • CPT-009 Cross-attention conditioning
  • CPT-011 DiT in-context conditioning
  • CPT-012 FiLM (feature-wise linear modulation)
  • VER-002 核验 CLM-002 adaLN-Zero 胜出:Table 4 四行与 Gflops/params 列逐项一致、Figure 5 排序声明一致,'同配置同预算'经审计修正。supported。
  • SYN-001 DiT 四种 conditioning 设计系统对比:adaLN-Zero 以可忽略算力增量取得 FID 19.47 全维最优;推导出'交互强度-质量'非单调与'算力效率优先'两条结构观察(单来源外推,显式标注)。
  • DIS-001 术语 cross-attention 的双 referent 路由:LDM 通用条件接口(CPT-009)与 DiT block 设计变体(CPT-010)。
  • CPT-001 co-definer Diffusion Transformer (DiT)
  • CPT-002 co-definer adaLN-Zero
  • CPT-003 co-definer classifier-free guidance
  • CPT-004 co-definer patchify
  • CPT-005 co-definer VAE decoder variants (ft-MSE / ft-EMA)
  • CPT-006 co-definer Latent Diffusion Model
  • CPT-007 co-definer adaptive layer norm (adaLN)
  • CPT-011 co-definer DiT in-context conditioning