Research KB 登录

CPT-001 Concept

Diffusion Transformer (DiT)

id
updated
type concept
name Diffusion Transformer (DiT)
aliases DiT
defined-by PPR-2212.09748
figures FIG-001

Definition

以标准 Vision Transformer 为 backbone 的(潜空间)去噪扩散模型:VAE 潜表示经 patchify(CPT-004)化为 token 序列,由若干 transformer block 处理条件去噪,线性解码出噪声与协方差预测。区别于 U-Net backbone 的 DDPM(ADM/LDM 系列)。

Disambiguation

  • 与 Latent Diffusion Model (CPT-006) 的关系:DiT 是 backbone 维度的概念,LDM 是训练空间维度的概念;DiT 论文的模型同时是 LDM。
  • 与通用词 “diffusion transformer”(任何 transformer 结构的扩散模型,如 U-ViT、SDiT 等后续变体)区分:本库中 DiT 特指 Peebles & Xie 2022 的架构及其直接谱系。

Visualization

Noised Latent Patchify DiT Block × N Layer Norm Linear and Reshape Noise Σ Timestep t Label y Embed
DiT 模型结构(论文 Fig. 2 left:Noised Latent → Patchify → DiT Blocks → Layer Norm → Linear and Reshape → Noise/Σ;Timestep t / Label y → Embed)

关联(23)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • PPR-2501.15564 Diffusion-Based Planning for Autonomous Driving with Flexible Guidance
  • PPR-2510.11690 Diffusion Transformers with Representation Autoencoders
  • PPR-2605.12964 Asymmetric Flow Models
  • PPR-2606.26017 G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
  • FRM-2605.12964 AsymFlow 五层重建:不对称速度目标 Pε−x0 与解析恢复 → 端点归约(r=0/正负号 x0-pred,r=D u-pred)→ Procrustes lift 的轨迹耦合定理 → 方差缩减微调损失(control variates + LPIPS 门控);断言投影待 G1 签发后进行。
  • CLM-033 闭环 diffusion 规划的质量瓶颈在结构设计(联合生成/起点约束/导航 adaLN 专门架构)而非 diffusion 范式本身:专门设计免精修达学习型类内最好成绩,且大幅优于套壳 diffusion 方法;对规则/混合类整体优势仅经 w/ refine. 变体成立(作者主张)。
  • CPT-002 adaLN-Zero
  • CPT-004 patchify
  • CPT-006 Latent Diffusion Model
  • CPT-007 adaptive layer norm (adaLN)
  • FIG-001 DiT 模型结构图(kblayout 重绘论文 Fig. 2 left):Noised Latent→Patchify→DiT Block×N→Layer Norm→Linear and Reshape→Noise/Σ;Timestep t 与 Label y 经 Embed 侧列进 Block。
  • CPT-002 co-definer adaLN-Zero
  • CPT-003 co-definer classifier-free guidance
  • CPT-004 co-definer patchify
  • CPT-005 co-definer VAE decoder variants (ft-MSE / ft-EMA)
  • CPT-006 co-definer Latent Diffusion Model
  • CPT-007 co-definer adaptive layer norm (adaLN)
  • CPT-010 co-definer DiT cross-attention conditioning
  • CPT-011 co-definer DiT in-context conditioning