Research KB 登录

CPT-006 Concept

Latent Diffusion Model

id
updated
type concept
name Latent Diffusion Model
aliases LDM, latent diffusion
defined-by PPR-2212.09748, PPR-2112.10752

Definition

在 VAE 隐空间(而非像素空间)训练 diffusion 模型的两阶段框架(canonical 定义源:Rombach et al., PPR-2112.10752):(1) 感知压缩段——学习 encoder E(autoencoder,LPIPS 感知损失 + PatchGAN 对抗目标,KL 或 VQ 正则)把图像 x 压缩为低维、感知等价的表示 z=E(x)(下采样因子 f,抽掉高频细节);(2) 语义压缩/生成段——在 z 上训练 diffusion 模型(ε-prediction,E 冻结),采样后用 decoder D 还原 x=D(z)。DiT 的模型即 LDM——它替换的是 LDM 框架内的 backbone(U-Net→ViT),first-stage 沿用本文的 f=8 VAE(32×32×4)。与 VQGAN/DALL·E 的关键差异:LDM 的 2D 卷积 backbone 使其无需极高压缩比即可保持高保真重建,从而可温和扩展到更高分辨率。

Disambiguation

  • 与 DiT(CPT-001)的关系:LDM 是训练空间维度的概念(像素 vs 隐空间),DiT 是 backbone 维度(U-Net vs transformer);DiT 论文的模型同时是 LDM 与 transformer backbone,两概念正交。
  • 与 pixel-space DDPM(ADM 系列)对比:LDM 用 VAE 隐表示换取计算效率(DiT 的 Figure 2 bubbles 显示 LDM 以 ADM 的一小部分 Gflops 达到相近质量;LDM 自身的量化证据见 CLM-014:训练算力约 3.4× 更少、采样吞吐约 3.3× 更快、FID 更低)。

关联(27)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • PPR-2510.11690 Diffusion Transformers with Representation Autoencoders
  • PPR-2605.12964 Asymmetric Flow Models
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
  • FRM-2605.12964 AsymFlow 五层重建:不对称速度目标 Pε−x0 与解析恢复 → 端点归约(r=0/正负号 x0-pred,r=D u-pred)→ Procrustes lift 的轨迹耦合定理 → 方差缩减微调损失(control variates + LPIPS 门控);断言投影待 G1 签发后进行。
  • CLM-009 U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone,并在同等评估协议下取得优于既有 U-Net-based diffusion 模型的质量。
  • CLM-013 像素空间 DM 把容量同时花在感知无关细节与语义构成上;显式剥离感知压缩给一次训练的 autoencoder、让 DM 在低维 latent 专司语义生成,是复杂度降低与细节保留之间的近最优分解(作者自评)。
  • CLM-014 在预训练感知 autoencoder 的 latent 空间训扩散模型,相对同等评估条件下的像素空间扩散模型,同时显著降低训练算力与采样/推理成本,且生成质量不降反升。
  • CPT-001 Diffusion Transformer (DiT)
  • CPT-002 adaLN-Zero
  • CPT-007 adaptive layer norm (adaLN)
  • CPT-008 Perceptual autoencoder (first stage)
  • CPT-009 Cross-attention conditioning
  • VER-017 条件机制核验:Q/K/V 公式(§2.5 Eq. cond_loss)与命题一致,text/class/layout/i2i 四模态有实例,与 DiT adaLN 不同机制不冲突。supported。
  • CPT-001 co-definer Diffusion Transformer (DiT)
  • CPT-002 co-definer adaLN-Zero
  • CPT-003 co-definer classifier-free guidance
  • CPT-004 co-definer patchify
  • CPT-005 co-definer VAE decoder variants (ft-MSE / ft-EMA)
  • CPT-007 co-definer adaptive layer norm (adaLN)
  • CPT-008 co-definer Perceptual autoencoder (first stage)
  • CPT-009 co-definer Cross-attention conditioning
  • CPT-010 co-definer DiT cross-attention conditioning
  • CPT-011 co-definer DiT in-context conditioning