CPT-006
Concept
Latent Diffusion Model
| id | |
|---|---|
| updated | |
| type | concept |
| name | Latent Diffusion Model |
| aliases | LDM, latent diffusion |
| defined-by | PPR-2212.09748, PPR-2112.10752 |
Definition
在 VAE 隐空间(而非像素空间)训练 diffusion 模型的两阶段框架(canonical 定义源:Rombach et al., PPR-2112.10752):(1) 感知压缩段——学习 encoder E(autoencoder,LPIPS 感知损失 + PatchGAN 对抗目标,KL 或 VQ 正则)把图像 x 压缩为低维、感知等价的表示 z=E(x)(下采样因子 f,抽掉高频细节);(2) 语义压缩/生成段——在 z 上训练 diffusion 模型(ε-prediction,E 冻结),采样后用 decoder D 还原 x=D(z)。DiT 的模型即 LDM——它替换的是 LDM 框架内的 backbone(U-Net→ViT),first-stage 沿用本文的 f=8 VAE(32×32×4)。与 VQGAN/DALL·E 的关键差异:LDM 的 2D 卷积 backbone 使其无需极高压缩比即可保持高保真重建,从而可温和扩展到更高分辨率。
Disambiguation
关联(27)
- PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
- PPR-2212.09748 Scalable Diffusion Models with Transformers
- PPR-2510.11690 Diffusion Transformers with Representation Autoencoders
- PPR-2605.12964 Asymmetric Flow Models
- FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
- FRM-2605.12964 AsymFlow 五层重建:不对称速度目标 Pε−x0 与解析恢复 → 端点归约(r=0/正负号 x0-pred,r=D u-pred)→ Procrustes lift 的轨迹耦合定理 → 方差缩减微调损失(control variates + LPIPS 门控);断言投影待 G1 签发后进行。
- CLM-009 U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone,并在同等评估协议下取得优于既有 U-Net-based diffusion 模型的质量。
- CLM-013 像素空间 DM 把容量同时花在感知无关细节与语义构成上;显式剥离感知压缩给一次训练的 autoencoder、让 DM 在低维 latent 专司语义生成,是复杂度降低与细节保留之间的近最优分解(作者自评)。
- CLM-014 在预训练感知 autoencoder 的 latent 空间训扩散模型,相对同等评估条件下的像素空间扩散模型,同时显著降低训练算力与采样/推理成本,且生成质量不降反升。
- CPT-001 Diffusion Transformer (DiT)
- CPT-002 adaLN-Zero
- CPT-007 adaptive layer norm (adaLN)
- CPT-008 Perceptual autoencoder (first stage)
- CPT-009 Cross-attention conditioning
- VER-017 条件机制核验:Q/K/V 公式(§2.5 Eq. cond_loss)与命题一致,text/class/layout/i2i 四模态有实例,与 DiT adaLN 不同机制不冲突。supported。
- CPT-001 co-definer Diffusion Transformer (DiT)
- CPT-002 co-definer adaLN-Zero
- CPT-003 co-definer classifier-free guidance
- CPT-004 co-definer patchify
- CPT-005 co-definer VAE decoder variants (ft-MSE / ft-EMA)
- CPT-007 co-definer adaptive layer norm (adaLN)
- CPT-008 co-definer Perceptual autoencoder (first stage)
- CPT-009 co-definer Cross-attention conditioning
- CPT-010 co-definer DiT cross-attention conditioning
- CPT-011 co-definer DiT in-context conditioning