CPT-005
Concept
VAE decoder variants (ft-MSE / ft-EMA)
| id | |
|---|---|
| updated | |
| type | concept |
| name | VAE decoder variants (ft-MSE / ft-EMA) |
| aliases | sd-vae-ft-mse, sd-vae-ft-ema, LDM f8 decoder |
| defined-by | PPR-2212.09748 |
Definition
DiT 实验所用 VAE 解码器权重三选一:LDM 原 f8 模型的 original decoder,及其仅微调 decoder 权重的两个变体 ft-MSE 与 ft-EMA(Stable Diffusion 发布,权重见 huggingface.co/stabilityai/sd-vae-ft-mse)。三者 encoder 相同,故 decoder 可免重训互换(CLM-007)。
Disambiguation
- 用途分工(论文 §A.4):scaling 分析(400K 网格、Table 4)用 ft-MSE;最终 SOTA 表(Table 2/3)用 ft-EMA——引用消融数字时必须核对 decoder 口径。
- “SD f8 VAE” 指整条管线(encoder 8× downsample,256×256×3 → 32×32×4),decoder 变体是其可替换末端。
关联(15)
- PPR-2212.09748 Scalable Diffusion Models with Transformers
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- CLM-007 DiT 对既有 U-Net diffusion 模型的质量优势不依赖 VAE decoder 选择:免重训互换 LDM 原始/ft-MSE/ft-EMA decoder(encoder 相同)后优势均保持。
- EVI-004 Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-009)。
- EVI-007 Table 5/§A.4:decoder original/ft-MSE/ft-EMA FID 2.46/2.30/2.27,encoder 相同免重训互换,差异有限均优于此前的 diffusion(支撑 CLM-007)。
- VER-007 核验 CLM-007 decoder 消融:Table 5(2.46/2.30/2.27)与 §A.4(encoder 相同、免重训互换、LDM decoder 下仍最优)一致。supported。
- VER-023 局限核验:§10 原文(顺序采样慢于 GAN;f=4 AE 非逐像素精确成瓶颈、SR 已受限,'assume' 措辞)与命题一致,推断性质已声明。supported。
- CPT-001 co-definer Diffusion Transformer (DiT)
- CPT-002 co-definer adaLN-Zero
- CPT-003 co-definer classifier-free guidance
- CPT-004 co-definer patchify
- CPT-006 co-definer Latent Diffusion Model
- CPT-007 co-definer adaptive layer norm (adaLN)
- CPT-010 co-definer DiT cross-attention conditioning
- CPT-011 co-definer DiT in-context conditioning