Research KB 登录

CPT-005 Concept

VAE decoder variants (ft-MSE / ft-EMA)

id
updated
type concept
name VAE decoder variants (ft-MSE / ft-EMA)
aliases sd-vae-ft-mse, sd-vae-ft-ema, LDM f8 decoder
defined-by PPR-2212.09748

Definition

DiT 实验所用 VAE 解码器权重三选一:LDM 原 f8 模型的 original decoder,及其仅微调 decoder 权重的两个变体 ft-MSE 与 ft-EMA(Stable Diffusion 发布,权重见 huggingface.co/stabilityai/sd-vae-ft-mse)。三者 encoder 相同,故 decoder 可免重训互换(CLM-007)。

Disambiguation

  • 用途分工(论文 §A.4):scaling 分析(400K 网格、Table 4)用 ft-MSE;最终 SOTA 表(Table 2/3)用 ft-EMA——引用消融数字时必须核对 decoder 口径。
  • “SD f8 VAE” 指整条管线(encoder 8× downsample,256×256×3 → 32×32×4),decoder 变体是其可替换末端。

关联(15)

  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • CLM-007 DiT 对既有 U-Net diffusion 模型的质量优势不依赖 VAE decoder 选择:免重训互换 LDM 原始/ft-MSE/ft-EMA decoder(encoder 相同)后优势均保持。
  • EVI-004 Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-009)。
  • EVI-007 Table 5/§A.4:decoder original/ft-MSE/ft-EMA FID 2.46/2.30/2.27,encoder 相同免重训互换,差异有限均优于此前的 diffusion(支撑 CLM-007)。
  • VER-007 核验 CLM-007 decoder 消融:Table 5(2.46/2.30/2.27)与 §A.4(encoder 相同、免重训互换、LDM decoder 下仍最优)一致。supported。
  • VER-023 局限核验:§10 原文(顺序采样慢于 GAN;f=4 AE 非逐像素精确成瓶颈、SR 已受限,'assume' 措辞)与命题一致,推断性质已声明。supported。
  • CPT-001 co-definer Diffusion Transformer (DiT)
  • CPT-002 co-definer adaLN-Zero
  • CPT-003 co-definer classifier-free guidance
  • CPT-004 co-definer patchify
  • CPT-006 co-definer Latent Diffusion Model
  • CPT-007 co-definer adaptive layer norm (adaLN)
  • CPT-010 co-definer DiT cross-attention conditioning
  • CPT-011 co-definer DiT in-context conditioning