Research KB 登录

EVI-020 Evidence

无条件合成表:LDM 对 GAN/扩散基线的 FID/Precision/Recall(支撑 CLM-020)。

id
updated
type evidence
claims CLM-020
source PPR-2112.10752
observation 无条件图像合成表(256²,CelebA-HQ / FFHQ / LSUN-Churches / LSUN-Bedrooms:FID↓ + Precision↑ + Recall↑,LDM vs VQGAN/PGGAN/LSGM/UDM/StyleGAN/StyleGAN2/ProjectedGAN/ADM/DDPM/ImageBART 等)+ §4.2 Image Generation with Latent Diffusion
method 无条件生成,256×256;FID(↓)、Precision(↑)、Recall(↑)(ADM TF evaluation suite);DDIM 采样(CelebA-HQ 500 步、FFHQ/LSUN 200 步等);对比 GAN(StyleGAN/StyleGAN2/ProjectedGAN/PGGAN)与 likelihood-based(VQGAN+T/ImageBART/DDPM/UDM/LSGM/ADM)。
scope 256²; CelebA-HQ(SOTA 论断所在)/ FFHQ / LSUN-Churches / LSUN-Bedrooms

Result

FID↓ + Precision↑ + Recall↑(256²):

  • CelebA-HQ:VQGAN+T 10.2;PGGAN 8.0;LSGM 7.22;UDM 7.16(prec/recall 未列)。LDM-4(500 步):FID 5.11,Precision 0.72,Recall 0.49。 → 5.11 低于全部所列对比(最接近的 UDM 7.16 也差 2.05),是 CelebA-HQ 上的新 SOTA。
  • FFHQ:StyleGAN 4.16(0.71/0.46);ProjectedGAN 3.08(0.65/0.46)。LDM-4(200 步):4.98,Precision 0.73,Recall 0.50(P/R 反超 StyleGAN/ProjectedGAN,FID 略高)。
  • LSUN-Churches:StyleGAN 4.21;StyleGAN2 3.86;ProjectedGAN 1.59(0.61/0.44)。LDM-8(200 步):4.02,Precision 0.64,Recall 0.52(FID 与 StyleGAN2 相当,Recall 更高)。
  • LSUN-Bedrooms:StyleGAN2 2.35(0.59/0.48);ADM 1.90(0.66/0.51);ProjectedGAN 1.52(0.61/0.34)。LDM-4(200 步):2.95,Precision 0.66,Recall 0.48 → 接近 ADM(差 1.05),且 Precision 0.66 与 ADM 持平、Recall 0.48 略低;LDM-4 参数量为 ADM 约一半、训练资源少 4 倍。

Caveats

SOTA 措辞严格限于 CelebA-HQ(5.11 低于全表所列 GAN 与 likelihood-based 基线);FFHQ/LSUN 上 LDM 并非 FID 最低——FFHQ 的 ProjectedGAN 3.08、LSUN-Bedrooms 的 ADM 1.90/ProjectedGAN 1.52 都低于 LDM(4.98/2.95)。“outperform GAN in Precision and Recall” 是逐数据集成立的(FFHQ 0.73/0.50、LSUN-Bedrooms 0.66/0.48 均 ≥ 对应 GAN),但 Bedrooms 的 Recall 0.48 低于 ADM 0.51——ADM 是 likelihood-based 而非 GAN,故“优于 GAN”的论断不受 ADM 拖累,但若把 ADM 也算进“likelihood 对手”则 LDM 的 Recall 并不占优。5.11 的 prec/recall(0.72/0.49)为同口径 500 步测得,与 200 步的 FFHQ/LSUN 数字不可比步数。

关联(15)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • BMK-005 CelebA-HQ unconditional generation (256×256)
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • CLM-020 likelihood-based 目标的 mode-covering 行为在 Precision/Recall 上系统性地优于 GAN(逐数据集、针对对抗基线),支持其分布覆盖优势的指标层证据;同口径下 LDM 于 CelebA-HQ 取得新 SOTA FID,其余数据集与最强 GAN/扩散竞争。
  • VER-020 无条件合成核验:CelebA-HQ 5.11 SOTA、FFHQ 4.98、LSUN-Bedrooms 2.95 vs ADM 1.90 与无条件表一致,SOTA 限 CelebA-HQ、P/R 逐数据集。supported。
  • EVI-013 co-source §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。
  • EVI-014 co-source Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
  • EVI-015 co-source Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。
  • EVI-016 co-source §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。
  • EVI-017 co-source §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
  • EVI-018 co-source 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
  • EVI-019 co-source 主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-018 第二子命题)。
  • EVI-021 co-source §4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。
  • EVI-022 co-source §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。
  • EVI-023 co-source §10 Limitations + Fig. firststagecomparison:AE 重建瓶颈与迭代采样局限(支撑 CLM-023)。