Research KB 登录

EVI-015 Evidence

Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。

id
updated
type evidence
claims CLM-015
source PPR-2112.10752
observation Tab.423 firststage(OpenImages 训练的 autoencoder,ImageNet-Val 评估;对比 DALL·E f=8、VQGAN f=16 与 LDM f=8/16/2 的重建指标)+ §4 / 引言贡献 i, iii
method first-stage autoencoder,下采样因子 f,code dim |Z|;重建指标:R-FID(原图 vs 重构图,↓)、IS、PSNR(↑)、LPIPS(↓)、SSIM(↑)。OpenImages 训练,ImageNet-Val 评估。
scope f=8/16/2(LDM)、DALL·E f=8、VQGAN f=16(k=16384/1024);OpenImages→ImageNet-Val

Result

matched 压缩下 LDM 的重建质量:

  • f=8, LDM (|Z|=16384, 4ch):R-FID 1.14, IS 201.92, PSNR 23.07, LPIPS 1.17, SSIM 0.65。
  • 对比 DALL·E f=8 (8192):R-FID 32.01, PSNR 22.8, SSIM 0.73。→ 同为 8× 压缩,LDM 的 R-FID 1.14 远优于 DALL·E 的 32.01(相差约 28 倍)。
  • f=16, LDM (8ch):R-FID 5.15, IS 144.55, PSNR 20.83, SSIM 0.54;对比 VQGAN f=16 (16384,256):R-FID 4.98, PSNR 19.9(两者 f=16 下重建能力大体相当);VQGAN f=16 (1024,256):R-FID 7.94。
  • f=2 (|Z|=2048, 2ch):R-FID 0.16, IS 232.75, PSNR 30.85, LPIPS 0.27, SSIM 0.91 —— 极低压缩下仍有近乎无损的重建,这是 AR 类方案难以企及的区间。

Caveats

R-FID 越低代表重建越忠实(原图与重构图的 Inception 特征距离小)。LDM 的优势主要体现在低压缩区间(f=2/8):f=8 下 R-FID 1.14 vs DALL·E 32.01;而 f=16 下 LDM(5.15)与 VQGAN(4.98)基本打平——即 LDM 并非在所有 f 上都赢,而是“能在更低 f 处保持高保真”,这正是其可扩展到高分辨率的根基。code dim |Z| 与通道数是受控变量;DALL·E 的 “- ‘ 表示其 IS 未在该表列出。该表为补充材料完整版(firststagetablecomplete),主文 Tab.423 为其精简视图。

关联(15)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • BMK-004 ImageNet class-conditional generation (256×256 / 512×512)
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • CLM-015 LDM 全 2D-conv 流程(conv AE + conv DM)可容忍比 1D-AR tokenize 更温和的压缩且重建更保真;优势集中在低压缩区间(f=8 显著优于 DALL·E,f=16 与 VQGAN 相当)。
  • VER-015 重建核验:LDM f=8 R-FID 1.14 vs DALL·E 32.01 / VQGAN 4.98、f=2 0.16 与 Tab.423 一致,f=16 打平边界已声明。supported。
  • EVI-013 co-source §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。
  • EVI-014 co-source Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
  • EVI-016 co-source §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。
  • EVI-017 co-source §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
  • EVI-018 co-source 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
  • EVI-019 co-source 主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-018 第二子命题)。
  • EVI-020 co-source 无条件合成表:LDM 对 GAN/扩散基线的 FID/Precision/Recall(支撑 CLM-020)。
  • EVI-021 co-source §4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。
  • EVI-022 co-source §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。
  • EVI-023 co-source §10 Limitations + Fig. firststagecomparison:AE 重建瓶颈与迭代采样局限(支撑 CLM-023)。