Research KB 登录

EVI-022 Evidence

§4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。

id
updated
type evidence
claims CLM-022
source PPR-2112.10752
observation §4.4 Super-Resolution(Tab. srtable:ImageNet 4×, 256²,LDM-SR 169M / big 552M / 50s-guiding 184M vs SR3/pixel/regression)+ §4.5 Inpainting(Tab. inpaintingefficiency + inpaintingtable,Places 256²/512², LDM-1 vs LDM-4 / big 387M vs LaMa)+ Tab. user_study(SR 与 Inpainting 两组偏好)
method SR:ImageNet 4× bicubic 退化(遵循 SR3 流水线),f=4 VQ(OpenImages 预训练)AE,LR 与 UNet 输入拼接(τ=id),DDIM,ImageNet-Val 256²,FID/IS/PSNR/SSIM/LPIPS;LDM-SR 169M(100s)、big 552M、50s+guiding 184M。Inpainting:Places 30k,256²/512²,f=4 KL/VQ,参数量对齐 ~215M(big 387M,3-level attention),LDM-1(pixel)vs LDM-4,6 epochs,测吞吐+FID;对比 LaMa(FFT 专用)。用户研究:GT-preference 与 pairwise。
scope SR ImageNet 4× 256²(f=4 VQ,169M/552M/184M); Inpainting Places 256²/512²(215M/387M); DDIM; vs SR3/LaMa/pixel

Result

SR(ImageNet 4×, 256²,FID↓/IS↑/PSNR/SSIM/LPIPS):

  • LDM-SR(169M, 100 步):FID 2.8†(val feat)/ 4.8‡(train feat),IS 166.3,PSNR 24.4±3.8,SSIM 0.69±0.14。
  • LDM-SR-big(552M):FID 2.4/4.3,IS 174.9,PSNR 24.7,SSIM 0.71。
  • LDM-SR-50s-guiding(184M, 50 步+guiding):FID 4.4/6.4,PSNR 25.8, SSIM 0.74(guiding 抬 PSNR/SSIM,牺牲一点 FID)。
  • LDM-SR 的 FID 优于 SR3(SR3 的 IS 更高);PSNR/SSIM 最高者仍为简单回归基线(其偏好“模糊但对齐”),LDM 在感知质量上胜出,post-hoc perceptual-loss guider 可再推 PSNR/SSIM。

Inpainting(Places 256²/512²):

  • LDM-4(带 attention)vs pixel LDM-1:≥2.7× 训练+采样吞吐提升、≥1.6× FID 改善(6 epochs, 256²/512²,215M 对齐)。
  • LDM-4 FID 优于 LaMa(专用 SOTA 修复器);LPIPS 略高于 LaMa——LaMa 单张均值化图像 LPIPS 更低(更接近原图的均值),LDM 多样样张平均 LPIPS 略高但整体 FID(分布级)更好。
  • big(387M,3-level attention,无 first-stage attention 以省高清 VRAM)在 512² 微调半 epoch 后 → 刷新图像修复 SOTA FID。
  • 用户研究(user_study 表):Inpainting — LDM-4 GT-preference 21.0% vs LaMa 13.6%;pairwise 68.1% vs 31.9%。

Caveats

SR 的 PSNR/SSIM 由回归基线拿第一是指标特性(“favor blurriness over imperfectly aligned HF details”),不代表感知更好;LDM 的 2.4/2.8 FID 才是分布级质量的正确读数,PSNR 24.4–25.8 只是参考。“2.7×/1.6×” 与 “FID 2.4–4.4、PSNR 24.4–25.8” 是 215M/387M 对齐下 6 epochs 的中位读数,随分辨率(256²/512²)与 KL/VQ 微调漂移;512² 需 500 步级采样,256² 100 步足够。Inpainting 的 LPIPS 略劣于 LaMa 与 FID 更优并存,说明 LPIPS(单样本感知距离)与 FID(分布匹配)在此任务上排序不一致——LaMa 赢在“单张更像原图均值”,LDM 赢在“多样样本整体分布更对”,两者是不同维度。

关联(14)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • CLM-022 对密集条件 i2i 任务,latent 扩散配方同时给出感知质量与效率收益:(SR) LDM-SR 在感知指标上胜过专用像素扩散 SR3 与回归基线,但 PSNR/SSIM 由回归基线占先;(Inpainting) latent 化显著提吞吐并改善 FID,分布级质量超专用 SOTA 修复器 LaMa 而 LPIPS 略高。
  • VER-022 i2i 核验:SR FID 2.8/2.4/4.4 胜 SR3、inpainting 2.7×提速/1.6×FID、胜 LaMa(用户 30.4/70.6、21.0/68.1)与表/正文逐项一致。supported。
  • EVI-013 co-source §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。
  • EVI-014 co-source Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
  • EVI-015 co-source Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。
  • EVI-016 co-source §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。
  • EVI-017 co-source §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
  • EVI-018 co-source 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
  • EVI-019 co-source 主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-018 第二子命题)。
  • EVI-020 co-source 无条件合成表:LDM 对 GAN/扩散基线的 FID/Precision/Recall(支撑 CLM-020)。
  • EVI-021 co-source §4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。
  • EVI-023 co-source §10 Limitations + Fig. firststagecomparison:AE 重建瓶颈与迭代采样局限(支撑 CLM-023)。