Research KB 登录

CLM-022 Claim

对密集条件 i2i 任务,latent 扩散配方同时给出感知质量与效率收益:(SR) LDM-SR 在感知指标上胜过专用像素扩散 SR3 与回归基线,但 PSNR/SSIM 由回归基线占先;(Inpainting) latent 化显著提吞吐并改善 FID,分布级质量超专用 SOTA 修复器 LaMa 而 LPIPS 略高。

id
type claim
source PPR-2112.10752
scope SR: ImageNet 4× bicubic upscaling, 256^2, f=4 VQ (OpenImages 预训练), identity conditioner, LR concat, 遵循 SR3 数据处理; Inpainting: Places 256^2/512^2 (30k), f=4 KL/VQ, 参数量对齐 ~215M (更大模型 387M, 3-level attention); DDIM; 对比 SR3 / LaMa / pixel-DM
epistemic supported
lifecycle RECONCILED
updated

Proposition

对密集条件的 image-to-image 任务,latent 扩散配方同时给出感知质量与效率收益 :(SR) 以低清图拼接注入训练的 LDM-SR 在感知指标(FID、用户偏好)上超过专用像素扩散模型 SR3 与像素回归基线,但像素级指标(PSNR/SSIM)由回归基线占先——感知质量与像素精确在此任务上分化为两个维度;(Inpainting) latent 化相对像素扩散显著提升吞吐并改善 FID,分布级质量(FID)超过专用 SOTA 修复器 LaMa 而 LPIPS 略高——归因于 LaMa 输出单张均值化图像、LDM 给出多样样本,单样本感知距离与分布匹配在此排序不一致。

Evidence refs

Notes

SR 部分(§4.4):LDM-SR(f=4 VQ, 169M UNet, 100 步)FID 2.8(val-split feat)/4.8(train-split);LDM-SR-big(552M)2.4/4.3;LDM-SR-50s-guiding(184M)4.4/6.4。PSNR/SSIM 最高的仍是简单回归基线(论文承认这些指标“favor blurriness over imperfectly aligned high frequency details”);LDM 以 post-hoc perceptual-loss guider 可再推高 PSNR/SSIM。LDM-BSR(泛化退化版本,补充 srsupptable)用于非 bicubic 退化。Inpainting 部分(§4.5):Tab. inpaintingefficiency 给出 LDM-1 vs LDM-4(KL/VQ)、215M 参数量对齐下 256²/512² 的训练+采样吞吐与六 epoch FID;Tab. inpaintingtable 给出 LDM-4-attn / big / big-w/o-attn-ft 对 LaMa 的 FID/LPIPS/PSNR/SSIM 对比;user_study 表给出 SR 与 Inpainting 两个任务两组偏好数字。“2.7× speed-up / 1.6× FID” 是直接引用 §4.5 正文表述。两子命题合一是监工裁决(2026-09-07(b)):共享“感知 vs 像素精确”的分析约定(SR 的 PSNR 现象与 inpainting 的 LPIPS 现象是同一机制的两面,EVI-022 Caveats 指认)且共用 EVI-022 一次完整复合举证。全部数字(FID、用户偏好百分比、2.7×/1.6×)沉在 EVI-022;inpainting big 模型(387M、512² 微调半 epoch)刷新 SOTA FID 一节为单配置单表读数且口径特殊,按裁决 2026-09-07(c) 沉 EVI-022(其 Result 已载)。倍数随 KL/VQ、分辨率漂移不是常数,见 EVI-022 Caveats。

关联(15)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • CLM-023 LDM 上限受 first-stage AE 重建精度限制(细粒度像素任务),且迭代采样仍慢于 GAN 一步生成。
  • EVI-022 §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。
  • VER-022 i2i 核验:SR FID 2.8/2.4/4.4 胜 SR3、inpainting 2.7×提速/1.6×FID、胜 LaMa(用户 30.4/70.6、21.0/68.1)与表/正文逐项一致。supported。
  • SYN-002 三源合成:diffusion 管线三段可分解改造——LDM 表示层(latent 感知压缩)、DiT 骨干层(ViT 替换 + Gflops 标度)、G2DP 采样层(推理期引导插件);三论文是时间上的实际组合链(DiT 复用 LDM first-stage,G2DP 用 DiT 骨干),层独立性判断 CLM-013/009/032 解释组合可行性。
  • CLM-013 co-source 像素空间 DM 把容量同时花在感知无关细节与语义构成上;显式剥离感知压缩给一次训练的 autoencoder、让 DM 在低维 latent 专司语义生成,是复杂度降低与细节保留之间的近最优分解(作者自评)。
  • CLM-014 co-source 在预训练感知 autoencoder 的 latent 空间训扩散模型,相对同等评估条件下的像素空间扩散模型,同时显著降低训练算力与采样/推理成本,且生成质量不降反升。
  • CLM-015 co-source LDM 全 2D-conv 流程(conv AE + conv DM)可容忍比 1D-AR tokenize 更温和的压缩且重建更保真;优势集中在低压缩区间(f=8 显著优于 DALL·E,f=16 与 VQGAN 相当)。
  • CLM-016 co-source 下采样因子 f 的选取存在数据集相关的甜区:f 过小训练进度结构性缓慢,f 过大因 first-stage 信息损失保真度早期停滞;复杂数据集甜区在 f=4/8,较简单数据可用更高 f 换采样速度。
  • CLM-017 co-source LDM 以通用 cross-attention 注入任意条件(τ_θ 投影 y 为 KV,UNet 中间特征为 Q),一个 backbone 承载多模态条件。
  • CLM-018 co-source 推理期 CFG 大幅抬升 LDM 样张质量(FID/IS 同改)而几乎不加训练成本,两设定均成立;引导后的 1.45B cross-attn 文本 LDM 与近期最强 AR/diffusion 系统同量级且参数量显著更少(论文措辞 on par,非新 SOTA)。
  • CLM-020 co-source likelihood-based 目标的 mode-covering 行为在 Precision/Recall 上系统性地优于 GAN(逐数据集、针对对抗基线),支持其分布覆盖优势的指标层证据;同口径下 LDM 于 CelebA-HQ 取得新 SOTA FID,其余数据集与最强 GAN/扩散竞争。
  • CLM-021 co-source 密集条件 image-to-image 直接把条件拼入输入训练,conv 式条件使模型能越过训练分辨率泛化到兆像素大图。
  • CLM-023 co-source LDM 上限受 first-stage AE 重建精度限制(细粒度像素任务),且迭代采样仍慢于 GAN 一步生成。