Research KB 登录

EVI-013 Evidence

§1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。

id
updated
type evidence
claims CLM-013
source PPR-2112.10752
observation §1 Introduction(perceptual/semantic 两段分解论述)+ §2.3 Perceptual Image Compression + §2.4 Latent Diffusion Models(Eq. dmloss/ldmloss)
method 第一段:autoencoder(E,D),x∈R^(Hp×Wp×3) → z=E(x)(下采样因子 f),重构 x̂=D(z);损失=LPIPS 感知 + patch-based 对抗目标;两种正则:KL(对标准正态加轻 KL 罚,类 VAE)与 VQ(解码器内置向量量化层,可视为量化被吸收的 VQGAN 变体)。第二段:latent 上训 ε-prediction 扩散模型(time-conditional U-Net),reweighted 简化目标 ||ε−ε_θ(z_t,t)||²。
scope 256²/512²(conv 扩至 ~1024²);ImageNet/CelebA-HQ/FFHQ/LSUN/LAION/COCO/OpenImages/Places;f=1..32 全消融;169M–1.45B params

Result

像素空间 DM 的学习可拆为感知压缩(去掉高频细节、语义变化很小)与语义压缩(学数据的语义/概念组合)两阶段。LDM 用显式分离替代隐式混合:first-stage autoencoder(CPT-008)提供与像素感知等价但算力更省的表示空间;second-stage DM 在该空间训练,采样后单次过 decoder 得图像。

Caveats

f=1(LDM-1)即退化为像素 DM,是整套消融的下界参照。KL 与 VQ 两种 first-stage 的重建能力略有差异(VQ 略逊),但实验观察到 VQ 正则化有时反而给出更好的 LDM 样张质量(见 CLM 相关消融讨论)。感知等价性是经验意义上的(LPIPS/对抗目标保证局部真实感),非数学同构。

关联(15)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • CLM-013 像素空间 DM 把容量同时花在感知无关细节与语义构成上;显式剥离感知压缩给一次训练的 autoencoder、让 DM 在低维 latent 专司语义生成,是复杂度降低与细节保留之间的近最优分解(作者自评)。
  • CPT-008 Perceptual autoencoder (first stage)
  • VER-013 两段分解核验:感知压缩 AE + 潜空间 DM 与 §1/§2.3/§2.4(Eq.4-5)一致,DiT FRM-2212.09748 AX-2 同向互证,scope 未超。supported。
  • EVI-014 co-source Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
  • EVI-015 co-source Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。
  • EVI-016 co-source §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。
  • EVI-017 co-source §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
  • EVI-018 co-source 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
  • EVI-019 co-source 主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-018 第二子命题)。
  • EVI-020 co-source 无条件合成表:LDM 对 GAN/扩散基线的 FID/Precision/Recall(支撑 CLM-020)。
  • EVI-021 co-source §4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。
  • EVI-022 co-source §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。
  • EVI-023 co-source §10 Limitations + Fig. firststagecomparison:AE 重建瓶颈与迭代采样局限(支撑 CLM-023)。