Research KB 登录

EVI-016 Evidence

§4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。

id
updated
type evidence
claims CLM-016
source PPR-2112.10752
observation §4.1 On Perceptual Compression Tradeoffs + Fig. cin_traincourse(2M steps 样张随训练进度)+ Fig. speedplot(采样速度 vs FID, DDIM)+ Tab. cin_hyperparams(z-shape/通道/模型规模 391–396M/batch)
method class-conditional ImageNet 256²;f∈{1,2,4,8,16,32};参数量对齐 ~391–396M;2M steps;单 A100;linear 噪声调度 1000 步;DDIM 采样(25–100 步)测吞吐与 FID 关系。
scope f=1,2,4,8,16,32;~391–396M;2M steps;单 A100;ImageNet

Result

训练进度(Fig. cin_traincourse,2M steps):

  • LDM-{1,2}(低压缩):进度慢——因把大部分感知压缩任务交给了扩散模型本身,像素级的高维空间使其收敛迟滞。
  • LDM-{4,8}:兼具较快的早期收敛与较高的渐近质量,为甜区。
  • LDM-{16,32}(高压缩):first-stage 压缩过强→信息损失,样张保真度在较少步数后即停滞(上限被 first-stage 锁死)。

量化差距:LDM-1(像素基线)与 LDM-8 之间的 FID gap 在 2M steps 后达 38。

采样速度(Fig. speedplot,DDIM,CelebA-HQ & ImageNet):LDM-{4,8} 相对不合适的压缩比(过低/过高)的模型,在更低 FID 的同时实现更高的 samples/sec——二者兼顾。

Caveats

f 的选择是数据集相关的:ImageNet(复杂自然场景)需要较低压缩(f=4/8)以避免质量损失;CelebA-HQ(人脸,结构较规整)可以用较高 f 换取速度而质量损失较小。参数量“对齐”是名义上的(391–396M 区间内),实际各 f 的通道配置不同(channels 192/256, multiplier 随 f 变化),因此“参数量对齐”不完全等同于“算力对齐”——低 f 的模型虽然参数相同,但其 latent 空间维度更高,单次前向的 Gflops 实际上更高。这解释了为何 LDM-1/2 不仅“进度慢”,而且其“慢”是结构性的(latent 维度高→每步贵),不只是收敛动力学问题。

关联(14)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • CLM-016 下采样因子 f 的选取存在数据集相关的甜区:f 过小训练进度结构性缓慢,f 过大因 first-stage 信息损失保真度早期停滞;复杂数据集甜区在 f=4/8,较简单数据可用更高 f 换采样速度。
  • VER-016 f 甜区核验:f=4/8 最优与 §4.1 消融、FID gap 38(LDM-1 vs LDM-8 @2M)正文引语一致,scope 限 ImageNet/2M/单 A100。supported。
  • EVI-013 co-source §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。
  • EVI-014 co-source Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
  • EVI-015 co-source Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。
  • EVI-017 co-source §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
  • EVI-018 co-source 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
  • EVI-019 co-source 主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-018 第二子命题)。
  • EVI-020 co-source 无条件合成表:LDM 对 GAN/扩散基线的 FID/Precision/Recall(支撑 CLM-020)。
  • EVI-021 co-source §4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。
  • EVI-022 co-source §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。
  • EVI-023 co-source §10 Limitations + Fig. firststagecomparison:AE 重建瓶颈与迭代采样局限(支撑 CLM-023)。