Research KB 登录

EVI-018 Evidence

主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。

id
updated
type evidence
claims CLM-018
source PPR-2112.10752
observation 主文 Tab.(Text-Conditional Image Synthesis, MS-COCO, 250 DDIM steps:LDM-KL-8 vs LDM-KL-8-G)+ class-conditional ImageNet 256² 主表(LDM-4 vs LDM-4-G, cfg=1.5)+ Changelog(v2 的 T2I 数由 1.45B + CFG 产生)
method T2I:LAION-400M,1.45B KL-LDM,BERT tokenizer,τ=transformer,MS-COCO val,250 DDIM steps,guided 版 cfg s=1.5。Class-cond:ImageNet 256²,LDM-4 400M,250 步,cfg=1.5(三/四通道口径见表内注)。
scope T2I 1.45B(23.35→12.61); class-cond ImageNet 256²(10.56→3.60); 250 步; cfg 1.5

Result

开启 CFG(s=1.5)前后:

  • text-to-image(MS-COCO, 250 步):LDM-KL-8 FID 23.35 → LDM-KL-8-G 12.61(降幅 ≈47%);IS 19.93 → 26.62。
  • class-conditional ImageNet 256²(250 步):LDM-4 FID 10.56 / IS 103.49 → LDM-4-G FID 3.60 / IS 247.67(prec 0.87),降幅 ≈66%。

同表参照(T2I, 250 步):CogView 27.10;LAFITE 26.94;GLIDE 12.24;Make-A-Scene 11.84;LDM-KL-8 23.35/19.93;LDM-KL-8-G 12.61/26.62。

Caveats

“CFG 大幅提质”是推理期效应——同一份训练好的权重,仅采样时用 \(\hat{\epsilon}(s) = \epsilon(\varnothing) + s \cdot (\epsilon(c) - \epsilon(\varnothing))\) 外推即改变 FID,不增加训练成本;故 23.35 与 12.61 的差异不能归于“训了更大的模型”。需注意 guidance scale(CPT-003)与通道数的口径:DiT 侧把 cfg 施加在 4 通道 latent 的前 3 通道(等效换算 \(\text{3ch}(1.5) \approx \text{4ch}(1.375)\)),LDM 主表的 1.5 为通道无关标称值;不同 scale 下 FID 单调下降但样本多样性(recall)略降(见 EVI-001 的 2.27 讨论)。T2I 的 23.35/12.61 与 class-cond 的 10.56/3.60 分属两张不同的表、两套数据(LAION/MS-COCO vs ImageNet),不要跨表相减。

关联(16)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • CLM-018 推理期 CFG 大幅抬升 LDM 样张质量(FID/IS 同改)而几乎不加训练成本,两设定均成立;引导后的 1.45B cross-attn 文本 LDM 与近期最强 AR/diffusion 系统同量级且参数量显著更少(论文措辞 on par,非新 SOTA)。
  • EVI-001 Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-009)。
  • CPT-003 classifier-free guidance
  • VER-018 CFG 核验:推理期提质(T2I 23.35→12.61、IS 19.93→26.62;ImageNet 10.56→3.60)与两表一致、非增训,机制同 CPT-003。supported。
  • EVI-013 co-source §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。
  • EVI-014 co-source Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
  • EVI-015 co-source Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。
  • EVI-016 co-source §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。
  • EVI-017 co-source §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
  • EVI-019 co-source 主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-018 第二子命题)。
  • EVI-020 co-source 无条件合成表:LDM 对 GAN/扩散基线的 FID/Precision/Recall(支撑 CLM-020)。
  • EVI-021 co-source §4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。
  • EVI-022 co-source §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。
  • EVI-023 co-source §10 Limitations + Fig. firststagecomparison:AE 重建瓶颈与迭代采样局限(支撑 CLM-023)。