CLM-018
Claim
推理期 CFG 大幅抬升 LDM 样张质量(FID/IS 同改)而几乎不加训练成本,两设定均成立;引导后的 1.45B cross-attn 文本 LDM 与近期最强 AR/diffusion 系统同量级且参数量显著更少(论文措辞 on par,非新 SOTA)。
| id | |
|---|---|
| type | claim |
| source | PPR-2112.10752 |
| scope | text-to-image: LAION-400M, 1.45B KL-LDM, BERT tokenizer, τ=transformer, MS-COCO val, 250 DDIM steps, CFG s=1.5; class-conditional: ImageNet 256^2, LDM-4 400M, 250 步, cfg=1.5 |
| epistemic | partially-supported |
| lifecycle | RECONCILED |
| updated |
Proposition
classifier-free guidance(CFG)在推理期施加即可大幅抬升 LDM 样张质量(FID/IS 同时改善)而几乎不增加训练成本,收益在 text-to-image 与 class-conditional 两设定均成立;引导后的 1.45B cross-attention(CPT-009)文本 LDM 达到与近期最强 AR 与 diffusion text-to-image 系统相当的量级,且参数量显著更少(论文措辞 “on par”,非新 SOTA)。
Evidence refs
Notes
论文原文(§4.3.1):“applying classifier-free diffusion guidance greatly boosts sample quality, such that the guided LDM-KL-8-G is on par with the recent state-of-the-art AR and diffusion models for text-to-image synthesis, while substantially reducing parameter count.” Changelog 证实 v2 的 T2I 数由 1.45B 大模型 + CFG 产生。CFG 的机制性定义(null-token dropout + 采样期外推)归属 DiT 侧 CPT-003;本条只记其在 LDM 上的效果。两处数值(T2I 23.35→12.61;ImageNet 10.56→3.60)分别锁在对应主表(EVI-018/EVI-019)。“on par 非 SOTA” 的 hedge 出自 EVI-019 Caveats 的诚实发现(12.61 略高于 Make-A-Scene 11.84 与 GLIDE 12.24),随命题保留以免读成全指标占优。2026-09-07:原 CLM-019(T2I 同量级 + 参数更少)并入本卡第二子命题——两子命题由同一张 T2I 表承重(质量与参数效率同源于一次对比,共享证据复合体);其口径警告(MS-COCO val 5K 标准评测协议、参数量对比不逐模型展开)随 EVI-019 Caveats 保留。
Epistemic Log
关联(17)
- PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
- FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
- EVI-018 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
- EVI-019 主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-018 第二子命题)。
- CPT-003 classifier-free guidance
- CPT-009 Cross-attention conditioning
- VER-018 CFG 核验:推理期提质(T2I 23.35→12.61、IS 19.93→26.62;ImageNet 10.56→3.60)与两表一致、非增训,机制同 CPT-003。supported。
- SYN-002 三源合成:diffusion 管线三段可分解改造——LDM 表示层(latent 感知压缩)、DiT 骨干层(ViT 替换 + Gflops 标度)、G2DP 采样层(推理期引导插件);三论文是时间上的实际组合链(DiT 复用 LDM first-stage,G2DP 用 DiT 骨干),层独立性判断 CLM-013/009/032 解释组合可行性。
- CLM-013 co-source 像素空间 DM 把容量同时花在感知无关细节与语义构成上;显式剥离感知压缩给一次训练的 autoencoder、让 DM 在低维 latent 专司语义生成,是复杂度降低与细节保留之间的近最优分解(作者自评)。
- CLM-014 co-source 在预训练感知 autoencoder 的 latent 空间训扩散模型,相对同等评估条件下的像素空间扩散模型,同时显著降低训练算力与采样/推理成本,且生成质量不降反升。
- CLM-015 co-source LDM 全 2D-conv 流程(conv AE + conv DM)可容忍比 1D-AR tokenize 更温和的压缩且重建更保真;优势集中在低压缩区间(f=8 显著优于 DALL·E,f=16 与 VQGAN 相当)。
- CLM-016 co-source 下采样因子 f 的选取存在数据集相关的甜区:f 过小训练进度结构性缓慢,f 过大因 first-stage 信息损失保真度早期停滞;复杂数据集甜区在 f=4/8,较简单数据可用更高 f 换采样速度。
- CLM-017 co-source LDM 以通用 cross-attention 注入任意条件(τ_θ 投影 y 为 KV,UNet 中间特征为 Q),一个 backbone 承载多模态条件。
- CLM-020 co-source likelihood-based 目标的 mode-covering 行为在 Precision/Recall 上系统性地优于 GAN(逐数据集、针对对抗基线),支持其分布覆盖优势的指标层证据;同口径下 LDM 于 CelebA-HQ 取得新 SOTA FID,其余数据集与最强 GAN/扩散竞争。
- CLM-021 co-source 密集条件 image-to-image 直接把条件拼入输入训练,conv 式条件使模型能越过训练分辨率泛化到兆像素大图。
- CLM-022 co-source 对密集条件 i2i 任务,latent 扩散配方同时给出感知质量与效率收益:(SR) LDM-SR 在感知指标上胜过专用像素扩散 SR3 与回归基线,但 PSNR/SSIM 由回归基线占先;(Inpainting) latent 化显著提吞吐并改善 FID,分布级质量超专用 SOTA 修复器 LaMa 而 LPIPS 略高。
- CLM-023 co-source LDM 上限受 first-stage AE 重建精度限制(细粒度像素任务),且迭代采样仍慢于 GAN 一步生成。