Research KB 登录

EVI-019 Evidence

主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-018 第二子命题)。

id
updated
type evidence
claims CLM-018
source PPR-2112.10752
observation 主文 Text-Conditional Image Synthesis 表(MS-COCO val,250 DDIM steps:CogView/LAFITE/GLIDE/Make-A-Scene vs LDM-KL-8 / LDM-KL-8-G)+ §4.3.1 Transformer Encoders for LDMs(LAION-400M, 1.45B, BERT tokenizer, τ=transformer)
method LAION-400M 训练;1.45B KL-LDM;BERT tokenizer;τ_θ=transformer 编码文本,cross-attention 注入 U-Net;MS-COCO validation 集评测 FID/IS;250 DDIM steps;best 配置 CFG s=1.5。
scope LAION-400M→MS-COCO val;1.45B;250 步;cfg 1.5(best)

Result

MS-COCO 250 步 text-to-image(FID↓ / IS↑):

  • CogView:27.10 / 18.20(AR)
  • LAFITE:26.94 / 26.02(GAN)
  • GLIDE:12.24 / –(diffusion)
  • Make-A-Scene:11.84 / –(AR, 同期最新)
  • LDM-KL-8(ours):23.35 / 19.93±0.35
  • LDM-KL-8-G(ours, CFG s=1.5):FID 12.61 / IS 26.62±0.38

→ LDM-KL-8-G(1.45B)的 FID 12.61 与 GLIDE 12.24、Make-A-Scene 11.84 处于同一量级(差 ≤0.8),并大幅领先早期的 CogView 27.10 与 LAFITE 26.94(差 ≈14.3/14.3)。

Caveats

“on par with” 是相对量级判断(12.61 vs 12.24/11.84,差 0.37–0.77),严格说 LDM-KL-8-G 的 FID(12.61)略高于 Make-A-Scene(11.84)与 GLIDE(12.24),并非绝对最低——论文措辞是 “on par”(相当)而非 “new SOTA”。“substantially reducing parameter count” 指 1.45B 小于部分 AR 系统,但表中未逐一列出 CogView/Make-A-Scene/GLIDE 的精确参数量,故参数量优势的量化幅度取决于外部信息,本表只保证 1.45B 这一自身数值。IS 的 ±0.38 为多次评测标准差;FID 单次值未附误差棒(FID 对样本数敏感,5K 提示集是标准口径)。

关联(14)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • CLM-018 推理期 CFG 大幅抬升 LDM 样张质量(FID/IS 同改)而几乎不加训练成本,两设定均成立;引导后的 1.45B cross-attn 文本 LDM 与近期最强 AR/diffusion 系统同量级且参数量显著更少(论文措辞 on par,非新 SOTA)。
  • VER-018 CFG 核验:推理期提质(T2I 23.35→12.61、IS 19.93→26.62;ImageNet 10.56→3.60)与两表一致、非增训,机制同 CPT-003。supported。
  • EVI-013 co-source §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。
  • EVI-014 co-source Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
  • EVI-015 co-source Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。
  • EVI-016 co-source §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。
  • EVI-017 co-source §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
  • EVI-018 co-source 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
  • EVI-020 co-source 无条件合成表:LDM 对 GAN/扩散基线的 FID/Precision/Recall(支撑 CLM-020)。
  • EVI-021 co-source §4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。
  • EVI-022 co-source §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。
  • EVI-023 co-source §10 Limitations + Fig. firststagecomparison:AE 重建瓶颈与迭代采样局限(支撑 CLM-023)。