Research KB 登录

EVI-014 Evidence

Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。

id
updated
type evidence
claims CLM-014
source PPR-2112.10752
observation Tab.13 compute_vs_fid(训练 V100-days + 推理 samples/s,A100)+ 主 ImageNet 256² 表(LDM-4/LDM-4-G vs ADM/ADM-G/BigGAN-deep,250 步)
method class-conditional ImageNet 256²;LDM-4 400M latent U-Net,f=4;ADM 554M pixel U-Net;250 DDIM steps;两配置:主结果 cfg=1.5,算力表 cfg=1.25(178K steps, batch 1200)。
scope LDM-4 400M vs ADM 554M;250 步;cfg 1.5(主)/1.25(算力表)

Result

训练算力(V100-days):LDM-4-G 271 vs ADM 916 → ≈3.4× 更少。推理吞吐(samples/s, A100):LDM-4-G 0.4 vs ADM 0.12 → ≈3.3× 更快。参数量:400M vs 554M。质量:LDM-4-G 主表 cfg=1.5 FID 3.60 / IS 247.67 / prec 0.87 / recall 0.48;算力表 cfg=1.25 FID 3.95 / IS 178.22 / prec 0.81 / recall 0.55。对比 ADM(250 步)FID 10.94;ADM-G FID 4.59(608M);BigGAN-deep 6.95(340M)。

Caveats

两处 LDM-4-G 数值来自不同配置,勿混:主表 cfg=1.5 的 FID 3.60;算力表 cfg=1.25(178K, batch 1200)的 271 V100-days + 0.4 samples/s + FID 3.95。ADM 行按 250 步取(916, 0.12, 554M, 10.94),与 250 步 LDM 直接可比;ADM 另有 1000 步行(232 V100-days)不属此口径。“3.4×/3.3×” 为 916/271 与 0.4/0.12 之比,随所选口径浮动,非固定常数。DiT 侧(EVI-001)把 “LDM-4-G 3.60” 记为“此前所有 diffusion 模型最佳”,与本表一致,形成跨来源锚点。

关联(15)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • CLM-014 在预训练感知 autoencoder 的 latent 空间训扩散模型,相对同等评估条件下的像素空间扩散模型,同时显著降低训练算力与采样/推理成本,且生成质量不降反升。
  • EVI-001 Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-009)。
  • VER-014 算力主张核验:271 vs 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94 与 compute_vs_fid 表逐项吻合,两 cfg 口径已分离。supported。
  • EVI-013 co-source §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。
  • EVI-015 co-source Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。
  • EVI-016 co-source §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。
  • EVI-017 co-source §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
  • EVI-018 co-source 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
  • EVI-019 co-source 主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-018 第二子命题)。
  • EVI-020 co-source 无条件合成表:LDM 对 GAN/扩散基线的 FID/Precision/Recall(支撑 CLM-020)。
  • EVI-021 co-source §4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。
  • EVI-022 co-source §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。
  • EVI-023 co-source §10 Limitations + Fig. firststagecomparison:AE 重建瓶颈与迭代采样局限(支撑 CLM-023)。