EVI-001
Evidence
Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-009)。
| id | |
|---|---|
| updated | |
| type | evidence |
| claims | CLM-009 |
| source | PPR-2212.09748 |
| observation | Table 2 (Class-Conditional ImageNet 256x256) + §5.1 正文 + Appendix A.1 (subset-channel guidance) |
| method | FID-50K via ADM TensorFlow evaluation suite, 250 DDPM steps, ft-EMA VAE decoder, EMA 权重; guidance 仅施加于 4 通道 latent 的前 3 通道 |
| scope | Table 2 全部行目:与 BigGAN-deep / StyleGAN-XL / ADM 系列 / CDM / LDM 系列的同表对比 |
Result
DiT-XL/2-G(三通道 cfg=1.50):FID-50K 2.27,sFID 4.60,IS 278.24,Precision 0.83,Recall 0.57。对比行:LDM-4-G (cfg=1.50) 3.60、ADM-G+U 3.94、StyleGAN-XL 2.30、BigGAN-deep 6.95。2.27 出自三通道 guidance;等效四通道 guidance(scale 1.375)给出 FID-50K 2.20(Appendix A.1)。无 guidance DiT-XL/2:FID 9.62(7M steps),recall 0.67 为全表最高。计算开销上下文(§5.1、Table 6):DiT-XL/2 118.6G vs LDM-4 103.6G(latent U-Net)vs ADM 1120G / ADM-U 742G(pixel U-Net)。
Caveats
FID 对实现细节敏感,论文专门用 ADM 的评估套件保证口径一致。DiT-XL/2 训练 7M steps(约为对比模型常规预算的数倍);2.35M steps 时 FID 2.55(无 guidance 10.67),仍优于此前全部 diffusion 模型。2.27 对 StyleGAN-XL 2.30 的幅度为 0.03,“all prior generative models 中最低 FID”的结论依赖此对比口径与 FID 单一指标:sFID 上 StyleGAN-XL(4.02)仍优于 DiT(4.60),IS 上 DiT(278.24)高于 StyleGAN-XL(265.12)。
关联(27)
- PPR-2212.09748 Scalable Diffusion Models with Transformers
- BMK-004 ImageNet class-conditional generation (256×256 / 512×512)
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- CLM-009 U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone,并在同等评估协议下取得优于既有 U-Net-based diffusion 模型的质量。
- CLM-014 在预训练感知 autoencoder 的 latent 空间训扩散模型,相对同等评估条件下的像素空间扩散模型,同时显著降低训练算力与采样/推理成本,且生成质量不降反升。
- EVI-009 §1 + Table 2/3/6:DiT-XL/2 2.27(256)/3.04(512)vs LDM-4-G 3.60/ADM-G+U 3.94 及 118.6G/524.6G 算力对照——架构论题的经验支撑(支撑 CLM-009)。
- EVI-014 Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
- EVI-018 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
- CPT-002 adaLN-Zero
- VER-007 核验 CLM-007 decoder 消融:Table 5(2.46/2.30/2.27)与 §A.4(encoder 相同、免重训互换、LDM decoder 下仍最优)一致。supported。
- VER-009 核验 CLM-009 架构论题:可检验部分(ViT 替换 U-Net 质量反升)与 Table 2/3/6 一致;'归纳偏置非关键'属作者诠释(非受控对比),按 A4 保留。partially-supported。
- VER-012 核验 CLM-012 CFG 梯度:Table 2/3 行内(256: 9.62/3.22/2.27;512: 12.03/4.64/3.04)逐格一致,scale 边界与质量-多样性权衡已记。supported。
- VER-014 算力主张核验:271 vs 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94 与 compute_vs_fid 表逐项吻合,两 cfg 口径已分离。supported。
- VER-018 CFG 核验:推理期提质(T2I 23.35→12.61、IS 19.93→26.62;ImageNet 10.56→3.60)与两表一致、非增训,机制同 CPT-003。supported。
- VER-020 无条件合成核验:CelebA-HQ 5.11 SOTA、FFHQ 4.98、LSUN-Bedrooms 2.95 vs ADM 1.90 与无条件表一致,SOTA 限 CelebA-HQ、P/R 逐数据集。supported。
- SYN-001 DiT 四种 conditioning 设计系统对比:adaLN-Zero 以可忽略算力增量取得 FID 19.47 全维最优;推导出'交互强度-质量'非单调与'算力效率优先'两条结构观察(单来源外推,显式标注)。
- EVI-002 co-source Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。
- EVI-003 co-source Figure 8/6 + Table 4:12 变体 Gflops-FID 强负相关;异构同 Gflops 的 S/2 68.40 vs B/4 68.38 相近、缩小 p 单调改善(支撑 CLM-003)。
- EVI-004 co-source Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-009)。
- EVI-005 co-source Figure 10/§5.2:小模型多步采样追不平大模型(80.7 Tflops@1000 步 FID 25.9 vs 15.2 Tflops@128 步 23.7),采样算力不可替代模型算力(支撑 CLM-005)。
- EVI-006 co-source Figure 9/§4.2:等训练算力下大模型 FID 更低;XL/2 约 10^10 Gflops 后反超 XL/4(训练算力效率,支撑 CLM-006)。
- EVI-007 co-source Table 5/§A.4:decoder original/ft-MSE/ft-EMA FID 2.46/2.30/2.27,encoder 相同免重训互换,差异有限均优于此前的 diffusion(支撑 CLM-007)。
- EVI-008 co-source App. A.1:3 通道 guidance(1.5)FID 2.27 vs 4 通道(1.375)2.20,近似式 3ch(1+x)≈4ch(1+¾x)(支撑 CLM-012 的口径 caveat)。
- EVI-009 co-source §1 + Table 2/3/6:DiT-XL/2 2.27(256)/3.04(512)vs LDM-4-G 3.60/ADM-G+U 3.94 及 118.6G/524.6G 算力对照——架构论题的经验支撑(支撑 CLM-009)。
- EVI-010 co-source §4.1 + Table 4 + Fig.13:未调参 ADM 配方(lr 1e-4/batch 256 全表一致)全程无 loss spike,训练高度稳定(支撑 CLM-010)。
- EVI-011 co-source §3.2 + Table 1/4:p 减半时参数量近似不变(S 33M 等)、Gflops ≥4×(S 0.36→1.41→6.06),验证 patchify 标度(支撑 CLM-011/TH-1)。
- EVI-012 co-source Table 2/3 行内梯度:256 FID 9.62→3.22→2.27、512 12.03→4.64→3.04,档位间改善递减——CFG 效应与饱和(支撑 CLM-012)。