EVI-004
Evidence
Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-009)。
| id | |
|---|---|
| updated | |
| type | evidence |
| claims | CLM-009 |
| source | PPR-2212.09748 |
| observation | Table 3 (Class-Conditional ImageNet 512x512) + §5.1 512×512 正文 |
| method | FID-50K via ADM TensorFlow evaluation suite, 250 DDPM steps, ft-EMA VAE decoder; Precision/Recall 用 1000 真实样本(循 ADM 惯例) |
| scope | Table 3 全部行目:BigGAN-deep / StyleGAN-XL / ADM 系列 / DiT 系列 |
Result
DiT-XL/2-G(cfg=1.50):FID-50K 3.04,sFID 5.02,IS 240.82,Precision 0.84,Recall 0.54。对比行:ADM-G+U 3.85、ADM-G 7.72、ADM-U 9.96、ADM 23.24、StyleGAN-XL 2.41、BigGAN-deep 8.43。DiT 行内梯度(无 guidance → cfg1.25 → cfg1.50):12.03 → 4.64 → 3.04。计算开销:DiT-XL/2 524.6G vs ADM 1983G / ADM-U 2813G(§5.1、Table 6)。
Caveats
3.04 对 StyleGAN-XL 2.41 差 0.63——512 上 GAN 仍占优。Table 4 报告的 512 无 guidance FID 为 11.93(ft-MSE decoder、3M steps),与 Table 3 的 12.03(ft-EMA)存在 decoder 口径差(CPT-005)。
关联(20)
- PPR-2212.09748 Scalable Diffusion Models with Transformers
- BMK-004 ImageNet class-conditional generation (256×256 / 512×512)
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- CLM-009 U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone,并在同等评估协议下取得优于既有 U-Net-based diffusion 模型的质量。
- CPT-002 adaLN-Zero
- CPT-005 VAE decoder variants (ft-MSE / ft-EMA)
- VER-009 核验 CLM-009 架构论题:可检验部分(ViT 替换 U-Net 质量反升)与 Table 2/3/6 一致;'归纳偏置非关键'属作者诠释(非受控对比),按 A4 保留。partially-supported。
- VER-012 核验 CLM-012 CFG 梯度:Table 2/3 行内(256: 9.62/3.22/2.27;512: 12.03/4.64/3.04)逐格一致,scale 边界与质量-多样性权衡已记。supported。
- SYN-001 DiT 四种 conditioning 设计系统对比:adaLN-Zero 以可忽略算力增量取得 FID 19.47 全维最优;推导出'交互强度-质量'非单调与'算力效率优先'两条结构观察(单来源外推,显式标注)。
- EVI-001 co-source Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-009)。
- EVI-002 co-source Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。
- EVI-003 co-source Figure 8/6 + Table 4:12 变体 Gflops-FID 强负相关;异构同 Gflops 的 S/2 68.40 vs B/4 68.38 相近、缩小 p 单调改善(支撑 CLM-003)。
- EVI-005 co-source Figure 10/§5.2:小模型多步采样追不平大模型(80.7 Tflops@1000 步 FID 25.9 vs 15.2 Tflops@128 步 23.7),采样算力不可替代模型算力(支撑 CLM-005)。
- EVI-006 co-source Figure 9/§4.2:等训练算力下大模型 FID 更低;XL/2 约 10^10 Gflops 后反超 XL/4(训练算力效率,支撑 CLM-006)。
- EVI-007 co-source Table 5/§A.4:decoder original/ft-MSE/ft-EMA FID 2.46/2.30/2.27,encoder 相同免重训互换,差异有限均优于此前的 diffusion(支撑 CLM-007)。
- EVI-008 co-source App. A.1:3 通道 guidance(1.5)FID 2.27 vs 4 通道(1.375)2.20,近似式 3ch(1+x)≈4ch(1+¾x)(支撑 CLM-012 的口径 caveat)。
- EVI-009 co-source §1 + Table 2/3/6:DiT-XL/2 2.27(256)/3.04(512)vs LDM-4-G 3.60/ADM-G+U 3.94 及 118.6G/524.6G 算力对照——架构论题的经验支撑(支撑 CLM-009)。
- EVI-010 co-source §4.1 + Table 4 + Fig.13:未调参 ADM 配方(lr 1e-4/batch 256 全表一致)全程无 loss spike,训练高度稳定(支撑 CLM-010)。
- EVI-011 co-source §3.2 + Table 1/4:p 减半时参数量近似不变(S 33M 等)、Gflops ≥4×(S 0.36→1.41→6.06),验证 patchify 标度(支撑 CLM-011/TH-1)。
- EVI-012 co-source Table 2/3 行内梯度:256 FID 9.62→3.22→2.27、512 12.03→4.64→3.04,档位间改善递减——CFG 效应与饱和(支撑 CLM-012)。