EVI-002
Evidence
Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。
| id | |
|---|---|
| updated | |
| type | evidence |
| claims | CLM-002 |
| source | PPR-2212.09748 |
| observation | Appendix Table 4 ('Details of all DiT models') + Figure 5 (FID over training) |
| method | 四种 conditioning 设计的 DiT-XL/2 各训 400K steps,其余超参相同;FID-50K 无 guidance(ft-MSE VAE decoder) |
| scope | DiT-XL/2 @ 256x256, 400K steps:in-context 119.37G / cross-attn 137.62G / adaLN 118.56G / adaLN-Zero 118.64G flops |
Result
FID-50K(400K steps,无 guidance,ft-MSE decoder):adaLN-Zero(CPT-002)19.47 < adaLN(CPT-007)25.21 < cross-attention(CPT-010)26.14 < in-context(CPT-011)35.24。Figure 5 显示该排序在训练全程保持。计算开销:cross-attention 增加 ~15% Gflops;adaLN 系列增量可忽略。参数量(Table 4):in-context 449M / cross-attention 598M / adaLN 600M / adaLN-Zero 675M——四种设计既不同算力也不同参数。
Caveats
单种子、单规模(XL/2)的直接对比;论文未报告方差。adaLN vs adaLN-Zero 的差距归因于零初始化,是论文的解释(Figure 5 推断),非独立消融。
关联(20)
- PPR-2212.09748 Scalable Diffusion Models with Transformers
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- CLM-002 同配置同预算下,条件注入机制的选择对生成质量有决定性影响:adaLN-Zero 调制式注入同时最优质量与最低计算开销,优于 cross-attention 与 in-context。
- CPT-002 adaLN-Zero
- CPT-007 adaptive layer norm (adaLN)
- CPT-010 DiT cross-attention conditioning
- CPT-011 DiT in-context conditioning
- VER-002 核验 CLM-002 adaLN-Zero 胜出:Table 4 四行与 Gflops/params 列逐项一致、Figure 5 排序声明一致,'同配置同预算'经审计修正。supported。
- SYN-001 DiT 四种 conditioning 设计系统对比:adaLN-Zero 以可忽略算力增量取得 FID 19.47 全维最优;推导出'交互强度-质量'非单调与'算力效率优先'两条结构观察(单来源外推,显式标注)。
- EVI-001 co-source Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-009)。
- EVI-003 co-source Figure 8/6 + Table 4:12 变体 Gflops-FID 强负相关;异构同 Gflops 的 S/2 68.40 vs B/4 68.38 相近、缩小 p 单调改善(支撑 CLM-003)。
- EVI-004 co-source Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-009)。
- EVI-005 co-source Figure 10/§5.2:小模型多步采样追不平大模型(80.7 Tflops@1000 步 FID 25.9 vs 15.2 Tflops@128 步 23.7),采样算力不可替代模型算力(支撑 CLM-005)。
- EVI-006 co-source Figure 9/§4.2:等训练算力下大模型 FID 更低;XL/2 约 10^10 Gflops 后反超 XL/4(训练算力效率,支撑 CLM-006)。
- EVI-007 co-source Table 5/§A.4:decoder original/ft-MSE/ft-EMA FID 2.46/2.30/2.27,encoder 相同免重训互换,差异有限均优于此前的 diffusion(支撑 CLM-007)。
- EVI-008 co-source App. A.1:3 通道 guidance(1.5)FID 2.27 vs 4 通道(1.375)2.20,近似式 3ch(1+x)≈4ch(1+¾x)(支撑 CLM-012 的口径 caveat)。
- EVI-009 co-source §1 + Table 2/3/6:DiT-XL/2 2.27(256)/3.04(512)vs LDM-4-G 3.60/ADM-G+U 3.94 及 118.6G/524.6G 算力对照——架构论题的经验支撑(支撑 CLM-009)。
- EVI-010 co-source §4.1 + Table 4 + Fig.13:未调参 ADM 配方(lr 1e-4/batch 256 全表一致)全程无 loss spike,训练高度稳定(支撑 CLM-010)。
- EVI-011 co-source §3.2 + Table 1/4:p 减半时参数量近似不变(S 33M 等)、Gflops ≥4×(S 0.36→1.41→6.06),验证 patchify 标度(支撑 CLM-011/TH-1)。
- EVI-012 co-source Table 2/3 行内梯度:256 FID 9.62→3.22→2.27、512 12.03→4.64→3.04,档位间改善递减——CFG 效应与饱和(支撑 CLM-012)。