Research KB 登录

CLM-002 Claim

同配置同预算下,条件注入机制的选择对生成质量有决定性影响:adaLN-Zero 调制式注入同时最优质量与最低计算开销,优于 cross-attention 与 in-context。

id
type claim
source PPR-2212.09748
scope DiT-XL/2, ImageNet 256x256, 400K training steps, batch 256, no classifier-free guidance; FID-50K via ft-MSE VAE decoder
epistemic supported
lifecycle RECONCILED
updated

Proposition

在 DiT 的 block 设计空间中,条件信息注入机制的选择对生成质量有决定性影响:调制式注入(adaLN-Zero(CPT-002),将 t/c 嵌入回归为缩放/平移参数)同时取得最优质量与最低计算开销,优于注意力式(cross-attention(CPT-010))与序列拼接式(in-context(CPT-011))注入;相对 vanilla adaLN(CPT-007)的优势归因见 Notes。

Evidence refs

Notes

四种设计在 Gflops(118.56–137.62G)与参数量(449–675M)上并不相同,故这是“同配置(XL/2)、同训练预算”的对比,而非严格“同规模”对比;论文原文框架(§5、Figure 5)是 adaLN-Zero 同时“更优且最省算力”(“yields lower FID ... while being the most compute-efficient”)。结论在训练全程成立(Figure 5),未对全程单独列表。零初始化使每个 block 初始为恒等函数,可能是 adaLN-Zero 优于 vanilla adaLN 的原因(论文推断,非独立消融)。此后论文所有模型均使用 adaLN-Zero block(§5)。

关联(18)

  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • EVI-002 Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。
  • CPT-002 adaLN-Zero
  • CPT-007 adaptive layer norm (adaLN)
  • CPT-010 DiT cross-attention conditioning
  • CPT-011 DiT in-context conditioning
  • VER-002 核验 CLM-002 adaLN-Zero 胜出:Table 4 四行与 Gflops/params 列逐项一致、Figure 5 排序声明一致,'同配置同预算'经审计修正。supported。
  • SYN-001 DiT 四种 conditioning 设计系统对比:adaLN-Zero 以可忽略算力增量取得 FID 19.47 全维最优;推导出'交互强度-质量'非单调与'算力效率优先'两条结构观察(单来源外推,显式标注)。
  • SYN-002 三源合成:diffusion 管线三段可分解改造——LDM 表示层(latent 感知压缩)、DiT 骨干层(ViT 替换 + Gflops 标度)、G2DP 采样层(推理期引导插件);三论文是时间上的实际组合链(DiT 复用 LDM first-stage,G2DP 用 DiT 骨干),层独立性判断 CLM-013/009/032 解释组合可行性。
  • CLM-003 co-source 模型前向 Gflops(而非参数量)主导 DiT 质量:Gflops 相近则 FID 相近,且与 FID-50K 强负相关。
  • CLM-005 co-source 采样算力不能补偿模型算力:DiT 族内小模型即使以数倍单图采样算力生成,FID 仍劣于大模型的低步数采样(锚点数字见 EVI-005)。
  • CLM-006 co-source 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。
  • CLM-007 co-source DiT 对既有 U-Net diffusion 模型的质量优势不依赖 VAE decoder 选择:免重训互换 LDM 原始/ft-MSE/ft-EMA decoder(encoder 相同)后优势均保持。
  • CLM-009 co-source U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone,并在同等评估协议下取得优于既有 U-Net-based diffusion 模型的质量。
  • CLM-010 co-source DiT 在未调参 ADM 配方下稳定训练:恒定 lr、无 warmup/正则,全程无 loss spike。
  • CLM-011 co-source patchify 标度:p 减半 → token 与 transformer Gflops 至少 ×4(注意力超线性),参数量近似不变。
  • CLM-012 co-source CFG 大幅改善 DiT 生成质量,收益随 guidance scale 增大而递减,并伴随保真度升、多样性(recall)降的权衡;SOTA 数字均以 guidance 口径取得。