Research KB 登录

CLM-010 Claim

DiT 在未调参 ADM 配方下稳定训练:恒定 lr、无 warmup/正则,全程无 loss spike。

id
type claim
source PPR-2212.09748
scope all DiT configs (S/B/L/XL x p x 4 conditioning designs, 256/512), JAX on TPU-v3; AdamW, constant lr 1e-4, no weight decay/warmup/regularization, batch 256, EMA 0.9999, horizontal-flip-only augmentation
epistemic supported
lifecycle RECONCILED
updated

Proposition

DiT 在未调参的 ADM 配方下即可稳定训练到高性能:恒定学习率 1e-4、无 weight decay、无 warmup、无正则化,所有模型配置(含 XL)训练全程无 loss spike;超参几乎全部沿用 ADM 且未做调参(lr / 调度 / Adam β / weight decay 均为默认沿用)。

Evidence refs

Notes

与 ViT 分类文献的常见做法(warmup + 强正则化)形成对照(§4.1 引 steiner2021train / Xiao2021)。可复现要点:所有报告结果用 EMA 权重(decay 0.9999);数据增广仅水平翻转;DiT-XL/2 在 TPU v3-256 上约 5.7 iter/s(batch 256)。

关联(13)

  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • EVI-010 §4.1 + Table 4 + Fig.13:未调参 ADM 配方(lr 1e-4/batch 256 全表一致)全程无 loss spike,训练高度稳定(支撑 CLM-010)。
  • VER-010 核验 CLM-010 配方稳定:§4.1 两引语(no loss spikes/did not tune)与 Table 4 超参列(lr 1e-4、batch 256)及 Fig.13 曲线一致。supported。
  • SYN-002 三源合成:diffusion 管线三段可分解改造——LDM 表示层(latent 感知压缩)、DiT 骨干层(ViT 替换 + Gflops 标度)、G2DP 采样层(推理期引导插件);三论文是时间上的实际组合链(DiT 复用 LDM first-stage,G2DP 用 DiT 骨干),层独立性判断 CLM-013/009/032 解释组合可行性。
  • CLM-002 co-source 同配置同预算下,条件注入机制的选择对生成质量有决定性影响:adaLN-Zero 调制式注入同时最优质量与最低计算开销,优于 cross-attention 与 in-context。
  • CLM-003 co-source 模型前向 Gflops(而非参数量)主导 DiT 质量:Gflops 相近则 FID 相近,且与 FID-50K 强负相关。
  • CLM-005 co-source 采样算力不能补偿模型算力:DiT 族内小模型即使以数倍单图采样算力生成,FID 仍劣于大模型的低步数采样(锚点数字见 EVI-005)。
  • CLM-006 co-source 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。
  • CLM-007 co-source DiT 对既有 U-Net diffusion 模型的质量优势不依赖 VAE decoder 选择:免重训互换 LDM 原始/ft-MSE/ft-EMA decoder(encoder 相同)后优势均保持。
  • CLM-009 co-source U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone,并在同等评估协议下取得优于既有 U-Net-based diffusion 模型的质量。
  • CLM-011 co-source patchify 标度:p 减半 → token 与 transformer Gflops 至少 ×4(注意力超线性),参数量近似不变。
  • CLM-012 co-source CFG 大幅改善 DiT 生成质量,收益随 guidance scale 增大而递减,并伴随保真度升、多样性(recall)降的权衡;SOTA 数字均以 guidance 口径取得。