Research KB 登录

CPT-002 Concept

adaLN-Zero

id
updated
type concept
name adaLN-Zero
aliases adaptive layer norm zero, zero-initialized adaptive layer norm, adaLN-zero
defined-by PPR-2212.09748
figures FIG-002

Definition

DiT block 的条件注入机制(PPR-2212.09748 §3.2、App. A.5):在 vanilla adaLN(CPT-007)基础上,除从条件嵌入回归逐维 scale/shift(γ, β)外,额外回归残差门控 α(施加于 block 内每条残差连接之前);调制 MLP 输出层零初始化使 α 初始为 0,从而每个 DiT block 初始为恒等映射。名称中的“Zero” 即指这层零初始化(初始化为恒等函数的 adaLN)。

  • 条件来源:timestep t 与 class label c 的嵌入向量之和(逐元素求和,非拼接、非分别注入;§3.2 “sum of the embedding vectors of t and c”)。
  • block 内有两个残差子块(self-attention 路径与 MLP 路径),各有独立的自适应 LayerNorm,故每个 block 需要两组 (γ, β) 与两个 α(详见 Mechanism 的参数结构)。
  • 恒等初始化的先例:ResNet 系(Goyal 2017 零初始化 block 末端 BN scale γ)与 diffusion U-Net(零初始化残差连接前的末层卷积)——论文明确以此为其设计来源(§3.2)。

Mechanism

论文对 adaLN-Zero 仅作文字描述 + Figure 3 图示,未给出显式公式;以下为与论文描述一致的标准实现重建(逐条可与 §3.2 / App. A.5 对应,见 Notes)。

设 \(z = \mathrm{Emb}_t(t) + \mathrm{Emb}_c(c)\)(t 经 256 维频率嵌入 + 两层 SiLU MLP 映射到 hidden size d;c 为 d 维 label 嵌入;二者逐元素求和)。调制参数由单层线性回归:

\[(\gamma_1, \beta_1, \alpha_1, \gamma_2, \beta_2, \alpha_2) = W\,\mathrm{SiLU}(z) + b, \quad W \in \mathbb{R}^{6d \times d}\]

DiT block 为 pre-norm 残差结构,两个子块各有一个自适应 LayerNorm(elementwise affine 关闭,γ/β 由调制提供):

self-attention 子块:

\[h_1 = h + \alpha_1 \odot \mathrm{Attn}\big(\gamma_1 \odot \mathrm{LN}(h) + \beta_1\big)\]

MLP 子块:

\[h_2 = h_1 + \alpha_2 \odot \mathrm{MLP}\big(\gamma_2 \odot \mathrm{LN}(h_1) + \beta_2\big)\]

其中 \(\odot\) 为逐通道(dimension-wise)缩放,广播到全部 token;γ/β/α 均逐维。

  • 零初始化(§3.2 “initialize the MLP to output the zero-vector for all α”;§4.1 “initialize the final linear layer with zeros”):调制输出线性层零初始化 ⇒ 初始 α = 0 ⇒ 残差门关闭 ⇒ 每 block 输出 = 输入(恒等映射)。
  • 模型末端、线性 decoder 之前的最终 LayerNorm 在 adaLN 系下亦为自适应(§3.2 Transformer decoder:adaptive if using adaLN)。
  • 参数结构印证(App. A.5):adaLN-Zero 调制输出为 6×hidden(adaLN 为 4×hidden)。6 = 2 子块 × 3 参数 (γ, β, α),4 = 2 子块 × 2 参数 (γ, β)——两数之差恰好是每条残差路径新增的 α 门控,与 §3.2 的文字描述自洽。

Design Rationale

  • 恒等初始化的收益主张来自先例而非本论文新证:ResNet 监督训练中零初始化 BN scale γ 可加速大规模训练(Goyal 2017);diffusion U-Net 亦在残差前零初始化末层卷积(§3.2 引述)。
  • 机制理解:block 初始为恒等 ⇒ 训练早期网络等效更浅、残差路径的梯度不受随机初始化深层堆叠干扰。论文以“每个 block 初始为恒等函数”解释 adaLN-Zero 相对 vanilla adaLN 的显著优势(CLM-002 归因,见下)。
  • 归因边界:恒等初始化在 DiT 上的收益是论文的解释(Figure 5 推断),非独立消融实验(EVI-002 Caveats;单种子、无方差报告)。

Cost

  • Gflops:论文明言 “adaLN-Zero adds negligible Gflops to the model”(§3.2)。XL/2 实测 118.64G vs adaLN 118.56G(Table 4),差 0.08G(≈0.07%),调制的计算代价可忽略。
  • 参数量:非可忽略——调制输出宽度 4d→6d,每 block 增 2d² 权重;XL/2(N=28, d=1152)增量 ≈ 28 × 1152 × 2304 ≈ 74.4M,与 Table 4 的 adaLN 600M → adaLN-Zero 675M(+75M)吻合。即“计算可忽略、参数不可忽略”。
  • 由于 DiT 的 scaling 分析以 Gflops 为复杂度透镜(AX-7),论文视该参数增量不在复杂度讨论内;但引用消融数字时须注意四种 conditioning 设计的参数量本就不同(EVI-002)。

Empirical Role

  • CLM-002 / EVI-002:四种 conditioning 消融(in-context / cross-attention / adaLN / adaLN-Zero,DiT-XL/2 @ 400K),adaLN-Zero 质量最优且算力最省;adaLN → adaLN-Zero 的差距被论文归因于恒等初始化。
  • FRM AR-2:CLM-002 是全部 SOTA 结果的设计前提——§5 明言此后所有模型均使用 adaLN-Zero,故 DiT 的 256/512 SOTA 数值(EVI-001/EVI-004)都在该 block 设计下取得。
  • 与 CLM-012 的 CFG 效应互补:CFG 是采样端机制(CPT-003),adaLN-Zero 是前向 block 内的条件注入,二者正交叠加(CFG 数字均出自 adaLN-Zero 模型)。

Disambiguation

  • 术语路由:“adaLN” 单独出现时可能指 vanilla 机制(CPT-007)或统称含本卡的机制族;完整路由表见 DIS-002。
  • 与 vanilla adaLN(CPT-007):adaLN-Zero 是 adaLN 的特化(定义依赖基础概念)——唯一差异是残差门控 α 与调制输出零初始化;量化差异见 CLM-002/EVI-002。
  • 与 FiLM(CPT-012):回归 γ/β 的思想承自 FiLM;adaLN-Zero 增加 α 与零初始化。
  • 与 cross-attention(CPT-010)/ in-context conditioning(CPT-011):四种 conditioning 设计中的另外两种;adaLN 与 adaLN-Zero 是算力最省的两种,其中 adaLN-Zero 质量最优(CLM-002)。cross-attention 额外引入一层 cross-attn(~15% Gflops 开销),in-context 把 t/c 嵌入当额外 token 拼进序列。
  • 与 U-Net 的 zero-init:同一“block 初始为恒等”思想,施加于 transformer 残差而非卷积残差。
  • 与 DiT(CPT-001):adaLN-Zero 是 DiT block 设计轴上的选定实现;DiT 设计空间三轴(patch size / block 设计 / 模型规模)中,block 设计轴由本概念占据,其余轴见 CPT-004(patchify)与 Table 1(模型规模)。
  • 与 CFG(CPT-003):正交——CFG 是采样端机制,adaLN-Zero 是前向注入(见 Empirical Role)。
  • 与 LDM(CPT-006):正交——LDM 定义训练空间(像素 vs 隐空间),adaLN-Zero 是 backbone 内部机制,与 DiT 同处 backbone 维度。

Notes

  • 本概念目前仅由单一来源 PPR-2212.09748 定义;论文对 adaLN-Zero 仅文字
    • Figure 3 图示描述,无显式公式。
  • Mechanism 一节的方程为标准实现重建(与论文文字逐条对应):参数结构(2 子块 × 3 参数 = 6d)由 App. A.5 的 “6×/4× hidden size” 相互印证;“+75M 参数” 的推导为本库演算,与 Table 4 数字吻合。这些属于 KB 外推(unverified),不视为论文原文断言。
  • 恒等初始化收益为论文解释而非独立消融(EVI-002)。
  • 后续 DiT 谱系(Sora、Stable Diffusion 3、Flux 等对 adaLN 式调制的继承与变体)不在本库 scope,未做跨来源扩展——如需扩展属 coverage gap(D14)。

Visualization

Input Tokens Layer Norm Scale, Shift Multi-Head Self-Attention Scale ⊕ Layer Norm Scale, Shift Pointwise Feedforward Scale ⊕ Conditioning MLP
DiT block with adaLN-Zero(论文图源:Fig. 2 right——Input Tokens → Layer Norm → Multi-Head Self-Attention → Scale, Shift → Scale → ⊕ → …;Condition MLP 供 γ/β/α,双 ⊕ 残差走左走廊)

关联(31)

  • PPR-1709.07871 FiLM: Visual Reasoning with a General Conditioning Layer
  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
  • CLM-002 同配置同预算下,条件注入机制的选择对生成质量有决定性影响:adaLN-Zero 调制式注入同时最优质量与最低计算开销,优于 cross-attention 与 in-context。
  • CLM-012 CFG 大幅改善 DiT 生成质量,收益随 guidance scale 增大而递减,并伴随保真度升、多样性(recall)降的权衡;SOTA 数字均以 guidance 口径取得。
  • CLM-033 闭环 diffusion 规划的质量瓶颈在结构设计(联合生成/起点约束/导航 adaLN 专门架构)而非 diffusion 范式本身:专门设计免精修达学习型类内最好成绩,且大幅优于套壳 diffusion 方法;对规则/混合类整体优势仅经 w/ refine. 变体成立(作者主张)。
  • EVI-001 Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-009)。
  • EVI-002 Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。
  • EVI-004 Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-009)。
  • CPT-001 Diffusion Transformer (DiT)
  • CPT-003 classifier-free guidance
  • CPT-004 patchify
  • CPT-006 Latent Diffusion Model
  • CPT-007 adaptive layer norm (adaLN)
  • CPT-010 DiT cross-attention conditioning
  • CPT-011 DiT in-context conditioning
  • CPT-012 FiLM (feature-wise linear modulation)
  • VER-002 核验 CLM-002 adaLN-Zero 胜出:Table 4 四行与 Gflops/params 列逐项一致、Figure 5 排序声明一致,'同配置同预算'经审计修正。supported。
  • VER-017 条件机制核验:Q/K/V 公式(§2.5 Eq. cond_loss)与命题一致,text/class/layout/i2i 四模态有实例,与 DiT adaLN 不同机制不冲突。supported。
  • SYN-001 DiT 四种 conditioning 设计系统对比:adaLN-Zero 以可忽略算力增量取得 FID 19.47 全维最优;推导出'交互强度-质量'非单调与'算力效率优先'两条结构观察(单来源外推,显式标注)。
  • DIS-002 术语 adaLN 的两种读法路由:vanilla adaLN(CPT-007)与其零初始化特化 adaLN-Zero(CPT-002)。
  • FIG-002 DiT block with adaLN-Zero 结构图(kblayout 重绘论文 Fig. 2 right):主链 LN→MHA→Scale/Shift→⊕→LN→FF→Scale→⊕;Conditioning→MLP 四条参数线送达各 gate。
  • CPT-001 co-definer Diffusion Transformer (DiT)
  • CPT-003 co-definer classifier-free guidance
  • CPT-004 co-definer patchify
  • CPT-005 co-definer VAE decoder variants (ft-MSE / ft-EMA)
  • CPT-006 co-definer Latent Diffusion Model
  • CPT-007 co-definer adaptive layer norm (adaLN)
  • CPT-010 co-definer DiT cross-attention conditioning
  • CPT-011 co-definer DiT in-context conditioning