SYN-001
Synthesis
DiT 四种 conditioning 设计系统对比:adaLN-Zero 以可忽略算力增量取得 FID 19.47 全维最优;推导出'交互强度-质量'非单调与'算力效率优先'两条结构观察(单来源外推,显式标注)。
| id | |
|---|---|
| updated | |
| type | synthesis |
| inputs | CLM-002 |
Structure
单来源(PPR-2212.09748)内同族设计的系统对比——D7 修订后“跨来源为建议性要求”的首个实例。输入 Claim:CLM-002(消融结果,EVI-002 承载数字);参与概念:CPT-011 / CPT-010 / CPT-007 / CPT-002;术语路由:DIS-001 / DIS-002。
| 设计 | CPT | 机制(条件注入方式) | Gflops | 参数 | FID-50K @400K |
|---|---|---|---|---|---|
| in-context | CPT-011 | t/c 嵌入拼入序列,self-attention 内融合 | 119.37 | 449M | 35.24 |
| cross-attention | CPT-010 | 2-token K/V + 独立交叉注意力层 | 137.62 | 598M | 26.14 |
| adaLN | CPT-007 | token 无关逐维仿射(γ/β 回归) | 118.56 | 600M | 25.21 |
| adaLN-Zero | CPT-002 | adaLN + 残差门控 α + 零初始化恒等 | 118.64 | 675M | 19.47 |
数字均出自 EVI-002(Table 4 + Figure 5;XL/2、无 guidance、ft-MSE decoder)。排序在训练全程保持。
派生观察(KB 外推,unverified——不回写为论文断言)
- 交互强度-质量非单调:条件-特征交互最强的 cross-attention(token 级)劣于 token 无关的 adaLN 系;在 DiT 的 class-conditional 设定下,条件通路的算力效率与恒等初始化比交互表达能力更关键。此为跨四设计的结构性解读,论文只给出逐对比较,未做此抽象。
- 参数量与质量无单调关系:最省参数的 in-context(449M)最差,最多参数的 adaLN-Zero(675M)最好;但四设计参数差源自机制本身(调制宽度 4d vs 6d、附加层),不能据此推断“加参数即提质”——该推断属 CLM-003/ CLM-006 的 Gflops scaling 轴,不在本对比 scope 内。
- 质量差距的两段归因:adaLN → adaLN-Zero(25.21→19.47)归因于零初始化恒等(论文解释、非独立消融,EVI-002 Caveats);其余排序差距论文未归因。
Consensus / Disagreement / Gaps
- 共识(单来源内):adaLN-Zero 质量最优且算力最省之一,§5 选定为此后全部模型的设计;CLM-002 是 SOTA 结果(EVI-001/EVI-004)的设计前提(FRM AR-2)。
- 争议:无——输入仅一条 Claim,无冲突进入本整合(CFL-001 属 LDM 侧术语问题,不涉及本对比)。
- 空白:①单一规模(XL/2)单种子、无方差(EVI-002 Caveats);②四设计 Gflops/参数量不同,是“同配置同预算”而非“同规模”对比;③条件机制的跨来源演化(FiLM(CPT-012,PPR-1709.07871)→ adaLN → 各后续谱系)未 ingest,属 coverage gap(D14)——扩展时本卡应升级为跨来源对比。
关联(17)
- PPR-1709.07871 FiLM: Visual Reasoning with a General Conditioning Layer
- PPR-2212.09748 Scalable Diffusion Models with Transformers
- CLM-002 同配置同预算下,条件注入机制的选择对生成质量有决定性影响:adaLN-Zero 调制式注入同时最优质量与最低计算开销,优于 cross-attention 与 in-context。
- CLM-003 模型前向 Gflops(而非参数量)主导 DiT 质量:Gflops 相近则 FID 相近,且与 FID-50K 强负相关。
- CLM-006 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。
- EVI-001 Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-009)。
- EVI-002 Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。
- EVI-004 Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-009)。
- CPT-002 adaLN-Zero
- CPT-007 adaptive layer norm (adaLN)
- CPT-010 DiT cross-attention conditioning
- CPT-011 DiT in-context conditioning
- CPT-012 FiLM (feature-wise linear modulation)
- CFL-001 表面冲突:CLM-009(DiT)称'U-Net 归纳偏置对生成质量非关键,可换 ViT',CLM-015(LDM)称'2D 卷积归纳偏置对重建保真关键,容忍低压缩'。论文核实:两处'U-Net'是不同网络(second-stage 去噪 UNet vs first-stage 压缩 autoencoder),同名异物、可同真互补,提议 terminology-difference。
- DIS-001 术语 cross-attention 的双 referent 路由:LDM 通用条件接口(CPT-009)与 DiT block 设计变体(CPT-010)。
- DIS-002 术语 adaLN 的两种读法路由:vanilla adaLN(CPT-007)与其零初始化特化 adaLN-Zero(CPT-002)。
- SYN-002 co-inputs 三源合成:diffusion 管线三段可分解改造——LDM 表示层(latent 感知压缩)、DiT 骨干层(ViT 替换 + Gflops 标度)、G2DP 采样层(推理期引导插件);三论文是时间上的实际组合链(DiT 复用 LDM first-stage,G2DP 用 DiT 骨干),层独立性判断 CLM-013/009/032 解释组合可行性。