CLM-011
Claim
patchify 标度:p 减半 → token 与 transformer Gflops 至少 ×4(注意力超线性),参数量近似不变。
| id | |
|---|---|
| type | claim |
| source | PPR-2212.09748 |
| scope | DiT architecture (patchify on I×I×C latents, T=(I/p)^2); configs S/B/L/XL x p in {8,4,2} at 256x256 (I=32) |
| epistemic | supported |
| lifecycle | RECONCILED |
| updated |
Proposition
patchify(CPT-004)的结构性标度:patch size p 减半使 token 数 T=(I/p)² 增至四倍、transformer Gflops 至少增至四倍(注意力项超线性),而参数量近似不变(实测略降)——p 是“以参数量近似不变换算力”的结构杠杆。
Evidence refs
Notes
可推导命题(由 patchify 定义 + transformer 前向构成推出),Table 1/4 为数值确认。此 claim 是 CLM-003(Gflops 而非参数量)论证结构的前提:参数量固定对照来自 p 轴。实测四倍率略超 4×(如 DiT-S:0.36→1.41→6.06G,比率 3.9×/4.3×),超线性部分来自注意力对 T 的二次依赖。
关联(15)
- PPR-2212.09748 Scalable Diffusion Models with Transformers
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- CLM-003 模型前向 Gflops(而非参数量)主导 DiT 质量:Gflops 相近则 FID 相近,且与 FID-50K 强负相关。
- EVI-011 §3.2 + Table 1/4:p 减半时参数量近似不变(S 33M 等)、Gflops ≥4×(S 0.36→1.41→6.06),验证 patchify 标度(支撑 CLM-011/TH-1)。
- CPT-004 patchify
- VER-011 核验 CLM-011 patchify 标度:推导链(patchify→T×4→Gflops≥×4、参数不变)与 §3.2 一致,Table 4 实测 3.9–4.3× 逐行核对。supported。
- SYN-002 三源合成:diffusion 管线三段可分解改造——LDM 表示层(latent 感知压缩)、DiT 骨干层(ViT 替换 + Gflops 标度)、G2DP 采样层(推理期引导插件);三论文是时间上的实际组合链(DiT 复用 LDM first-stage,G2DP 用 DiT 骨干),层独立性判断 CLM-013/009/032 解释组合可行性。
- CLM-002 co-source 同配置同预算下,条件注入机制的选择对生成质量有决定性影响:adaLN-Zero 调制式注入同时最优质量与最低计算开销,优于 cross-attention 与 in-context。
- CLM-003 co-source 模型前向 Gflops(而非参数量)主导 DiT 质量:Gflops 相近则 FID 相近,且与 FID-50K 强负相关。
- CLM-005 co-source 采样算力不能补偿模型算力:DiT 族内小模型即使以数倍单图采样算力生成,FID 仍劣于大模型的低步数采样(锚点数字见 EVI-005)。
- CLM-006 co-source 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。
- CLM-007 co-source DiT 对既有 U-Net diffusion 模型的质量优势不依赖 VAE decoder 选择:免重训互换 LDM 原始/ft-MSE/ft-EMA decoder(encoder 相同)后优势均保持。
- CLM-009 co-source U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone,并在同等评估协议下取得优于既有 U-Net-based diffusion 模型的质量。
- CLM-010 co-source DiT 在未调参 ADM 配方下稳定训练:恒定 lr、无 warmup/正则,全程无 loss spike。
- CLM-012 co-source CFG 大幅改善 DiT 生成质量,收益随 guidance scale 增大而递减,并伴随保真度升、多样性(recall)降的权衡;SOTA 数字均以 guidance 口径取得。