CPT-004
Concept
patchify
| id | |
|---|---|
| updated | |
| type | concept |
| name | patchify |
| aliases | patch embedding |
| defined-by | PPR-2212.09748 |
Definition
DiT 的第一层:将空间表示(noised latent,I×I×C)线性嵌入为长度 T = (I/p)² 的 token 序列,每 token 维度 d;p 为 patch size 超参(DiT 设计空间取 \(p \in \{2,4,8\}\))。随后施加标准 ViT 正弦-余弦位置编码。
Disambiguation
- 与 ViT 的 patch embedding 同构,但作用于 VAE latent 而非像素。
- p 减半 → T ×4 → Gflops 至少 ×4,参数量近似不变(CLM-011):p 是“以参数量近似不变换算力”的结构性杠杆。
- p 是 DiT 设计空间三轴(patch size / block 设计 / 模型规模)之一。
关联(14)
- PPR-2212.09748 Scalable Diffusion Models with Transformers
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- FRM-2605.12964 AsymFlow 五层重建:不对称速度目标 Pε−x0 与解析恢复 → 端点归约(r=0/正负号 x0-pred,r=D u-pred)→ Procrustes lift 的轨迹耦合定理 → 方差缩减微调损失(control variates + LPIPS 门控);断言投影待 G1 签发后进行。
- CLM-011 patchify 标度:p 减半 → token 与 transformer Gflops 至少 ×4(注意力超线性),参数量近似不变。
- CPT-001 Diffusion Transformer (DiT)
- CPT-002 adaLN-Zero
- CPT-001 co-definer Diffusion Transformer (DiT)
- CPT-002 co-definer adaLN-Zero
- CPT-003 co-definer classifier-free guidance
- CPT-005 co-definer VAE decoder variants (ft-MSE / ft-EMA)
- CPT-006 co-definer Latent Diffusion Model
- CPT-007 co-definer adaptive layer norm (adaLN)
- CPT-010 co-definer DiT cross-attention conditioning
- CPT-011 co-definer DiT in-context conditioning