Research KB 登录

CPT-004 Concept

patchify

id
updated
type concept
name patchify
aliases patch embedding
defined-by PPR-2212.09748

Definition

DiT 的第一层:将空间表示(noised latent,I×I×C)线性嵌入为长度 T = (I/p)² 的 token 序列,每 token 维度 d;p 为 patch size 超参(DiT 设计空间取 \(p \in \{2,4,8\}\))。随后施加标准 ViT 正弦-余弦位置编码。

Disambiguation

  • 与 ViT 的 patch embedding 同构,但作用于 VAE latent 而非像素。
  • p 减半 → T ×4 → Gflops 至少 ×4,参数量近似不变(CLM-011):p 是“以参数量近似不变换算力”的结构性杠杆。
  • p 是 DiT 设计空间三轴(patch size / block 设计 / 模型规模)之一。

关联(14)

  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • FRM-2605.12964 AsymFlow 五层重建:不对称速度目标 Pε−x0 与解析恢复 → 端点归约(r=0/正负号 x0-pred,r=D u-pred)→ Procrustes lift 的轨迹耦合定理 → 方差缩减微调损失(control variates + LPIPS 门控);断言投影待 G1 签发后进行。
  • CLM-011 patchify 标度:p 减半 → token 与 transformer Gflops 至少 ×4(注意力超线性),参数量近似不变。
  • CPT-001 Diffusion Transformer (DiT)
  • CPT-002 adaLN-Zero
  • CPT-001 co-definer Diffusion Transformer (DiT)
  • CPT-002 co-definer adaLN-Zero
  • CPT-003 co-definer classifier-free guidance
  • CPT-005 co-definer VAE decoder variants (ft-MSE / ft-EMA)
  • CPT-006 co-definer Latent Diffusion Model
  • CPT-007 co-definer adaptive layer norm (adaLN)
  • CPT-010 co-definer DiT cross-attention conditioning
  • CPT-011 co-definer DiT in-context conditioning