Research KB 登录

EVI-017 Evidence

§2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。

id
updated
type evidence
claims CLM-017
source PPR-2112.10752
observation §2.5 Conditioning Mechanisms(Eq. cond_loss, cross-attention 公式 Q/K/V, Fig. conditioning)+ §4.3–§4.5 的多模态条件应用(text/class/layout/SR/inpainting)
method domain-specific encoder τ_θ 把条件 y 投影为 M×d_τ 的 token 序列;cross-attention:Q=W_Q·φ_i(z_t)(来自 UNet 在噪声 latent 上的中间特征),K=W_K·τ_θ(y),V=W_V·τ_θ(y);L_simpleLCM=||ε−ε_θ(z_t,t,τ_θ(y))||²,τ_θ 与 ε_θ 联合优化。对密集条件(SR/inpainting)则把 y 与 z_t 的通道拼接、τ_θ 取恒等。
scope text(BERT/CLIP, LAION-400M 1.45B), class(ImageNet), layout(OpenImages/COCO), SR/inpainting(concat, f=4); f=4..8

Result

同一个 cross-attention(CPT-009)注意力算子 \(\mathrm{Attention}(Q,K,V) = \mathrm{softmax}(QK^\top / \sqrt{d})\,V\),通过改变 K/V 的来源(\(\tau_\theta(y)\))即可接入不同模态:

  • 文本:y=prompt,\(\tau_\theta\) 用 BERT tokenizer + transformer,在 LAION-400M 训 1.45B KL-LDM(§4.3.1,Fig. text2img_samples)。
  • 类别:y=class label,经 AdaIN/CA 注入(class-cond ImageNet)。
  • 布局:y=bounding box/语义布局,OpenImages 训、COCO 微调(补充 Sec. bboxtoimage)。
  • SR/inpainting:y=低清图/mask,与 \(z_t\) 通道拼接、\(\tau_\theta \equiv \mathrm{id}\)(§4.4/§4.5)。

Caveats

\(\tau_\theta\) 的“expert”选型是任务依赖的自由度:文本用(未 mask 的)transformer,类标签用 AdaIN/CA,SR/inpainting 退化为恒等+拼接。这说明“通用”是注意力机制层的通用,而具体 y→token 的编码仍需 per-domain 设计。Fig. conditioning 是机制示意(非定量)。与 DiT 侧的关系:DiT 把该 LDM 框架内的 U-Net backbone 换成 ViT,但 cross-attention 条件方式(尤其 text/CA)沿用——故 DiT 的 CFG/text 条件可在本源的 §2.5 找到出处。

关联(15)

  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • CLM-017 LDM 以通用 cross-attention 注入任意条件(τ_θ 投影 y 为 KV,UNet 中间特征为 Q),一个 backbone 承载多模态条件。
  • CPT-009 Cross-attention conditioning
  • VER-017 条件机制核验:Q/K/V 公式(§2.5 Eq. cond_loss)与命题一致,text/class/layout/i2i 四模态有实例,与 DiT adaLN 不同机制不冲突。supported。
  • EVI-013 co-source §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。
  • EVI-014 co-source Tab.13 compute_vs_fid + 主表:LDM-4-G 271 vs ADM 916 V100-day、0.4 vs 0.12 samples/s、FID 3.60/3.95 vs 10.94(支撑 CLM-014)。
  • EVI-015 co-source Tab.423 firststage:matched 重建指标对比 VQGAN/DALL·E(支撑 CLM-015)。
  • EVI-016 co-source §4.1 + Fig. cin_traincourse/speedplot:f 消融的训练/采样曲线(支撑 CLM-016)。
  • EVI-018 co-source 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
  • EVI-019 co-source 主文 T2I 对比表 + §4.3.1:1.45B 文本条件 LDM 对比 AR/diffusion(支撑 CLM-018 第二子命题)。
  • EVI-020 co-source 无条件合成表:LDM 对 GAN/扩散基线的 FID/Precision/Recall(支撑 CLM-020)。
  • EVI-021 co-source §4.3.2 + 大图样例:越分辨率泛化到 ~1024²/兆像素(支撑 CLM-021)。
  • EVI-022 co-source §4.4/4.5 + Tab. srtable/inpainting:SR 与 inpainting 的高质高效结果(支撑 CLM-022)。
  • EVI-023 co-source §10 Limitations + Fig. firststagecomparison:AE 重建瓶颈与迭代采样局限(支撑 CLM-023)。