Research KB 登录

VER-017 Verification

条件机制核验:Q/K/V 公式(§2.5 Eq. cond_loss)与命题一致,text/class/layout/i2i 四模态有实例,与 DiT adaLN 不同机制不冲突。supported。

id
updated
type verification
claim CLM-017
result supported
basis §2.5 条件机制公式(Q/K/V 投影, τ_θ, Eq. cond_loss)+ Fig. conditioning 与命题一致;text/class/layout/i2i 在 §4.3-4.5 均有实例;与 DiT 的 adaLN 系(CPT-007/CPT-002)是不同注入机制、不冲突
checked 2026-09-03

Checks

  1. 内部一致性:命题对 cross-attention 机制的描述(Q 来自 UNet 中间特征 \(\phi_i(z_t)\),K/V 来自 \(\tau_\theta(y)\),\(\mathrm{Attention} = \mathrm{softmax}(QK^\top/\sqrt{d})\,V\),密集 i2i 退化为拼接)与 EVI-017 Result / §2.5 公式逐项一致。
  2. 证据链完整性:EVI-017 observation 精确到 §2.5 + Eq. cond_loss + Fig. conditioning + §4.3–4.5;method 载明四种条件形态(text 用 BERT+transformer、class 用 AdaIN/CA、layout 用语义图、SR/inp 用拼接+ \(\tau \equiv \mathrm{id}\))与联合优化(\(\tau_\theta\) 与 \(\epsilon_\theta\))。
  3. scope 匹配:命题限定“注入机制的通用性”(同一注意力形式横跨稀疏/稠密条件)——未把“跨模态无需任务架构”升级为“任意条件零成本”;\(\tau_\theta\) 需 per-domain 设计的边界在 EVI-017 Caveats 声明。
  4. 跨来源核对:DiT 用 adaLN-Zero(CPT-002,逐层仿射调制)做 class-conditional 注入,与 LDM 的 cross-attention(CPT-009)是不同注入机制——不构成冲突(DiT 替换 backbone 而非条件机制);CFG 规范源(PPR-2207.12598)为源桩,无 claim 可比。

Notes

“通用”限于注意力机制层的通用(K/V 来源可换),非“一个 \(\tau_\theta\) 通吃所有模态”。DiT 侧复用本源 latent 空间但换用 adaLN(CPT-007)做类条件——说明 cross-attention(CPT-009)是 LDM 的可选条件接口,不是 latent diffusion(CPT-006)的必要条件,这与 CLM-017 的表述(“给 U-Net 加装”)一致,无过度声明。

Scope Note

2026-09-07 命题按 _issues/0001 重述(定性化);本 VER 基于旧范式(数字对照)审核,投影忠实度段待 T-VERIFY 补审。

投影忠实度复核(2026-09-07)

忠实。定性化后命题的机制公式(Q/K/V 来源、\(\tau_\theta\) 的 per-domain 投影、Attention 形式、密集 i2i 退化为拼接)与四模态实例均为旧审核逐项核对项;“无需为每个任务改结构”的概括在旧审核 scope 匹配段已有限定(\(\tau_\theta\) 需 per-domain 设计、通用限于注意力机制层),未越证据。与 DiT adaLN 不同机制、不冲突的判定未变。结论不变。

关联(7)

  • PPR-2207.12598 Classifier-Free Diffusion Guidance
  • CLM-017 LDM 以通用 cross-attention 注入任意条件(τ_θ 投影 y 为 KV,UNet 中间特征为 Q),一个 backbone 承载多模态条件。
  • EVI-017 §2.5 + §4.3–4.5:cross-attention 条件机制与多模态应用(支撑 CLM-017)。
  • CPT-002 adaLN-Zero
  • CPT-006 Latent Diffusion Model
  • CPT-007 adaptive layer norm (adaLN)
  • CPT-009 Cross-attention conditioning