Research KB 登录

CPT-003 Concept

classifier-free guidance

id
updated
type concept
name classifier-free guidance
aliases CFG, guidance scale
defined-by PPR-2212.09748

Definition

条件采样技术:训练时随机丢弃条件 c(替换为可学习的 null embedding ∅),采样时按下式向条件方向外推:

\[\hat{\epsilon}_\theta(x_t, c) = \epsilon_\theta(x_t, \varnothing) + s \cdot \big(\epsilon_\theta(x_t, c) - \epsilon_\theta(x_t, \varnothing)\big)\]

s > 1 为 guidance scale,s = 1 退化为标准条件采样。(以上为 DiT 论文 §2.1 的复述;canonical 定义源 Ho & Salimans arXiv:2207.12598 尚未入库——Phase 3 侧翼候选。)

Disambiguation

  • 与 classifier guidance 的区别:无需外部分类器,以同模型的无条件输出为基线。
  • DiT 的用法特例:guidance 仅施加于 latent 前 3/4 通道(EVI-008);等效换算 3ch scale (1+x) ≈ 4ch scale (1+¾x)。
  • s 的两处口径:Table 2/3 的 cfg=1.25/1.50(评估用,3ch)与样图 caption 的 1.5–6.0(展示用,不出指标)。

关联(28)

  • PPR-2105.05233 Diffusion Models Beat GANs on Image Synthesis
  • PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
  • PPR-2207.12598 Classifier-Free Diffusion Guidance
  • PPR-2211.01095 DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models
  • PPR-2212.09748 Scalable Diffusion Models with Transformers
  • PPR-2510.11083 Flow Matching-Based Autonomous Driving Planning with Advanced Interactive Behavior Modeling
  • FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
  • FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
  • FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
  • FRM-2605.12964 AsymFlow 五层重建:不对称速度目标 Pε−x0 与解析恢复 → 端点归约(r=0/正负号 x0-pred,r=D u-pred)→ Procrustes lift 的轨迹耦合定理 → 方差缩减微调损失(control variates + LPIPS 门控);断言投影待 G1 签发后进行。
  • FRM-2605.19771 BeyondDrive 五层重建(骨架):核心对象是让模仿学习显式吸收失败——提出“安全不对称”性质(模仿误差几乎相同的两条轨迹安全性可截然不同,一条可恢复、一条致碰撞),故用流匹配的负轨迹生成器合成“安全关键但贴近专家”的硬负样本、以多样性感知采样提高失败模式覆盖,再用排斥距离损失同时吸引预测靠近专家并推离硬负样本,从而在轨迹空间建立可判别的安全边界。
  • CLM-012 CFG 大幅改善 DiT 生成质量,收益随 guidance scale 增大而递减,并伴随保真度升、多样性(recall)降的权衡;SOTA 数字均以 guidance 口径取得。
  • CLM-018 推理期 CFG 大幅抬升 LDM 样张质量(FID/IS 同改)而几乎不加训练成本,两设定均成立;引导后的 1.45B cross-attn 文本 LDM 与近期最强 AR/diffusion 系统同量级且参数量显著更少(论文措辞 on par,非新 SOTA)。
  • EVI-008 App. A.1:3 通道 guidance(1.5)FID 2.27 vs 4 通道(1.375)2.20,近似式 3ch(1+x)≈4ch(1+¾x)(支撑 CLM-012 的口径 caveat)。
  • EVI-018 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
  • CPT-002 adaLN-Zero
  • CPT-007 adaptive layer norm (adaLN)
  • CPT-030 DPM-Solver++
  • VER-018 CFG 核验:推理期提质(T2I 23.35→12.61、IS 19.93→26.62;ImageNet 10.56→3.60)与两表一致、非增训,机制同 CPT-003。supported。
  • SYN-003 G2DP 引导谱系四支合成:机制(classifier guidance→CFG→DPS)、扩散规划(Diffuser→MotionDiffuser→Diffusion Planner→FlowPlanner/pSTL/CTG)、安全硬约束(CBF 系)、稠密网格(HYPE/TPP/NaviDiffusor);G2DP 立四支交点——把『稠密分布性网格』放到『可微+时空+入去噪循环』。
  • CPT-001 co-definer Diffusion Transformer (DiT)
  • CPT-002 co-definer adaLN-Zero
  • CPT-004 co-definer patchify
  • CPT-005 co-definer VAE decoder variants (ft-MSE / ft-EMA)
  • CPT-006 co-definer Latent Diffusion Model
  • CPT-007 co-definer adaptive layer norm (adaLN)
  • CPT-010 co-definer DiT cross-attention conditioning
  • CPT-011 co-definer DiT in-context conditioning