CPT-003
Concept
classifier-free guidance
| id | |
|---|---|
| updated | |
| type | concept |
| name | classifier-free guidance |
| aliases | CFG, guidance scale |
| defined-by | PPR-2212.09748 |
Definition
条件采样技术:训练时随机丢弃条件 c(替换为可学习的 null embedding ∅),采样时按下式向条件方向外推:
\[\hat{\epsilon}_\theta(x_t, c) = \epsilon_\theta(x_t, \varnothing) + s \cdot \big(\epsilon_\theta(x_t, c) - \epsilon_\theta(x_t, \varnothing)\big)\]
s > 1 为 guidance scale,s = 1 退化为标准条件采样。(以上为 DiT 论文 §2.1 的复述;canonical 定义源 Ho & Salimans arXiv:2207.12598 尚未入库——Phase 3 侧翼候选。)
Disambiguation
- 与 classifier guidance 的区别:无需外部分类器,以同模型的无条件输出为基线。
- DiT 的用法特例:guidance 仅施加于 latent 前 3/4 通道(EVI-008);等效换算 3ch scale (1+x) ≈ 4ch scale (1+¾x)。
- s 的两处口径:Table 2/3 的 cfg=1.25/1.50(评估用,3ch)与样图 caption 的 1.5–6.0(展示用,不出指标)。
关联(28)
- PPR-2105.05233 Diffusion Models Beat GANs on Image Synthesis
- PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
- PPR-2207.12598 Classifier-Free Diffusion Guidance
- PPR-2211.01095 DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models
- PPR-2212.09748 Scalable Diffusion Models with Transformers
- PPR-2510.11083 Flow Matching-Based Autonomous Driving Planning with Advanced Interactive Behavior Modeling
- FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
- FRM-2212.09748 DiT 五层重建:以 ViT 替换 latent diffusion 的 U-Net backbone、Gflops 为透镜的 scaling 研究;边界为 class-cond ImageNet 256/512。
- FRM-2501.15564 Diffusion Planner 五层重建:task redefinition 后的 ego+邻车联合轨迹生成(DiT 骨干、单一扩散损失)与 DPS 免训练 classifier guidance;断言投影 CLM-033..038(一份投影卡因 erratum 删除)。附录 C 的四个引导能量函数(式 10–13)与四条设计经验已公式化回填,供 G2DP 稀疏对比臂跨源引用。
- FRM-2605.12964 AsymFlow 五层重建:不对称速度目标 Pε−x0 与解析恢复 → 端点归约(r=0/正负号 x0-pred,r=D u-pred)→ Procrustes lift 的轨迹耦合定理 → 方差缩减微调损失(control variates + LPIPS 门控);断言投影待 G1 签发后进行。
- FRM-2605.19771 BeyondDrive 五层重建(骨架):核心对象是让模仿学习显式吸收失败——提出“安全不对称”性质(模仿误差几乎相同的两条轨迹安全性可截然不同,一条可恢复、一条致碰撞),故用流匹配的负轨迹生成器合成“安全关键但贴近专家”的硬负样本、以多样性感知采样提高失败模式覆盖,再用排斥距离损失同时吸引预测靠近专家并推离硬负样本,从而在轨迹空间建立可判别的安全边界。
- CLM-012 CFG 大幅改善 DiT 生成质量,收益随 guidance scale 增大而递减,并伴随保真度升、多样性(recall)降的权衡;SOTA 数字均以 guidance 口径取得。
- CLM-018 推理期 CFG 大幅抬升 LDM 样张质量(FID/IS 同改)而几乎不加训练成本,两设定均成立;引导后的 1.45B cross-attn 文本 LDM 与近期最强 AR/diffusion 系统同量级且参数量显著更少(论文措辞 on par,非新 SOTA)。
- EVI-008 App. A.1:3 通道 guidance(1.5)FID 2.27 vs 4 通道(1.375)2.20,近似式 3ch(1+x)≈4ch(1+¾x)(支撑 CLM-012 的口径 caveat)。
- EVI-018 主文 T2I 表 + ImageNet 主表:CFG 的推理期质量增益(支撑 CLM-018)。
- CPT-002 adaLN-Zero
- CPT-007 adaptive layer norm (adaLN)
- CPT-030 DPM-Solver++
- VER-018 CFG 核验:推理期提质(T2I 23.35→12.61、IS 19.93→26.62;ImageNet 10.56→3.60)与两表一致、非增训,机制同 CPT-003。supported。
- SYN-003 G2DP 引导谱系四支合成:机制(classifier guidance→CFG→DPS)、扩散规划(Diffuser→MotionDiffuser→Diffusion Planner→FlowPlanner/pSTL/CTG)、安全硬约束(CBF 系)、稠密网格(HYPE/TPP/NaviDiffusor);G2DP 立四支交点——把『稠密分布性网格』放到『可微+时空+入去噪循环』。
- CPT-001 co-definer Diffusion Transformer (DiT)
- CPT-002 co-definer adaLN-Zero
- CPT-004 co-definer patchify
- CPT-005 co-definer VAE decoder variants (ft-MSE / ft-EMA)
- CPT-006 co-definer Latent Diffusion Model
- CPT-007 co-definer adaptive layer norm (adaLN)
- CPT-010 co-definer DiT cross-attention conditioning
- CPT-011 co-definer DiT in-context conditioning