| CFL-001 | 表面冲突:CLM-009(DiT)称'U-Net 归纳偏置对生成质量非关键,可换 ViT',CLM-015(LDM)称'2D 卷积归纳偏置对重建保真关键,容忍低压缩'。论文核实:两处'U-Net'是不同网络(second-stage 去噪 UNet vs first-stage 压缩 autoencoder),同名异物、可同真互补,提议 terminology-difference。 | Conflict |
| CLM-002 | 同配置同预算下,条件注入机制的选择对生成质量有决定性影响:adaLN-Zero 调制式注入同时最优质量与最低计算开销,优于 cross-attention 与 in-context。 | Claim reconciled supported ppr-2212.09748 |
| CLM-003 | 模型前向 Gflops(而非参数量)主导 DiT 质量:Gflops 相近则 FID 相近,且与 FID-50K 强负相关。 | Claim reconciled supported ppr-2212.09748 |
| CLM-005 | 采样算力不能补偿模型算力:DiT 族内小模型即使以数倍单图采样算力生成,FID 仍劣于大模型的低步数采样(锚点数字见 EVI-005)。 | Claim reconciled supported ppr-2212.09748 |
| CLM-006 | 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。 | Claim reconciled supported ppr-2212.09748 |
| CLM-007 | DiT 对既有 U-Net diffusion 模型的质量优势不依赖 VAE decoder 选择:免重训互换 LDM 原始/ft-MSE/ft-EMA decoder(encoder 相同)后优势均保持。 | Claim reconciled supported ppr-2212.09748 |
| CLM-009 | U-Net 归纳偏置对 diffusion 质量非关键:标准 ViT 可直接替换 U-Net backbone,并在同等评估协议下取得优于既有 U-Net-based diffusion 模型的质量。 | Claim reconciled partially-supported ppr-2212.09748 |
| CLM-010 | DiT 在未调参 ADM 配方下稳定训练:恒定 lr、无 warmup/正则,全程无 loss spike。 | Claim reconciled supported ppr-2212.09748 |
| CLM-011 | patchify 标度:p 减半 → token 与 transformer Gflops 至少 ×4(注意力超线性),参数量近似不变。 | Claim reconciled supported ppr-2212.09748 |
| CLM-012 | CFG 大幅改善 DiT 生成质量,收益随 guidance scale 增大而递减,并伴随保真度升、多样性(recall)降的权衡;SOTA 数字均以 guidance 口径取得。 | Claim reconciled supported ppr-2212.09748 |
| CLM-013 | 像素空间 DM 把容量同时花在感知无关细节与语义构成上;显式剥离感知压缩给一次训练的 autoencoder、让 DM 在低维 latent 专司语义生成,是复杂度降低与细节保留之间的近最优分解(作者自评)。 | Claim reconciled supported ppr-2112.10752 |
| CLM-014 | 在预训练感知 autoencoder 的 latent 空间训扩散模型,相对同等评估条件下的像素空间扩散模型,同时显著降低训练算力与采样/推理成本,且生成质量不降反升。 | Claim reconciled supported ppr-2112.10752 |
| CLM-015 | LDM 全 2D-conv 流程(conv AE + conv DM)可容忍比 1D-AR tokenize 更温和的压缩且重建更保真;优势集中在低压缩区间(f=8 显著优于 DALL·E,f=16 与 VQGAN 相当)。 | Claim reconciled partially-supported ppr-2112.10752 |
| CLM-016 | 下采样因子 f 的选取存在数据集相关的甜区:f 过小训练进度结构性缓慢,f 过大因 first-stage 信息损失保真度早期停滞;复杂数据集甜区在 f=4/8,较简单数据可用更高 f 换采样速度。 | Claim reconciled supported ppr-2112.10752 |
| CLM-017 | LDM 以通用 cross-attention 注入任意条件(τ_θ 投影 y 为 KV,UNet 中间特征为 Q),一个 backbone 承载多模态条件。 | Claim reconciled supported ppr-2112.10752 |
| CLM-018 | 推理期 CFG 大幅抬升 LDM 样张质量(FID/IS 同改)而几乎不加训练成本,两设定均成立;引导后的 1.45B cross-attn 文本 LDM 与近期最强 AR/diffusion 系统同量级且参数量显著更少(论文措辞 on par,非新 SOTA)。 | Claim reconciled partially-supported ppr-2112.10752 |
| CLM-020 | likelihood-based 目标的 mode-covering 行为在 Precision/Recall 上系统性地优于 GAN(逐数据集、针对对抗基线),支持其分布覆盖优势的指标层证据;同口径下 LDM 于 CelebA-HQ 取得新 SOTA FID,其余数据集与最强 GAN/扩散竞争。 | Claim reconciled supported ppr-2112.10752 |
| CLM-021 | 密集条件 image-to-image 直接把条件拼入输入训练,conv 式条件使模型能越过训练分辨率泛化到兆像素大图。 | Claim reconciled supported ppr-2112.10752 |
| CLM-022 | 对密集条件 i2i 任务,latent 扩散配方同时给出感知质量与效率收益:(SR) LDM-SR 在感知指标上胜过专用像素扩散 SR3 与回归基线,但 PSNR/SSIM 由回归基线占先;(Inpainting) latent 化显著提吞吐并改善 FID,分布级质量超专用 SOTA 修复器 LaMa 而 LPIPS 略高。 | Claim reconciled supported ppr-2112.10752 |
| CLM-023 | LDM 上限受 first-stage AE 重建精度限制(细粒度像素任务),且迭代采样仍慢于 GAN 一步生成。 | Claim reconciled supported ppr-2112.10752 |
| CLM-026 | nuPlan 训练的模型零样本迁移 interPlan:相对共享生成管线的 Diffusion Planner 大幅领先,增益集中于安全维度(碰撞避免、TTC),progress/speed-limit 类项持平或微降;优势依场景类型非全域均匀。 | Claim extracted unverified ppr-2606.26017 |
| CLM-027 | 零样本迁移真实无人机记录的密集城市交通(DeepScenario,NR):安全与路线推进增益保持,碰撞避免与推进维度大幅超过 Diffusion Planner、推进维度反超规则基线 PDM-Closed;drivable area 与 driving direction 非最优。 | Claim extracted unverified ppr-2606.26017 |
| CLM-031 | 去掉邻车历史输入的 history-free 变体在 reactive/interactive 闭环下反而更优,且加事后规则精修后的增益依赖远小于稀疏引导对照(作者推断);该优势严格限于 reactive/interactive 设定,NR 下不成立。 | Claim extracted unverified ppr-2606.26017 |
| CLM-033 | 闭环 diffusion 规划的质量瓶颈在结构设计(联合生成/起点约束/导航 adaLN 专门架构)而非 diffusion 范式本身:专门设计免精修达学习型类内最好成绩,且大幅优于套壳 diffusion 方法;对规则/混合类整体优势仅经 w/ refine. 变体成立(作者主张)。 | Claim extracted unverified ppr-2501.15564 |
| CLM-034 | 把规划与预测统一重定义为 future trajectory generation(ego 与 M 辆邻车同一扩散损失联合生成)后,协同行为由联合分布建模自然涌现,无需额外损失函数或专用子模块——从架构推导+定性案例+M 消融旁证,非严格归因(作者推断)。 | Claim extracted unverified ppr-2501.15564 |
| CLM-035 | 训练后行为对齐可经 DPS 免训练实现:能量重加权目标 p0 ∝ q0·e^{−E} 下,用 μ_θ 近似后验期望直接过可微能量函数取梯度修正分数,免 classifier 训练;多种能量函数(目标速度/舒适/碰撞/可行驶区)推理期自由组合(案例级证据,无量化消融)。 | Claim extracted unverified ppr-2501.15564 |
| CLM-037 | 数据管线各件是独立承重件:数据增强、未来轨迹插值、z-score 归一化各自剔除均显著降分;ego 当前状态含速度/加速度会诱发 shortcut 而损害规划,直接剔除优于 state-dropout 缓解——shortcut 机制解释是作者叙述,非消融隔离的结论。 | Claim extracted unverified ppr-2501.15564 |
| CLM-038 | 无基准特化组件的规划器跨驾驶风格迁移保持:配送车(保守风格、非机动车道、密集交互)数据集上重训后取得最高闭环分,而含 nuPlan 特化设计(参考线、crosswalk 适配)的基线(PDM/GameFormer/PLUTO)掉分——迁移优势归因依赖作者解释,未经消融隔离。 | Claim extracted unverified ppr-2501.15564 |
| CPT-001 | 以标准 ViT 为 backbone 的潜空间去噪扩散模型,区别于 U-Net backbone 的 DDPM(ADM/LDM 系列)。 | Concept |
| CPT-002 | DiT 条件注入机制:adaLN + 残差门控 α + 零初始化,使每个 DiT block 初始为恒等映射。 | Concept |
| CPT-003 | 条件采样技术:以同模型无条件输出为基线,用 scale s 向条件方向外推 ε 预测。 | Concept |
| CPT-004 | DiT 第一层:把 noised latent 线性嵌入为 T=(I/p)² 个 token,p 为 patch size 超参。 | Concept |
| CPT-005 | DiT 所用 VAE 解码器三选一(original/ft-MSE/ft-EMA),encoder 相同可免重训互换。 | Concept |
| CPT-006 | 在 VAE 隐空间(而非像素空间)训练 diffusion 的两阶段框架;DiT 的模型即 LDM。 | Concept |
| CPT-007 | DiT 四种 conditioning 设计之一:以 t/c 嵌入之和回归 γ/β 的自适应 LayerNorm,token 无关。 | Concept |
| CPT-008 | LDM 感知压缩段:autoencoder 把像素压成低维感知等价表示 z=E(x),encoder 以下采样因子 f 缩小空间。 | Concept |
| CPT-009 | LDM 通用 cross-attention 条件机制:τ_θ 把任意条件投影为 Key/Value,注入扩散 U-Net。 | Concept |
| CPT-010 | DiT 四种 conditioning 设计之一:t/c 嵌入拼成 2-token 序列,block 内 self-attention 后追加 cross-attention 层;token 级交互但算力最贵(+15% Gflops),质量居中、劣于 adaLN-Zero。 | Concept |
| CPT-011 | DiT 四种 conditioning 设计之一:t/c 嵌入作为两个额外 token 拼入输入序列,block 零修改;质量最差(FID 35.24)但 Gflops 增量可忽略。 | Concept |
| CPT-012 | 条件调制机制原始出处:FiLM generator 从条件回归逐特征仿射参数 (γ, β),对 FiLM-ed 网络中间特征做逐特征仿射调制;adaLN(CPT-007)是该模式在 transformer LayerNorm 上的实例化。 | Concept |
| DIS-001 | 术语 cross-attention 的双 referent 路由:LDM 通用条件接口(CPT-009)与 DiT block 设计变体(CPT-010)。 | Disambiguation |
| DIS-002 | 术语 adaLN 的两种读法路由:vanilla adaLN(CPT-007)与其零初始化特化 adaLN-Zero(CPT-002)。 | Disambiguation |
| EVI-001 | Table 2/§5.1/App.A.1:DiT-XL/2-G 256 FID-50K 2.27(sFID 4.60/IS 278.24),3 通道 guidance 口径,优于 LDM-4-G 3.60 与 StyleGAN-XL 2.30(支撑 CLM-009)。 | Evidence ppr-2212.09748 |
| EVI-002 | Table 4/Figure 5:XL/2 @400K adaLN-Zero FID 19.47 最低(<adaLN 25.21<cross-attn 26.14<in-context 35.24),排序训练全程保持(支撑 CLM-002)。 | Evidence ppr-2212.09748 |
| EVI-003 | Figure 8/6 + Table 4:12 变体 Gflops-FID 强负相关;异构同 Gflops 的 S/2 68.40 vs B/4 68.38 相近、缩小 p 单调改善(支撑 CLM-003)。 | Evidence ppr-2212.09748 |
| EVI-004 | Table 3/§5.1:DiT-XL/2-G 512 FID-50K 3.04(sFID 5.02/IS 240.82),优于全部 diffusion 但未超 StyleGAN-XL 2.41(支撑 CLM-009)。 | Evidence ppr-2212.09748 |
| EVI-005 | Figure 10/§5.2:小模型多步采样追不平大模型(80.7 Tflops@1000 步 FID 25.9 vs 15.2 Tflops@128 步 23.7),采样算力不可替代模型算力(支撑 CLM-005)。 | Evidence ppr-2212.09748 |
| EVI-006 | Figure 9/§4.2:等训练算力下大模型 FID 更低;XL/2 约 10^10 Gflops 后反超 XL/4(训练算力效率,支撑 CLM-006)。 | Evidence ppr-2212.09748 |
| EVI-007 | Table 5/§A.4:decoder original/ft-MSE/ft-EMA FID 2.46/2.30/2.27,encoder 相同免重训互换,差异有限均优于此前的 diffusion(支撑 CLM-007)。 | Evidence ppr-2212.09748 |
| EVI-008 | App. A.1:3 通道 guidance(1.5)FID 2.27 vs 4 通道(1.375)2.20,近似式 3ch(1+x)≈4ch(1+¾x)(支撑 CLM-012 的口径 caveat)。 | Evidence ppr-2212.09748 |