| CLM-002 | 同配置同预算下,条件注入机制的选择对生成质量有决定性影响:adaLN-Zero 调制式注入同时最优质量与最低计算开销,优于 cross-attention 与 in-context。 | Claim reconciled supported ppr-2212.09748 |
| CLM-003 | 模型前向 Gflops(而非参数量)主导 DiT 质量:Gflops 相近则 FID 相近,且与 FID-50K 强负相关。 | Claim reconciled supported ppr-2212.09748 |
| CLM-005 | 采样算力不能补偿模型算力:DiT 族内小模型即使以数倍单图采样算力生成,FID 仍劣于大模型的低步数采样(锚点数字见 EVI-005)。 | Claim reconciled supported ppr-2212.09748 |
| CLM-006 | 等量总训练算力下大模型更 compute-efficient;仅改 patch size 的模型对在控制训练 Gflops 后性能曲线不同。 | Claim reconciled supported ppr-2212.09748 |
| CLM-007 | DiT 对既有 U-Net diffusion 模型的质量优势不依赖 VAE decoder 选择:免重训互换 LDM 原始/ft-MSE/ft-EMA decoder(encoder 相同)后优势均保持。 | Claim reconciled supported ppr-2212.09748 |
| CLM-010 | DiT 在未调参 ADM 配方下稳定训练:恒定 lr、无 warmup/正则,全程无 loss spike。 | Claim reconciled supported ppr-2212.09748 |
| CLM-011 | patchify 标度:p 减半 → token 与 transformer Gflops 至少 ×4(注意力超线性),参数量近似不变。 | Claim reconciled supported ppr-2212.09748 |
| CLM-012 | CFG 大幅改善 DiT 生成质量,收益随 guidance scale 增大而递减,并伴随保真度升、多样性(recall)降的权衡;SOTA 数字均以 guidance 口径取得。 | Claim reconciled supported ppr-2212.09748 |
| CLM-013 | 像素空间 DM 把容量同时花在感知无关细节与语义构成上;显式剥离感知压缩给一次训练的 autoencoder、让 DM 在低维 latent 专司语义生成,是复杂度降低与细节保留之间的近最优分解(作者自评)。 | Claim reconciled supported ppr-2112.10752 |
| CLM-014 | 在预训练感知 autoencoder 的 latent 空间训扩散模型,相对同等评估条件下的像素空间扩散模型,同时显著降低训练算力与采样/推理成本,且生成质量不降反升。 | Claim reconciled supported ppr-2112.10752 |
| CLM-016 | 下采样因子 f 的选取存在数据集相关的甜区:f 过小训练进度结构性缓慢,f 过大因 first-stage 信息损失保真度早期停滞;复杂数据集甜区在 f=4/8,较简单数据可用更高 f 换采样速度。 | Claim reconciled supported ppr-2112.10752 |
| CLM-017 | LDM 以通用 cross-attention 注入任意条件(τ_θ 投影 y 为 KV,UNet 中间特征为 Q),一个 backbone 承载多模态条件。 | Claim reconciled supported ppr-2112.10752 |
| CLM-020 | likelihood-based 目标的 mode-covering 行为在 Precision/Recall 上系统性地优于 GAN(逐数据集、针对对抗基线),支持其分布覆盖优势的指标层证据;同口径下 LDM 于 CelebA-HQ 取得新 SOTA FID,其余数据集与最强 GAN/扩散竞争。 | Claim reconciled supported ppr-2112.10752 |
| CLM-021 | 密集条件 image-to-image 直接把条件拼入输入训练,conv 式条件使模型能越过训练分辨率泛化到兆像素大图。 | Claim reconciled supported ppr-2112.10752 |
| CLM-022 | 对密集条件 i2i 任务,latent 扩散配方同时给出感知质量与效率收益:(SR) LDM-SR 在感知指标上胜过专用像素扩散 SR3 与回归基线,但 PSNR/SSIM 由回归基线占先;(Inpainting) latent 化显著提吞吐并改善 FID,分布级质量超专用 SOTA 修复器 LaMa 而 LPIPS 略高。 | Claim reconciled supported ppr-2112.10752 |
| CLM-023 | LDM 上限受 first-stage AE 重建精度限制(细粒度像素任务),且迭代采样仍慢于 GAN 一步生成。 | Claim reconciled supported ppr-2112.10752 |
第 1 / 1 页