CPT-008
Concept
Perceptual autoencoder (first stage)
| id | |
|---|---|
| updated | |
| type | concept |
| name | Perceptual autoencoder (first stage) |
| aliases | perceptual compression model, first-stage autoencoder, f-autoencoder |
| defined-by | PPR-2112.10752 |
Definition
LDM 两阶段框架中的感知压缩段:一个 autoencoder(encoder E + decoder D),把 RGB 图像 \(x \in \mathbb{R}^{H \times W \times 3}\) 编码为感知等价(去除高频、人眼不可辨细节)但算力显著更低的低维表示 z=E(x),其中 encoder 以下采样因子 f 缩小空间维度(z 形状 H/f × W/f × c)。训练目标为感知损失(LPIPS)+ patch-based 对抗目标(PatchGAN),确保重构落在图像流形上、避免纯像素损失(L1/L2)导致的模糊。按潜空间正则分为两变体(CPT-009 关联):KL-reg(类 VAE 轻 KL 罚)与 VQ-reg(量化层被 decoder 吸收,VQGAN 变体)。
Disambiguation
- 与 LDM(CPT-006)的关系:感知 autoencoder 是 LDM 的前半段;LDM 是包含“感知压缩 + 潜空间扩散”的完整框架,autoencoder 只负责压缩/重构,不直接负责生成。
- 与 VQGAN 的区别:本概念允许 KL(连续)或 VQ 两种正则;VQ-reg 变体“可解释为量化被 decoder 吸收的 VQGAN”,但 LDM 的 2D-conv 使其可选更低 f、重建更保真(对比见 PPR-2112.10752 firststage 表:LDM f=8 R-FID 1.14 vs DALL·E f=8 32.01)。
- 与像素空间 DDPM(ADM)的对比:ADM 无显式 first-stage(f=1,直接在像素上去噪),本概念正是 LDM 把 f 提离 1 的核心手段。
关联(11)
- PPR-006 Learning Structured Output Representation using Deep Conditional Generative Models
- PPR-2112.10752 High-Resolution Image Synthesis with Latent Diffusion Models
- FRM-2112.10752 LDM 五层重建:感知压缩 AE + 潜空间扩散的两段分解,换取训练/采样成本大降;多任务多分辨率(256²/512²→~1024²)。
- FRM-2605.12964 AsymFlow 五层重建:不对称速度目标 Pε−x0 与解析恢复 → 端点归约(r=0/正负号 x0-pred,r=D u-pred)→ Procrustes lift 的轨迹耦合定理 → 方差缩减微调损失(control variates + LPIPS 门控);断言投影待 G1 签发后进行。
- CLM-023 LDM 上限受 first-stage AE 重建精度限制(细粒度像素任务),且迭代采样仍慢于 GAN 一步生成。
- EVI-013 §1/§2.3/§2.4:感知/语义两段分解的论述与公式(支撑 CLM-013)。
- CPT-006 Latent Diffusion Model
- CPT-009 Cross-attention conditioning
- VER-013 两段分解核验:感知压缩 AE + 潜空间 DM 与 §1/§2.3/§2.4(Eq.4-5)一致,DiT FRM-2212.09748 AX-2 同向互证,scope 未超。supported。
- CPT-006 co-definer Latent Diffusion Model
- CPT-009 co-definer Cross-attention conditioning