6.6 KiB
Topic 5:近似可识别性界(定理 3)
前置知识: Topic 3:谱分解与线性可识别性 目标: 理解当理论假设只近似满足时,恢复误差如何被量化和控制
🎯 定理 3 的完整陈述
定理 3(近似可识别性): 设编码器
h满足:
- 近似对齐:
L_align(h) ≤ 2(1-ρ)n + δ(对齐损失比最优值多δ)- 近似白化:
‖Cov(h(z)) - Iₙ‖_F ≤ ε(协方差矩阵偏离单位阵ε)则存在正交矩阵
Q ∈ O(n)使得:E[‖h(z) - Qz‖²] ≤ D + (ε + D)²其中
D = δ / (2ρ(1-ρ))。
🤔 为什么需要近似版本?
定理1是精确结论:在完美条件下,h(z) = Qz。
但在实践中:
- 优化不完美:梯度下降不一定找到全局最优
- 有限样本:用有限数据估计的协方差矩阵有误差
- 模型容量:神经网络可能无法精确表示线性函数
- 非高斯数据:真实数据可能不完全满足高斯假设
定理3告诉我们:即使条件只近似满足,恢复误差也是有界的,且随误差优雅降级。
📐 两个误差参数的含义
参数 δ:对齐间隙(Alignment Gap)
δ = L_align(h) - 2(1-ρ)n ≥ 0
δ = 0:完美对齐(定理1的条件)δ > 0:对齐损失比最优值多δ
物理含义: 正样本对的嵌入有多"不相似"(超出理论最优的部分)。
参数 ε:白化误差(Whitening Error)
ε = ‖Cov(h(z)) - Iₙ‖_F
ε = 0:完美白化(嵌入是各向同性高斯)ε > 0:协方差矩阵偏离单位阵
物理含义: 嵌入分布有多"不高斯"(协方差矩阵偏离单位阵的程度)。
📐 归一化量 D 的推导
从 δ 到 D 的转换:
D = δ / (2ρ(1-ρ))
为什么要除以 2ρ(1-ρ)?
回忆定理1的证明:对齐损失的最优值是 2(1-ρ)n,而相关性的"谱间隙"(线性成分 ρ 与二次成分 ρ² 之差)是:
ρ - ρ² = ρ(1-ρ)
所以 2ρ(1-ρ) 是"每单位非线性成分对对齐损失的贡献"。除以它可以把对齐间隙 δ 转换为"非线性成分的总权重"。
📐 界的推导(简化版)
第一步:从 δ 到非线性权重
由定理1的证明,对齐损失可以写成:
L_align = 2n - 2 Σᵢ corr_i = 2n - 2 Σᵢ Σ_d w_{i,d} ρᵈ
最优值是 2(1-ρ)n(所有 w_{i,1} = 1)。
对齐间隙 δ 对应于非线性成分的总权重:
Σᵢ Σ_{d≥2} w_{i,d} ≤ δ / (2ρ(1-ρ)) = D
第二步:从非线性权重到恢复误差
非线性成分的总权重 D 直接给出恢复误差的一部分:
E[‖h(z) - Az‖²] ≤ D
其中 A 是最优线性近似。
第三步:从线性近似到正交矩阵
A 不一定是正交的(因为白化误差 ε)。从 A 到最近的正交矩阵 Q(Procrustes 问题)引入额外误差:
‖A - Q‖_F ≤ ε + D
第四步:三角不等式组合
E[‖h(z) - Qz‖²] ≤ E[‖h(z) - Az‖²] + ‖A - Q‖_F²
≤ D + (ε + D)²
📊 界的数值感受
设 ρ = 0.9,考虑不同的误差水平:
| δ(对齐间隙) | ε(白化误差) | D = δ/(2×0.9×0.1) | 界 D + (ε+D)² |
|---|---|---|---|
| 0 | 0 | 0 | 0(完美!) |
| 0.018 | 0 | 0.1 | 0.1 + 0.01 = 0.11 |
| 0.018 | 0.1 | 0.1 | 0.1 + 0.04 = 0.14 |
| 0.018 | 0.5 | 0.1 | 0.1 + 0.36 = 0.46 |
| 0.18 | 0 | 1.0 | 1.0 + 1.0 = 2.0 |
观察:
- 对齐间隙
δ是主要误差来源(通过D) - 白化误差
ε的影响是二阶的((ε+D)²中的ε) - 当
D很小时,ε的影响可以忽略
🔧 代码中的量化
在 metrics.py 中,所有界的量都被计算:
def compute_all_metrics(z, x, h, h_prime, rho, N):
# 白化误差 ε
cov_h = torch.cov(h.T)
epsilon = torch.linalg.norm(cov_h - torch.eye(N), 'fro').item()
# 对齐损失 L_h
L_h = ((h_prime - h) ** 2).sum(dim=1).mean().item()
# 对齐间隙 δ(与理论最优 2(1-ρ)·trace_cov 的差)
delta = max(L_h - 2 * (1 - rho) * trace_cov, 0.0)
# 归一化量 D
spectral_gap = 2 * rho * (1 - rho)
D_bound = delta / spectral_gap
# 近似界
approx_bound = D_bound + (epsilon + D_bound) ** 2
📈 实验验证
论文在所有实验运行中验证了定理3:
图(a)(官网): 横轴是理论界 D + (ε+D)²,纵轴是实际恢复误差。
实际误差
↑
│ ●
│ ●●
│ ●●●
│ ●●●●
│●●●●
└──────────────────→ 理论界
所有点在对角线下方(界成立)
关键发现:
- 所有运行的实际误差均低于理论界(界是有效的)
- 对齐损失
L_h是可识别性的最强预测指标 - 白化误差
ε的影响相对较小
🎯 实践含义
对训练的指导
- 优先优化对齐损失:
δ是主要误差来源,应该尽量减小 - 白化误差是次要的:
ε的影响是二阶的,不需要过度追求完美白化 - 监控 D_bound:训练时可以用
D_bound作为可识别性的代理指标
对超参数选择的指导
-
ρ的选择:ρ越大,2ρ(1-ρ)越小,D越大(对δ更敏感)ρ = 0.5时:2ρ(1-ρ) = 0.5(最大谱间隙)ρ = 0.9时:2ρ(1-ρ) = 0.18(较小谱间隙)- 实践中
ρ ∈ [0.8, 0.95]是好的选择
-
λ的选择:正则化权重影响白化误差ελ太小:白化不充分,ε大λ太大:对齐损失被忽视,δ大
🔬 Lean 4 验证
在 Approx.lean 中形式化验证了定理3的核心不等式链。
✅ 小结
- 定理3 量化了"近似满足条件时"的恢复误差
- 两个误差参数:对齐间隙
δ(主要)和白化误差ε(次要) - 界的形式:
D + (ε+D)²,其中D = δ/(2ρ(1-ρ)) - 优雅降级:误差随
δ, ε → 0连续趋向零 - 实践指导:优先减小对齐损失,白化误差是次要的
➡️ 下一步
→ Topic 6:正交不变性与最优规划——线性可识别性如何使潜空间规划与真实世界规划等价?