7.6 KiB
Topic 4:Sturm-Liouville 理论与高斯唯一性(定理 2)
前置知识: Topic 3:谱分解与线性可识别性、基础微积分(微分方程) 目标: 理解为什么高斯分布是唯一能保证线性可识别性的分布
🎯 定理 2 的完整陈述
定理 2(高斯唯一性): 在满足世界假设(独立性、平稳性、加性噪声)的所有分布中,高斯分布是唯一使 LeJEPA 实现线性可识别性的分布。
白话翻译: 定理1的结论(线性可识别性)不是对所有分布都成立的——它只对高斯分布成立。换句话说,高斯分布是"恰好合适"的分布。
🤔 为什么这个结论令人惊讶?
与经典 ICA 的对比
在线性 ICA(独立成分分析)中,结论恰好相反:
| 场景 | 高斯分布 | 非高斯分布 |
|---|---|---|
| 线性 ICA | ❌ 失败(无法分离) | ✅ 成功 |
| LeJEPA(非线性) | ✅ 成功 | ❌ 失败 |
LeJEPA 完全颠倒了 ICA 的结论!
直觉解释
- 线性 ICA 失败的原因:高斯分布的旋转不变性使得无法区分不同的旋转方向
- LeJEPA 成功的原因:正是这种旋转不变性,使得 OU 过程的谱分解(Hermite 多项式)恰好给出线性最优解
🔑 证明的核心工具:Sturm-Liouville 理论
什么是 Sturm-Liouville 问题?
Sturm-Liouville 问题是一类特殊的微分方程特征值问题:
-(p(z) φ'(z))' + q(z) φ(z) = λ w(z) φ(z)
其中 φ 是特征函数,λ 是特征值。
在 LeJEPA 的语境中: 转移算子 T[f](z) = E[f(z')|z] 的特征函数满足 Sturm-Liouville 方程。
关键联系
对于加性噪声转移 z' = m(z) + η,转移算子的特征方程为:
K · (log p(z))' · φ(z) + K · φ'(z) = -λ₁ · φ(z)
其中:
K:扩散系数(与噪声方差有关)(log p(z))':得分函数(score function)λ₁:第一非常数特征值
📐 证明路线:从仿射特征函数到高斯分布
关键问题
定理1的证明依赖于"第一特征函数是线性的"(即 φ₁(z) = z)。
定理2要问:什么分布 p 使得第一特征函数是仿射的(φ₁(z) = az + b)?
步骤 1:仿射特征函数 → 仿射得分函数
设第一特征函数是仿射的:φ₁(z) = az + b(a ≠ 0)。
代入特征方程:
K · score(z) · a = -λ₁ · (az + b)
解出得分函数:
score(z) = (log p(z))' = -(λ₁/K) · z - (λ₁ b)/(Ka)
= α · z + β
其中 α = -λ₁/K < 0(因为 λ₁ > 0, K > 0)。
结论: 仿射特征函数 → 得分函数是线性的(斜率为负)。
步骤 2:仿射得分函数 → 高斯分布
得分函数 (log p(z))' = αz + β,积分得:
log p(z) = (α/2) z² + βz + C
由于 α < 0,这是一个向下开口的抛物线,对应:
p(z) ∝ exp((α/2) z² + βz) = exp(-(z-μ)²/(2σ²))
这正是高斯分布 N(μ, σ²)!
步骤 3:反向(高斯 → 仿射特征函数)
反过来,如果 p 是高斯分布,则其 Sturm-Liouville 特征函数是 Hermite 多项式,第一个非常数特征函数是 He₁(z) = z(仿射的)。
🔄 完整的双条件定理
p 是高斯分布
⟺
第一特征函数是仿射的
⟺
LeJEPA 实现线性可识别性
Lean 4 验证(Uniqueness.lean):
theorem gaussian_uniqueness (lc : LatentComponent) :
-- if 方向:高斯 → 仿射特征函数
(IsGaussianScore lc.score →
∃ (a b : ℝ), a ≠ 0 ∧ ∀ z, K·score(z)·a = -(ev·(az+b)))
∧
-- only-if 方向:仿射特征函数 → 高斯
(∀ (a b : ℝ), a ≠ 0 →
(∀ z, K·score(z)·a = -(ev·(az+b))) →
IsGaussianScore lc.score)
🎨 直觉图示:为什么非高斯分布失败?
拉普拉斯分布(α=1)
p(z) ∝ exp(-|z|)
得分函数:(log p)' = -sign(z) (在 z≠0 处)
这是一个阶跃函数,不是线性的!
→ 第一特征函数不是仿射的
→ 线性可识别性失败
均匀分布(α→∞)
p(z) = 1/(2a) 在 [-a, a] 上
得分函数:(log p)' = 0 (在内部)
这是常数,不是线性的!
→ 第一特征函数不是仿射的
→ 线性可识别性失败
高斯分布(α=2)
p(z) ∝ exp(-z²/2)
得分函数:(log p)' = -z (线性!)
→ 第一特征函数是 He₁(z) = z(仿射)
→ 线性可识别性成立 ✓
📊 实验验证(广义正态分布族)
论文用广义正态分布(Generalized Normal)扫描形状参数 α:
p(z; α) ∝ exp(-|z/β|^α)
α = 1:拉普拉斯分布α = 2:高斯分布(唯一成功的!)α → ∞:均匀分布
实验结果(gennorm.yaml 配置):
R²(h→z) 随 α 的变化:
α=0.5 ████░░░░░░░░░░░░░░░░ ~0.5(重尾,失败)
α=1.0 ██████░░░░░░░░░░░░░░ ~0.6(拉普拉斯,失败)
α=1.5 ████████░░░░░░░░░░░░ ~0.8(接近高斯,部分成功)
α=2.0 ████████████████████ ~1.0(高斯,完全成功!)
α=3.0 ████████░░░░░░░░░░░░ ~0.8(超高斯,部分失败)
α=5.0 ██████░░░░░░░░░░░░░░ ~0.6(接近均匀,失败)
R² 在 α=2(高斯)处尖锐达到峰值,完美验证定理2。
🔗 与 ICA 理论的深层联系
为什么 ICA 和 LeJEPA 的结论相反?
| 方法 | 目标 | 高斯的角色 |
|---|---|---|
| 线性 ICA | 最大化非高斯性(kurtosis) | 高斯是"最难分离"的 |
| LeJEPA | 最大化 OU 相关性 | 高斯是"最容易识别"的 |
根本原因: ICA 利用高阶统计量(非高斯性)来分离信号;LeJEPA 利用时间结构(OU 相关性)来识别信号。这两种方法对高斯分布的"态度"完全相反。
Hyvärinen & Pajunen (1999) 的经典结论
非线性 ICA 在一般情况下是不可识别的。
LeJEPA 通过限制分布为高斯和使用时间结构,绕过了这个不可识别性结果。
⚠️ 实践含义
什么时候潜变量近似高斯?
- 中心极限定理:如果潜变量是许多独立小因素的叠加,则趋向高斯
- 宏观物理量:温度、压力等宏观量通常近似高斯
- 主成分:PCA 后的主成分在许多情况下近似高斯
什么时候不是高斯?
- 稀疏信号:自然图像的小波系数(拉普拉斯分布)
- 有界量:角度、概率值(均匀或 Beta 分布)
- 多峰分布:类别标签、离散状态
论文的建议: 对于非高斯潜变量,LeJEPA 仍然有用,但线性可识别性保证不再成立(见 Topic 5 的近似界)。
✅ 小结
- 定理2 证明高斯分布是线性可识别性的唯一充要条件
- 证明工具:Sturm-Liouville 特征值理论
- 核心链条:仿射特征函数 ⟺ 线性得分函数 ⟺ 高斯分布
- 与 ICA 的对比:LeJEPA 完全颠倒了 ICA 中高斯分布的角色
- 实验验证:广义正态分布扫描显示 R² 在 α=2 处尖锐达到峰值
➡️ 下一步
→ Topic 5:近似可识别性界——当假设只近似满足时,误差如何优雅降级?