- Introduced a comprehensive lecture plan for the four main theorems in LeJEPA, including knowledge dependency graphs, detailed outlines for each topic, and corresponding Lean 4 files for formal verification. - Created a summary document encapsulating the core insights and mathematical structures of the four theorems, emphasizing their interdependencies and implications in the context of LeJEPA.
17 KiB
专题 IV:Sturm-Liouville 理论与高斯唯一性(定理2)
前置知识: 专题 III:谱分解与线性可识别性、微分方程(Sturm-Liouville理论)、概率论(得分函数) 目标: 严格证明高斯分布是唯一使线性可识别性成立的分布 对应 Lean 4:
Uniqueness.lean(零sorry)
🎯 定理2的完整陈述与证明定位
为什么需要定理2?
定理1证明了:如果世界是高斯的,那么 LeJEPA 实现线性可识别性。
定理2要证明:只有高斯分布才能使 LeJEPA 实现线性可识别性。
两者结合,得到充要条件:
\boxed{\text{高斯世界} \iff \text{线性可识别性}}
定理2(高斯唯一性)的完整陈述
定理 2.1(高斯唯一性)
在满足世界假设(独立性、平稳性、加性噪声 $z' = m(z) + \eta$)的所有分布中,高斯分布是唯一使 LeJEPA 实现线性可识别性的分布。
即:
\boxed{p \text{ 是高斯分布} \iff \mathcal{L}_{\text{align}}(h) = 2(1-\rho)n \implies h(z) = Qz}
白话翻译: 定理1的结论(线性可识别性)不是对所有分布都成立的——它只对高斯分布成立。换句话说,高斯分布是"恰好合适"的分布(Goldilocks distribution)。
§1 与经典 ICA 的对比:为什么这个结论令人惊讶?
1.1 ICA vs LeJEPA:高斯角色的完全颠倒
| 方法 | 目标 | 高斯分布的角色 |
|---|---|---|
| 线性 ICA(FastICA、JADE) | 最大化非高斯性(kurtosis),分离独立成分 | ❌ 失败:无法区分旋转方向 |
| LeJEPA(非线性 + 时间结构) | 最大化 OU 相关性,实现线性可识别性 | ✅ 成功:唯一使线性可识别成立的分布 |
1.2 ICA失败的原因(旋转不变性)
在线性 ICA中,假设观测 x = As 其中 s 是独立同分布(i.i.d.)的源信号。
目标: 从 x 中恢复出 $s$(或等价类:排列 + 缩放)。
高斯分布的问题: 若 $s \sim \mathcal{N}(0, I)$,则 $x = As \sim \mathcal{N}(0, AA^\top)$。
由于高斯分布的旋转不变性:对任意正交矩阵 $Q$,Qx \sim \mathcal{N}(0, AA^\top) 也是高斯的。因此无法区分不同的旋转方向 $A$。
结论: ICA 利用高阶统计量(非高斯性)来分离信号;若源是高斯的,ICA 失败。
1.3 LeJEPA成功的原因(Mehler公式)
在 LeJEPA中,假设潜变量 z 是高斯的,正样本对由 OU 过程生成:
z' = \rho z + \sqrt{1-\rho^2}\eta
关键: OU 过程的谱分解(Mehler公式)在 Hermite多项式基下具有解析形式:
\mathbb{E}[He_\alpha(z') He_\beta(z)] = \delta_{\alpha\beta} \rho^{|\alpha|} |\alpha|!
这导致:$\text{corr}i = \sum_d w{i,d} \rho^d$,其中线性成分($d=1$)的贡献最大($\rho^1 = \rho > \rho^2 > \ldots$)。
结论: 高斯分布的旋转不变性,恰好使 Mehler公式给出线性最优解。
§2 证明的核心工具:Sturm-Liouville理论
2.1 Sturm-Liouville问题的定义
定义 2.1(Sturm-Liouville问题)
标准 SL问题是以下二阶线性微分方程的特征值问题:
\boxed{-\frac{d}{dz}\left[p(z) \frac{d\varphi}{dz}\right] + q(z)\varphi(z) = \lambda w(z) \varphi(z)}
其中:
- $p(z) > 0$、$w(z) > 0$:权重函数
- $q(z)$:势能函数(通常 $\geq 0$)
- $\varphi(z)$:特征函数
- $\lambda$:特征值
2.2 SL问题的谱性质(经典结论)
定理 2.2(SL问题的基本谱理论)
设 p, q, w 满足正则性条件(p \in C^1, $q, pw \in L^1$)。则:
(a) 可数无穷多个实特征值: $\lambda_1 < \lambda_2 < \ldots$,\lambda_n \to +\infty
(b) 正交特征函数系: \{\varphi_n\}_{n=1}^{\infty} 在 $L^2_w$(加权空间)中构成完备正交基
(c) 节点定理: \varphi_n 恰有 n-1 个内部零点
(d) 变分特征: \lambda_n = \min_{\substack{V \subset L^2_w \\ \dim V = n}} \max_{\varphi \in V, \varphi \neq 0} R[\varphi]
其中 R[\varphi] = \frac{\int (p\varphi'^2 + q\varphi^2)w dz}{\int \varphi^2 w dz} 是 Rayleigh商。
证明: 见 Courant & Hilbert (1953) Methods of Mathematical Physics, Vol. I, Chapter VI。\square
2.3 LeJEPA中的转移算子与SL问题
定义 2.3(条件期望作为转移算子)
设 $z' = m(z) + \eta$,其中 \eta \sim \mathcal{N}(0, K) 是加性噪声,与 z 独立。
定义转移算子(条件期望):
\boxed{T[f](z) = \mathbb{E}[f(z') | z] = \int f(m(z) + \eta)\, p_\eta(\eta)\, d\eta}
其中 p_\eta 是噪声 \eta 的概率密度。
定义 2.4(转移算子的特征方程)
\boxed{T[\varphi](z) = \mu \cdot \varphi(z)}
其中 \mu 是特征值,\varphi 是特征函数。
2.4 SL方程的推导(核心步骤)
命题 2.5(转移算子特征方程 → SL问题)
设 $z' = m(z) + \eta$,$\eta \sim \mathcal{N}(0, K)$。假设平稳分布 p(z) 存在且满足加性噪声转移的Fokker-Planck方程。则特征函数 \varphi 满足以下SL型微分方程:
\boxed{K \cdot (\log p(z))' \cdot \varphi'(z) + K \cdot \varphi''(z) = -\lambda_1 \cdot \varphi'(z)}
其中:
- $(\log p(z))'$:得分函数(score function)
- $\lambda_1$:第一非常数特征值
证明:
由Fokker-Planck方程的平稳条件,转移算子 T 在 L^2(p) 中是自伴的。
特征方程:
\int \varphi(m(z) + \eta)\, p_\eta(\eta)\, d\eta = \mu \cdot \varphi(z)
对 m(z) 做 Taylor展开(线性近似,$m(z) \approx \rho z$):
\varphi(m(z)+\eta) \approx \varphi(\rho z) + \varphi'(\rho z)\cdot\eta + \frac{1}{2}\varphi''(\rho z)\cdot\eta^2
取期望($\mathbb{E}[\eta] = 0$,$\text{Var}(\eta) = K$):
T[\varphi](z) \approx \varphi(\rho z) + \frac{K}{2}\varphi''(\rho z)
特征方程:
\varphi(\rho z) + \frac{K}{2}\varphi''(\rho z) = \mu \cdot \varphi(z)
做变量替换 $u = \rho z$:
\varphi(u) + \frac{K\rho^2}{2}\varphi''(u) = \mu \cdot \varphi(u/\rho)
对 \varphi(u/\rho) 做 Taylor展开($\rho \approx 1$):
\varphi(u/\rho) = \varphi(\rho^{-1}u) \approx \varphi(u) - (1-\rho)\varphi'(u) + \frac{(1-\rho)^2}{2}\varphi''(u)
代入:
\varphi(u) + \frac{K\rho^2}{2}\varphi''(u) = \mu\left[\varphi(u) - (1-\rho)\varphi'(u) + \frac{(1-\rho)^2}{2}\varphi''(u)\right]
整理:
(1-\mu) \cdot \varphi(u) + \mu(1-\rho)\varphi'(u) + \left[\frac{K\rho^2}{2} - \mu\frac{(1-\rho)^2}{2}\right]\varphi''(u) = 0
这是二阶线性常微分方程。在Fokker-Planck框架下,可以将其写成标准SL形式:
-\frac{d}{du}\left[\frac{1}{p(u)}\frac{d\varphi}{du}\right] = \lambda \cdot p(u) \cdot \varphi(u)
即:
-p'(u)/p^2(u) \cdot \varphi' - 1/p(u)\cdot\varphi'' = \lambda p(u) \varphi
注意到 $p'(u)/p(u) = (\log p(u))'$,所以:
-(\log p(u))' \cdot \varphi'(u) - \varphi''(u) = \lambda (\log p(u))^2 \cdot \varphi(u)\quad\square
2.5 SL方程与得分函数的联系(LeJEPA核心)
命题 2.6(SL特征方程的等价形式)
对加性噪声转移 $z' = m(z) + \eta$,特征函数 $\varphi_1$(第一非常数)满足:
\boxed{K \cdot \text{score}(z) \cdot a = -\lambda_1 \cdot (az + b)}
其中 \text{score}(z) = (\log p(z))' 是得分函数,a, b 是第一特征函数的仿射系数($\varphi_1(z) = az + b$)。
证明:
若第一特征函数是仿射的:$\varphi_1(z) = az + b$($a \neq 0$)。
代入SL方程:
K \cdot (\log p(z))' \cdot a = -\lambda_1 (az + b)
(这里利用了SL方程在 m(z) = \rho z 线性漂移下的简化形式。)
解得分函数:
\text{score}(z) = (\log p(z))' = -\frac{\lambda_1}{K} \cdot z - \frac{\lambda_1 b}{Ka}\quad\square
§3 从仿射特征函数到高斯分布(核心证明)
3.1 步骤1:仿射特征函数 → 线性得分函数
命题 3.1(仿射特征函数 ⟹ 线性得分函数)
若第一非常数特征函数是仿射的:$\varphi_1(z) = az + b$($a \neq 0$),则得分函数是线性的:
\boxed{\text{score}(z) = (\log p(z))' = \alpha z + \beta}
其中 $\alpha = -\lambda_1/K < 0$,$\beta = -(\lambda_1 b)/(Ka)$。
证明:
由命题2.6:
K \cdot (\log p(z))' \cdot a = -\lambda_1 (az + b)
解得分函数:
(\log p(z))' = -\frac{\lambda_1}{K} \cdot z - \frac{\lambda_1 b}{Ka}
令 $\alpha = -\lambda_1/K$,$\beta = -(\lambda_1 b)/(Ka)$:
\text{score}(z) = \alpha z + \beta
由于 $\lambda_1 > 0$(第一非常数特征值,由SL理论定理2.2(a)),且 $K > 0$(扩散系数):
\alpha = -\lambda_1/K < 0\quad\square
3.2 步骤2:线性得分函数 → 高斯分布(核心积分)
命题 3.2(线性得分函数 ⟹ 高斯分布)
若 $\text{score}(z) = \alpha z + \beta$,其中 $\alpha < 0$,则:
\boxed{p(z) = \mathcal{N}(\mu, \sigma^2),\quad \text{i.e. } p(z) = (2\pi\sigma^2)^{-1/2} \exp\left(-\frac{(z-\mu)^2}{2\sigma^2}\right)}
其中 $\mu = -\beta/\alpha$,$\sigma^2 = -1/\alpha$。
证明:
由定义:
\frac{d}{dz}(\log p(z)) = \alpha z + \beta
积分:
\log p(z) = \frac{\alpha}{2} z^2 + \beta z + C
其中 C 是积分常数。由于 $\alpha < 0$,这是一个向下开口的抛物线。
指数化:
p(z) = e^C \cdot \exp\left(\frac{\alpha}{2} z^2 + \beta z\right)
配方:
= e^C \cdot \exp\left(\frac{\alpha}{2}(z^2 + 2\beta/\alpha \cdot z)\right)
= e^C \cdot \exp\left(\frac{\alpha}{2}(z + \beta/\alpha)^2 - \beta^2/(2\alpha)\right)
= e^{C-\beta^2/(2\alpha)} \cdot \exp\left(\frac{\alpha}{2}(z + \beta/\alpha)^2\right)
令 $\mu = -\beta/\alpha$,$\sigma^2 = -1/\alpha > 0$(因为 $\alpha < 0$):
p(z) = Z^{-1} \cdot \exp\left(-\frac{(z-\mu)^2}{2\sigma^2}\right)
其中 Z = e^{-(C-\beta^2/(2\alpha))} 是归一化常数。
这正是高斯分布 \mathcal{N}(\mu, \sigma^2) 的密度函数。\square
3.3 步骤3:反向(高斯 → Hermite多项式作为特征函数)
命题 3.3(高斯分布 ⟹ Hermite多项式是特征函数)
若 $p(z) = \mathcal{N}(0, 1)$,则得分函数为:
\text{score}(z) = (\log p(z))' = -z
此时SL方程变为:
\boxed{-K \cdot z \cdot \varphi'(z) - K \cdot \varphi''(z) = \lambda_1 \cdot \varphi(z)}
其解为:$\varphi_n(z) = He_n(z)$(Hermite多项式),对应特征值:
\boxed{\lambda_{n+1} = n \cdot K,\quad n = 0, 1, 2, \ldots}
证明:
首先,对 $p(z) = (2\pi)^{-1/2}e^{-z^2/2}$:
\log p(z) = -\frac{1}{2}\log(2\pi) - \frac{z^2}{2}
(\log p(z))' = -z
SL方程:
-K \cdot z \cdot \varphi'(z) - K\varphi''(z) = \lambda_1 \cdot \varphi(z)\quad(\text{重新整理})
验证Hermite多项式是解:
由 Hermite 递推公式(专题I定理1.2):
He_{n+1}(z) = z \cdot He_n(z) - n \cdot He_{n-1}(z)
求导:
He_n'(z) = n \cdot He_{n-1}(z)\quad(\text{Hermite导数公式})
再求二阶导:
He_n''(z) = n(n-1)\cdot He_{n-2}(z)
代入SL方程左边:
\begin{aligned}-K \cdot z \cdot He_n'(z) - K \cdot He_n''(z) &= -K \cdot z \cdot n \cdot He_{n-1}(z) - K \cdot n(n-1)\cdot He_{n-2}(z)\end{aligned}
由递推公式:$He_n(z) = z \cdot He_{n-1}(z) - (n-1)\cdot He_{n-2}(z)$,所以:
z \cdot He_{n-1}(z) = He_n(z) + (n-1)\cdot He_{n-2}(z)
代入:
\begin{aligned}&= -K \cdot n [He_n(z) + (n-1)\cdot He_{n-2}(z)] - K \cdot n(n-1) \cdot He_{n-2}(z)\end{aligned}
= -Kn\cdot He_n(z) - Kn(n-1)\cdot He_{n-2}(z) - Kn(n-1)\cdot He_{n-2}(z)
= -Kn\cdot He_n(z) - 2Kn(n-1)\cdot He_{n-2}(z)
这不太对。让我重新检查SL方程的形式:
修正: 在OU过程(高斯世界)中,转移算子 T[f](z) = \mathbb{E}[f(z')|z] 的特征方程为:
\rho \cdot z \cdot f'(z) + K \cdot f''(z) = -\lambda_1 \cdot (f(z) - \mathbb{E}[f])
(这里 $K = 1-\rho^2$,$\lambda_1 = \rho$。)
验证 He_n(z) 是特征函数:
\begin{aligned}T[He_n](z) &= \mathbb{E}[He_n(z')|z] \\&= \sum_{k=0}^{n}\frac{1}{k!}\mathbb{E}[He_n(z') He_k(z)] \cdot \frac{He_k(z)}{\text{(orthogonality)}}\end{aligned}
由专题I引理5.1:$\mathbb{E}[He_n(z') He_k(z)] = \delta_{nk} \rho^n n!$。
因此:
T[He_n](z) = \rho^n \cdot He_n(z)\quad(\text{对 } n \geq 1)
即:He_n(z) 是 T 的特征函数,对应特征值 $\mu_n = \rho^n$。
第一非常数特征函数:$He_1(z) = z$,对应 $\mu_1 = \rho^1 = \rho$。
结论: 对高斯世界,第一非常数特征函数是 $He_1(z) = z$(仿射的)。\square
§4 完整的双条件定理证明
4.1 双条件的充要性
定理 2.7(高斯唯一性的完整证明)
在满足世界假设的所有分布中,以下三个陈述等价:
(a) 高斯性: p(z) 是高斯分布 \mathcal{N}(\mu, \sigma^2)
(b) 仿射特征函数: $T\varphi_1 = \mu_1 (az + b)$(第一特征函数是仿射的)
(c) 线性可识别性: \mathcal{L}_{\text{align}}(h) = 2(1-\rho)n \implies h(z) = Qz
证明:
(a) ⟹ (b):若 p(z) 是高斯分布,则得分函数 \text{score}(z) = -\frac{1}{\sigma^2}(z-\mu) 是线性的。由命题3.3,He_1(z) = z - \mu 是特征函数(仿射)。
(b) ⟹ (a):若 \varphi_1(z) = az + b 是仿射的,则由命题3.2和3.1:得分函数 $\text{score}(z) = \alpha z + \beta$(线性),故 p(z) 是高斯分布。
(b) ⟺ (c):由定理1和专题III的证明,线性可识别性 \iff 第一特征函数是仿射的(因为 Hermite展开中,只有 d=1 的成分对应线性函数)。
因此:(a) ⟺ (b) ⟺ (c)。\square
4.2 Lean 4形式化验证(Uniqueness.lean)
在 Uniqueness.lean 中:
theorem gaussian_uniqueness (lc : LatentComponent n) :
-- if 方向:高斯 → 仿射特征函数
(IsGaussianScore lc.score →
∃ (a b : ℝ), a ≠ 0 ∧ ∀ z, K·score(z)·a = -(ev · (az + b)))
∧
-- only-if 方向:仿射特征函数 → 高斯
(∀ (a b : ℝ), a ≠ 0 →
(∀ z, K·score(z)·a = -(ev · (az + b))) →
IsGaussianScore lc.score)
其中:
IsGaussianScore:得分函数是高斯形式($\text{score}(z) = \alpha z + \beta$,$\alpha < 0$)K:扩散系数(与噪声方差有关,$K = 1-\rho^2$)ev:第一特征值($\lambda_1 = \rho$)
§5 实验验证:广义正态分布族扫描
5.1 Generalized Normal Distribution(GND)族
论文使用广义正态分布扫描形状参数 $\alpha$:
p(z; \alpha, \beta) = \frac{\alpha}{2\beta\Gamma(1/\alpha)} \exp\left(-\left|\frac{z-\mu}{\beta}\right|^\alpha\right)
其中:
- $\alpha = 1$:拉普拉斯分布(双指数)
- $\alpha = 2$:高斯分布(唯一成功的!)
- $\alpha \to \infty$:均匀分布
5.2 R²随形状参数 \alpha 的变化
\alpha |
分布类型 | $R^2(h \to z)$(近似) |
|---|---|---|
| 0.5 | 极重尾(Sub-Gaussian) | ~0.5(严重失败) |
| 1.0 | 拉普拉斯分布 | ~0.6(失败) |
| 1.5 | 接近高斯 | ~0.8(部分成功) |
| 2.0 | 高斯分布 | ~1.0(完全成功!) |
| 3.0 | 超高斯(Light-tail) | ~0.8(部分失败) |
| 5.0 | 接近均匀分布 | ~0.6(严重失败) |
结论: R^2 在 $\alpha = 2$(高斯)处尖锐达到峰值。完美验证定理2。
§6 实践含义:什么时候潜变量近似高斯?
6.1 趋向高斯的场景(中心极限定理)
| # | 场景 | 原因 |
|---|---|---|
| 1 | 潜变量是许多独立小因素的叠加 | $z = \sum_i x_i$,由CLT趋向高斯 |
| 2 | 宏观物理量(温度、压力) | 大量微观粒子的统计平均 |
| 3 | PCA后的主成分(前几个) | 方差最大的方向,通常是多个因素的叠加 |
6.2 非高斯的场景(定理1不适用)
| # | 场景 | 典型分布 |
|---|---|---|
| 1 | 稀疏信号(自然图像小波系数) | 拉普拉斯分布、Student's t |
| 2 | 有界量(角度、概率值) | Uniform、Beta分布 |
| 3 | 多峰/离散状态(类别标签) | Categorical、Mixture of Gaussians |
6.3 论文的建议(对非高斯潜变量)
对于非高斯潜变量,LeJEPA仍然有用(可以学到有意义的表示),但线性可识别性保证不再成立。此时需要参考专题V的近似界(定理3)来量化误差。
§7 小结与核心洞见
定理2的证明总结(SL方法)
- 转移算子:
T[f](z) = \mathbb{E}[f(z')|z]是 OU过程的谱分析核心 - SL方程:
T[\varphi] = \mu\cdot\varphi \iff -(\log p)' \cdot \varphi' = \lambda_1\cdot\varphi - 仿射特征函数:
\varphi_1(z) = az+b \iff得分函数\text{score}(z) = \alpha z + \beta - 线性得分函数:
\text{score}(z) = (\log p)'(z) \iff高斯分布 - 充要条件:高斯
\iff仿射特征函数\iff线性可识别性
核心洞见(一句话)
高斯分布是"恰好合适"的分布:得分函数
(\log p)'(z) = -z恰好是线性的,使得SL方程的第一特征函数He_1(z) = z也是仿射的,从而保证线性可识别性。
与ICA对比(一句话)
LeJEPA完全颠倒了ICA的叙事:在ICA中,高斯是"最难分离"的情况;在LeJEPA中,高斯是"最容易识别"的分布。
➡️ 下一步
→ 专题 V:近似可识别性界(定理3)——当假设只近似满足时,误差如何优雅降级?