Add multiple research papers in PDF format to the repository, including recent works on AI and physics, with file sizes ranging from 1.7 MB to 32.3 MB.
Sync to site1 / sync (push) Has been cancelled

This commit is contained in:
gaojie
2026-06-02 04:12:38 +08:00
parent 36fe037bc1
commit c55f47b287
57 changed files with 278820 additions and 3 deletions
+171
View File
@@ -0,0 +1,171 @@
# Topic 1Hermite 多项式——从直觉到定义
> **前置知识:** 高中数学(多项式)、基础概率(正态分布)
> **目标:** 理解为什么 Hermite 多项式是分析高斯分布下函数的"天然工具"
---
## 🎯 核心问题
LeJEPA 的证明需要回答:**编码器 `h(z)` 中,哪些成分对正样本对的相关性贡献最大?**
答案需要一套能把任意函数"拆开"的工具——就像傅里叶级数把周期函数拆成正弦/余弦。在高斯分布下,这套工具就是 **Hermite 多项式**
---
## 📐 从傅里叶到 Hermite:类比理解
| 概念 | 傅里叶级数 | Hermite 展开 |
|------|-----------|-------------|
| 适用场景 | 周期函数 | 高斯分布下的函数 |
| 基函数 | `sin(nx), cos(nx)` | `H₀(z), H₁(z), H₂(z), ...` |
| 正交性 | `∫ sin(mx)sin(nx)dx = 0`m≠n | `E[Hₘ(z)Hₙ(z)] = 0`m≠nz~N(0,1) |
| 展开系数 | 傅里叶系数 | Hermite 系数 |
| 完备性 | 任意周期函数可展开 | 任意 L²(γ) 函数可展开 |
**关键区别:** Hermite 的正交性是在**高斯测度**下定义的,即期望 `E[·]` 是对 `z ~ N(0,1)` 取的。
---
## 📝 Hermite 多项式的定义
### 物理学家版(概率论中常用)
前几个 Hermite 多项式(概率论版,`He_n`):
```
He₀(z) = 1
He₁(z) = z
He₂(z) = z² - 1
He₃(z) = z³ - 3z
He₄(z) = z⁴ - 6z² + 3
He₅(z) = z⁵ - 10z³ + 15z
```
### 递推公式(最容易记忆)
```
He_{n+1}(z) = z · Heₙ(z) - n · He_{n-1}(z)
```
**例子:**
- `He₂(z) = z · He₁(z) - 1 · He₀(z) = z·z - 1·1 = z² - 1`
- `He₃(z) = z · He₂(z) - 2 · He₁(z) = z(z²-1) - 2z = z³ - 3z`
---
## 🔑 最重要的性质:正交性
`z ~ N(0,1)` 时:
```
E[Heₘ(z) · Heₙ(z)] = { n! 如果 m = n
{ 0 如果 m ≠ n
```
**直觉:** 不同"频率"(阶数)的 Hermite 多项式在高斯分布下互不干扰,就像不同频率的正弦波互相正交。
### 验证 He₁ 和 He₂ 的正交性
```
E[He₁(z) · He₂(z)] = E[z · (z² - 1)]
= E[z³] - E[z]
= 0 - 0 = 0 ✓
(高斯分布的奇数阶矩为零)
```
---
## 🌊 完备性:任意函数都能展开
对任意满足 `E[h(z)²] < ∞` 的函数 `h`,可以展开为:
```
h(z) = Σ_{d=0}^{∞} cₐ · Heₐ(z)
```
其中展开系数:
```
cₐ = E[h(z) · Heₐ(z)] / d!
```
**类比:** 就像任意向量可以用正交基展开,任意"有限能量"的函数可以用 Hermite 多项式展开。
---
## 💡 为什么 Hermite 多项式对 LeJEPA 至关重要?
### 关键事实:OU 过程对不同阶数的衰减不同
`z' = ρz + √(1-ρ²)η`OU 过程,`η ~ N(0,1)`)时:
```
E[Heₙ(z') · Heₙ(z)] = ρⁿ · n!
```
**翻译成人话:**
- 1阶(线性)成分:相关性 = `ρ¹ = ρ`
- 2阶(二次)成分:相关性 = `ρ² < ρ`(因为 `ρ < 1`
- 3阶(三次)成分:相关性 = `ρ³ < ρ²`
- d阶成分:相关性 = `ρᵈ`,随 d 增大**指数衰减**
### 这意味着什么?
LeJEPA 的对齐损失要**最大化**正样本对的相关性。由于:
- 线性成分贡献 `ρ`
- 非线性成分贡献 `ρᵈ < ρ`d ≥ 2
**最优策略就是:只保留线性成分,丢弃所有非线性成分!**
这就是定理1的核心直觉。
---
## 🎨 可视化:前4个 Hermite 多项式
```
He₀(z) = 1 ──────────────── (常数,被零均值约束排除)
He₁(z) = z (线性,这是我们想要的!)
He₂(z) = z²-1 (二次,被 OU 衰减更多)
He₃(z) = z³-3z ∫ (三次,衰减更多)
```
`z ~ N(0,1)` 的分布下,大多数概率质量集中在 `[-3, 3]` 区间。
---
## 📊 谱权重的含义
在 LeJEPA 的证明中,定义**谱权重** `wₐ`
```
wₐ = (展开系数 cₐ)² · d! / E[h(z)²]
```
满足:
- `wₐ ≥ 0`(非负)
- `w₀ = 0`(零均值约束)
- `Σ wₐ = 1`(单位方差归一化)
**物理意义:** `wₐ` 是编码器 `h` 中"d阶非线性成分"占总方差的比例。
| 情况 | 谱权重分布 | 含义 |
|------|-----------|------|
| 纯线性 `h(z) = az` | `w₁ = 1`,其余为0 | 100% 线性 |
| 纯二次 `h(z) = z²-1` | `w₂ = 1`,其余为0 | 100% 二次 |
| 混合 `h(z) = z + z²-1` | `w₁, w₂ > 0` | 线性+二次混合 |
---
## ✅ 小结
1. **Hermite 多项式** 是高斯分布下函数的"频率分解"工具
2. **正交性**:不同阶数的 Hermite 多项式在高斯期望下互不干扰
3. **OU 衰减**d 阶成分的时间相关性为 `ρᵈ`,高阶衰减更快
4. **LeJEPA 的核心**:最大化相关性 → 只保留线性(d=1)成分 → 线性可识别性
---
## ➡️ 下一步
→ [Topic 2OU 过程与 Mehler 公式](02_ou_process_mehler.md)——深入理解 `ρᵈ` 衰减的来源
+224
View File
@@ -0,0 +1,224 @@
# Topic 2Ornstein-Uhlenbeck 过程与 Mehler 公式
> **前置知识:** [Topic 1Hermite 多项式](01_hermite_polynomials.md)、基础概率(条件期望)
> **目标:** 理解 LeJEPA 中"正样本对"的生成机制,以及为什么 OU 过程对高阶成分衰减更快
---
## 🎯 核心问题
LeJEPA 训练时需要"正样本对"——同一内容的两个视图 `(z, z')`。这对视图是怎么生成的?为什么这种生成方式会导致高阶 Hermite 成分被更强地惩罚?
---
## 🌊 什么是 Ornstein-UhlenbeckOU)过程?
### 物理直觉:弹簧上的粒子
想象一个粒子被弹簧拴在原点,同时受到随机扰动:
- **弹簧力**:把粒子拉回原点(均值回归)
- **随机扰动**:布朗运动噪声
这就是 OU 过程的物理图像。
### 数学定义(连续时间)
```
dz_t = -θ z_t dt + σ dW_t
```
其中:
- `θ > 0`:均值回归速率
- `σ`:噪声强度
- `W_t`:标准布朗运动
### LeJEPA 中的离散版本
论文使用的是**离散时间 OU 过程**,一步转移:
```
z' = ρz + √(1-ρ²) η, η ~ N(0, I_n)
```
其中 `ρ ∈ (0, 1)` 是**相关系数**(对应连续时间的 `e^{-θΔt}`)。
---
## 🔑 OU 过程的三个关键性质
### 性质 1:平稳性(Stationarity
如果 `z ~ N(0, I_n)`,那么 `z' ~ N(0, I_n)`
**验证:**
```
E[z'] = ρ·E[z] + √(1-ρ²)·E[η] = 0 + 0 = 0 ✓
Var(z') = ρ²·Var(z) + (1-ρ²)·Var(η) = ρ² + (1-ρ²) = 1 ✓
```
**意义:** 正样本对 `(z, z')` 的边际分布相同,满足论文的"平稳性假设"。
### 性质 2:相关性可控
```
Cov(z', z) = E[z'z^T] = ρ·E[zz^T] = ρ·I_n
```
所以 `ρ` 直接控制两个视图的相似程度:
- `ρ → 1``z' ≈ z`(几乎相同的视图)
- `ρ → 0``z'``z` 独立(完全不同的视图)
- 实践中取 `ρ ∈ [0.8, 0.95]`
### 性质 3:加性噪声(Additive Noise
转移可以写成 `z' = m(z) + η`,其中 `m(z) = ρz` 是线性漂移,`η` 是独立噪声。这满足论文的"加性噪声假设"。
---
## 📐 Mehler 公式:OU 过程的谱定理
### 什么是 Mehler 公式?
Mehler 公式描述了 OU 过程的**转移核**transition kernel)在 Hermite 多项式基下的展开:
```
p(z'|z) = φ(z') · Σ_{d=0}^{∞} ρᵈ · Heₐ(z) · Heₐ(z') / d!
```
其中 `φ(z')` 是标准高斯密度。
### 更直观的形式:相关性公式
对任意函数 `f, g`Mehler 公式给出:
```
E[f(z) · g(z')] = Σ_{d=0}^{∞} ρᵈ · ⟨f, Heₐ⟩ · ⟨g, Heₐ⟩ / d!
```
**特别地**,当 `f = g = h_i`(编码器的第 i 个分量)时:
```
E[h_i(z) · h_i(z')] = Σ_{d=0}^{∞} ρᵈ · wₐ
```
其中 `wₐ``h_i` 在 d 阶 Hermite 多项式上的谱权重。
---
## 🎯 核心推论:高阶成分被更强惩罚
### 推导过程
设编码器分量 `h_i` 的谱权重为 `{wₐ}`(满足 `Σ wₐ = 1``w₀ = 0`)。
由 Mehler 公式:
```
corr_i := E[h_i(z') · h_i(z)] = Σ_{d=1}^{∞} wₐ · ρᵈ
```
现在比较这个值与 `ρ`
```
corr_i = Σ_{d=1}^{∞} wₐ · ρᵈ
≤ Σ_{d=1}^{∞} wₐ · ρ (因为 ρᵈ ≤ ρ 对 d ≥ 1)
= ρ · Σ_{d=1}^{∞} wₐ
= ρ · 1 = ρ
```
**结论:** `corr_i ≤ ρ`,等号成立当且仅当 `w₁ = 1`(即 `h_i` 是纯线性的)。
### 为什么等号只在线性时成立?
如果存在某个 `d₀ ≥ 2` 使得 `w_{d₀} > 0`,那么:
```
w_{d₀} · ρ^{d₀} < w_{d₀} · ρ (严格不等式,因为 ρ^{d₀} < ρ 对 d₀ ≥ 2
```
所以整个求和严格小于 `ρ`
---
## 📊 数值例子
`ρ = 0.9`,考虑三种编码器:
| 编码器 | 谱权重 | 相关性 `corr_i` | 与 `ρ=0.9` 的差距 |
|--------|--------|----------------|-----------------|
| 纯线性 `h(z) = z` | `w₁ = 1` | `0.9¹ = 0.900` | 0(最优!) |
| 纯二次 `h(z) = z²-1` | `w₂ = 1` | `0.9² = 0.810` | -0.090 |
| 纯三次 `h(z) = z³-3z` | `w₃ = 1` | `0.9³ = 0.729` | -0.171 |
| 混合 `w₁=0.5, w₂=0.5` | 各半 | `0.5×0.9 + 0.5×0.81 = 0.855` | -0.045 |
**结论:** 非线性成分越多,相关性越低,对齐损失越大。
---
## 🔗 与 LeJEPA 训练目标的联系
LeJEPA 的对齐损失:
```
L_align = E[‖h(z') - h(z)‖²]
= 2n - 2 Σᵢ E[h_i(z') · h_i(z)]
= 2n - 2 Σᵢ corr_i
```
最小化 `L_align` ⟺ 最大化 `Σᵢ corr_i`
由 Mehler 公式,`corr_i ≤ ρ`,所以:
```
L_align ≥ 2n - 2nρ = 2(1-ρ)n
```
**等号成立当且仅当每个 `h_i` 都是线性的!**
这就是定理1的核心:**最优编码器必须是线性的**。
---
## 🎨 直觉图示
```
ρ = 0.9 时,不同阶数的衰减:
d=1 (线性): ρ¹ = 0.900 ████████████████████ ← 最大相关性
d=2 (二次): ρ² = 0.810 ██████████████████
d=3 (三次): ρ³ = 0.729 ████████████████
d=4 (四次): ρ⁴ = 0.656 ██████████████
d=5 (五次): ρ⁵ = 0.590 █████████████
非线性成分的相关性随阶数指数衰减!
```
---
## 🔧 代码实现
在 [`data.py`](../lejepa-identifiability/experiments/lejepa_id/data.py:29) 中:
```python
def ou_augment(z, rho, n_views=2, dist="gaussian", alpha=None):
"""z' = ρz + √(1-ρ²)η"""
fac = (1 - rho ** 2) ** 0.5
D, N = z.shape
eta = sample_latents(n_views * D, N, dist=dist, ...)
eta = eta.reshape(n_views, D, N)
return rho * z.unsqueeze(0) + fac * eta
```
实验配置([`configs/2d.yaml`](../lejepa-identifiability/experiments/configs/2d.yaml))中 `rho` 的典型值为 `0.9`
---
## ✅ 小结
1. **OU 过程** 生成正样本对 `(z, z')`,相关性由 `ρ` 控制
2. **平稳性**`z, z'` 有相同的高斯边际分布
3. **Mehler 公式**OU 过程对 d 阶 Hermite 成分的相关性为 `ρᵈ`
4. **核心不等式**`corr_i = Σ wₐ ρᵈ ≤ ρ`,等号 ⟺ 纯线性
5. **训练含义**:最小化对齐损失 → 最大化相关性 → 编码器必须是线性的
---
## ➡️ 下一步
→ [Topic 3:谱分解与线性可识别性](03_spectral_identifiability.md)——把 Hermite 展开和 OU 衰减组合成完整的定理1证明
+237
View File
@@ -0,0 +1,237 @@
# Topic 3:谱分解与线性可识别性(定理 1 完整证明)
> **前置知识:** [Topic 1Hermite 多项式](01_hermite_polynomials.md)、[Topic 2OU 过程与 Mehler 公式](02_ou_process_mehler.md)
> **目标:** 把前两个 topic 的工具组合起来,完整理解定理1的证明逻辑
---
## 🎯 定理 1 的完整陈述
> **定理 1(线性可识别性):** 在高斯世界中,设编码器 `h : ℝⁿ → ℝⁿ` 满足:
> 1. **高斯约束**`h(z) ~ N(0, Iₙ)`(嵌入分布是各向同性高斯)
> 2. **最优对齐**`h` 最小化对齐损失 `L_align = E[‖h(z') - h(z)‖²]`
>
> 则 `h(z) = Qz`,其中 `Q ∈ O(n)` 是正交矩阵。
**白话翻译:** 如果你强制嵌入是高斯的,并且最大化正样本对的相似度,那么编码器**必然**是线性的(且保持距离)。
---
## 🗺️ 证明路线图
```
高斯约束 + 最优对齐
[步骤1] Hermite 展开:h_i(z) = Σ cₐ Heₐ(z)
[步骤2] Mehler 公式:corr_i = Σ wₐ ρᵈ
[步骤3] 关键不等式:corr_i ≤ ρ(等号 ⟺ w₁=1
[步骤4] 最优性条件:L_align = 2(1-ρ)n → 每个 corr_i = ρ
[步骤5] 线性性:每个 h_i 是线性函数
[步骤6] 正交性:高斯约束 + 线性 → Q ∈ O(n)
```
---
## 📐 步骤 1Hermite 展开
由 Topic 1,任意满足 `E[h_i(z)²] < ∞` 的函数可以展开:
```
h_i(z) = Σ_{α} c_{i,α} He_α(z)
```
其中 `α = (α₁, ..., αₙ)` 是多指标,`|α| = α₁ + ... + αₙ` 是总阶数。
**高斯约束的含义:**
- `E[h_i(z)] = 0``c_{i,0} = 0`(零均值,排除常数项)
- `E[h_i(z)²] = 1``Σ_{|α|≥1} c_{i,α}² |α|! = 1`(单位方差)
定义**谱权重**
```
w_{i,d} = Σ_{|α|=d} c_{i,α}² d! / E[h_i(z)²]
```
`w_{i,d} ≥ 0``w_{i,0} = 0``Σ_d w_{i,d} = 1`
---
## 📐 步骤 2:用 Mehler 公式计算相关性
由 Topic 2 的 Mehler 公式:
```
corr_i := E[h_i(z') · h_i(z)] = Σ_{d=1}^{∞} w_{i,d} · ρᵈ
```
这是一个**加权平均**:用谱权重 `w_{i,d}``ρᵈ` 求加权和。
---
## 📐 步骤 3:关键不等式
**引理(已在 Lean 4 中验证):**
```
corr_i = Σ_{d=1}^{∞} w_{i,d} · ρᵈ ≤ Σ_{d=1}^{∞} w_{i,d} · ρ = ρ
```
**等号成立的条件:**
等号成立 ⟺ 对所有 `d ≥ 2``w_{i,d} · ρᵈ = w_{i,d} · ρ`
由于 `ρᵈ < ρ`(当 `d ≥ 2, 0 < ρ < 1`),这要求 `w_{i,d} = 0` 对所有 `d ≥ 2`
又因为 `Σ_d w_{i,d} = 1``w_{i,0} = 0`,所以 `w_{i,1} = 1`
**结论:** `corr_i = ρ``h_i` 是纯线性函数(只有 d=1 的 Hermite 成分)。
---
## 📐 步骤 4:最优性条件
对齐损失可以写成:
```
L_align = E[‖h(z') - h(z)‖²]
= Σᵢ E[(h_i(z') - h_i(z))²]
= Σᵢ (E[h_i(z')²] + E[h_i(z)²] - 2E[h_i(z')h_i(z)])
= Σᵢ (1 + 1 - 2·corr_i)
= 2n - 2 Σᵢ corr_i
```
由步骤3`corr_i ≤ ρ`,所以:
```
L_align = 2n - 2 Σᵢ corr_i ≥ 2n - 2nρ = 2(1-ρ)n
```
**最优值 `L_align = 2(1-ρ)n` 当且仅当每个 `corr_i = ρ`。**
由步骤3的等号条件,这要求每个 `h_i` 都是线性的。
---
## 📐 步骤 5:线性性
每个 `h_i` 只有 d=1 的 Hermite 成分,即:
```
h_i(z) = Σⱼ aᵢⱼ zⱼ
```
写成矩阵形式:`h(z) = Az`,其中 `A ∈ ℝⁿˣⁿ`
---
## 📐 步骤 6:正交性
现在利用**高斯约束** `h(z) ~ N(0, Iₙ)`
如果 `h(z) = Az``z ~ N(0, Iₙ)`,则:
```
h(z) ~ N(0, AA^T)
```
要使 `h(z) ~ N(0, Iₙ)`,需要:
```
AA^T = Iₙ
```
这正是 `A ∈ O(n)`(正交矩阵)的定义!
**结论:** `h(z) = Qz``Q ∈ O(n)`。 □
---
## 🔍 为什么叫"线性可识别性"?
### 可识别性(Identifiability)的含义
在表示学习中,"可识别性"指:从观测数据 `x = g(z)` 中,能否恢复出真实的潜变量 `z`
- **完全可识别**`h(x) = z`(精确恢复)
- **线性可识别**`h(x) = Qz`(恢复到正交变换等价)
- **置换可识别**`h(x) = Pz`(恢复到置换等价,ICA 的结果)
- **不可识别**:无法从 `h(x)` 恢复 `z` 的任何信息
### 为什么"正交等价"已经足够?
正交变换保持:
- **距离**`‖Qz₁ - Qz₂‖ = ‖z₁ - z₂‖`
- **内积**`⟨Qz₁, Qz₂⟩ = ⟨z₁, z₂⟩`
- **范数**`‖Qz‖ = ‖z‖`
对于**旋转不变的代价函数**(如欧氏距离、LQR),在 `Qz` 空间中规划与在 `z` 空间中规划完全等价(见 Topic 6)。
---
## 🎨 几何直觉
```
真实潜空间 z: 学到的表示 h(z) = Qz:
z₂ h₂
↑ ↑
│ ● ● │ ● ●
│● ● │ ● ●
│ ●● │ ●●
└──────→ z₁ └──────→ h₁
两个空间的点云形状完全相同,只是旋转了角度 θ。
所有距离、角度关系都被保留。
```
---
## ⚠️ 证明的假设条件
定理1成立需要以下条件:
| 假设 | 含义 | 如果违反? |
|------|------|-----------|
| 潜变量是高斯的 | `z ~ N(0, I_n)` | 定理2说明:非高斯时线性可识别性失败 |
| OU 转移 | `z' = ρz + √(1-ρ²)η` | 其他转移可能不满足 Mehler 公式 |
| 高斯约束 | `h(z) ~ N(0, I_n)` | 没有约束则编码器可能坍塌 |
| 最优对齐 | `h` 达到全局最优 | 局部最优可能不是线性的 |
---
## 🔧 Lean 4 验证状态
在 [`Hermite.lean`](../lejepa-identifiability/lean/LeJEPA/Hermite.lean) 中:
| 步骤 | 对应定理 | 状态 |
|------|---------|------|
| 步骤3(不等式) | `correlation_le_rho` | ✅ 机器验证 |
| 步骤3(等号条件) | `equality_forces_degree_one` | ✅ 机器验证 |
| 步骤4(损失下界) | `loss_lower_bound` | ✅ 机器验证 |
| 步骤4(最优性) | `hermite_identifiability`(主定理) | ✅ 机器验证 |
| 步骤1Hermite 基) | `mehler_summability` | 公理化(Mathlib 尚未收录) |
| 步骤5(线性性) | `linear_of_degree_one` | 公理化 |
| 步骤6(正交性) | `orthogonal_of_gaussian_linear` | 公理化 |
---
## ✅ 小结
定理1的证明是一个**优化论证**
1. 把编码器用 Hermite 多项式展开(谱分解)
2. 用 Mehler 公式计算正样本对的相关性
3. 证明相关性 ≤ ρ,等号 ⟺ 纯线性
4. 最优对齐要求每个分量都达到等号
5. 因此编码器必须是线性的
6. 高斯约束进一步要求线性映射是正交的
**核心洞见:** OU 过程对高阶非线性成分的"惩罚"(衰减)比线性成分更强,所以最优编码器会"放弃"所有非线性成分。
---
## ➡️ 下一步
→ [Topic 4Sturm-Liouville 理论与高斯唯一性](04_sturm_liouville_uniqueness.md)——为什么只有高斯分布才能保证线性可识别性?
+257
View File
@@ -0,0 +1,257 @@
# Topic 4Sturm-Liouville 理论与高斯唯一性(定理 2)
> **前置知识:** [Topic 3:谱分解与线性可识别性](03_spectral_identifiability.md)、基础微积分(微分方程)
> **目标:** 理解为什么高斯分布是**唯一**能保证线性可识别性的分布
---
## 🎯 定理 2 的完整陈述
> **定理 2(高斯唯一性):** 在满足世界假设(独立性、平稳性、加性噪声)的所有分布中,**高斯分布是唯一**使 LeJEPA 实现线性可识别性的分布。
**白话翻译:** 定理1的结论(线性可识别性)不是对所有分布都成立的——它只对高斯分布成立。换句话说,高斯分布是"恰好合适"的分布。
---
## 🤔 为什么这个结论令人惊讶?
### 与经典 ICA 的对比
在**线性 ICA**(独立成分分析)中,结论恰好相反:
| 场景 | 高斯分布 | 非高斯分布 |
|------|---------|-----------|
| 线性 ICA | ❌ **失败**(无法分离) | ✅ 成功 |
| LeJEPA(非线性) | ✅ **成功** | ❌ 失败 |
**LeJEPA 完全颠倒了 ICA 的结论!**
### 直觉解释
- **线性 ICA 失败的原因**:高斯分布的旋转不变性使得无法区分不同的旋转方向
- **LeJEPA 成功的原因**:正是这种旋转不变性,使得 OU 过程的谱分解(Hermite 多项式)恰好给出线性最优解
---
## 🔑 证明的核心工具:Sturm-Liouville 理论
### 什么是 Sturm-Liouville 问题?
Sturm-Liouville 问题是一类特殊的微分方程特征值问题:
```
-(p(z) φ'(z))' + q(z) φ(z) = λ w(z) φ(z)
```
其中 `φ` 是特征函数,`λ` 是特征值。
**在 LeJEPA 的语境中:** 转移算子 `T[f](z) = E[f(z')|z]` 的特征函数满足 Sturm-Liouville 方程。
### 关键联系
对于加性噪声转移 `z' = m(z) + η`,转移算子的特征方程为:
```
K · (log p(z))' · φ(z) + K · φ'(z) = -λ₁ · φ(z)
```
其中:
- `K`:扩散系数(与噪声方差有关)
- `(log p(z))'`**得分函数**score function
- `λ₁`:第一非常数特征值
---
## 📐 证明路线:从仿射特征函数到高斯分布
### 关键问题
定理1的证明依赖于"第一特征函数是线性的"(即 `φ₁(z) = z`)。
定理2要问:**什么分布 `p` 使得第一特征函数是仿射的(`φ₁(z) = az + b`)?**
### 步骤 1:仿射特征函数 → 仿射得分函数
设第一特征函数是仿射的:`φ₁(z) = az + b``a ≠ 0`)。
代入特征方程:
```
K · score(z) · a = -λ₁ · (az + b)
```
解出得分函数:
```
score(z) = (log p(z))' = -(λ₁/K) · z - (λ₁ b)/(Ka)
= α · z + β
```
其中 `α = -λ₁/K < 0`(因为 `λ₁ > 0, K > 0`)。
**结论:** 仿射特征函数 → 得分函数是线性的(斜率为负)。
### 步骤 2:仿射得分函数 → 高斯分布
得分函数 `(log p(z))' = αz + β`,积分得:
```
log p(z) = (α/2) z² + βz + C
```
由于 `α < 0`,这是一个**向下开口的抛物线**,对应:
```
p(z) ∝ exp((α/2) z² + βz) = exp(-(z-μ)²/(2σ²))
```
这正是**高斯分布** `N(μ, σ²)`
### 步骤 3:反向(高斯 → 仿射特征函数)
反过来,如果 `p` 是高斯分布,则其 Sturm-Liouville 特征函数是 Hermite 多项式,第一个非常数特征函数是 `He₁(z) = z`(仿射的)。
---
## 🔄 完整的双条件定理
```
p 是高斯分布
第一特征函数是仿射的
LeJEPA 实现线性可识别性
```
**Lean 4 验证([`Uniqueness.lean`](../lejepa-identifiability/lean/LeJEPA/Uniqueness.lean)):**
```lean
theorem gaussian_uniqueness (lc : LatentComponent) :
-- if 方向:高斯 → 仿射特征函数
(IsGaussianScore lc.score
(a b : ), a 0 z, K·score(z)·a = -(ev·(az+b)))
-- only-if 方向:仿射特征函数 → 高斯
( (a b : ), a 0
( z, K·score(z)·a = -(ev·(az+b)))
IsGaussianScore lc.score)
```
---
## 🎨 直觉图示:为什么非高斯分布失败?
### 拉普拉斯分布(α=1
```
p(z) ∝ exp(-|z|)
得分函数:(log p)' = -sign(z) (在 z≠0 处)
这是一个阶跃函数,不是线性的!
→ 第一特征函数不是仿射的
→ 线性可识别性失败
```
### 均匀分布(α→∞)
```
p(z) = 1/(2a) 在 [-a, a] 上
得分函数:(log p)' = 0 (在内部)
这是常数,不是线性的!
→ 第一特征函数不是仿射的
→ 线性可识别性失败
```
### 高斯分布(α=2
```
p(z) ∝ exp(-z²/2)
得分函数:(log p)' = -z (线性!)
→ 第一特征函数是 He₁(z) = z(仿射)
→ 线性可识别性成立 ✓
```
---
## 📊 实验验证(广义正态分布族)
论文用**广义正态分布**Generalized Normal)扫描形状参数 `α`
```
p(z; α) ∝ exp(-|z/β|^α)
```
- `α = 1`:拉普拉斯分布
- `α = 2`:高斯分布(唯一成功的!)
- `α → ∞`:均匀分布
实验结果([`gennorm.yaml`](../lejepa-identifiability/experiments/configs/gennorm.yaml) 配置):
```
R²(h→z) 随 α 的变化:
α=0.5 ████░░░░░░░░░░░░░░░░ ~0.5(重尾,失败)
α=1.0 ██████░░░░░░░░░░░░░░ ~0.6(拉普拉斯,失败)
α=1.5 ████████░░░░░░░░░░░░ ~0.8(接近高斯,部分成功)
α=2.0 ████████████████████ ~1.0(高斯,完全成功!)
α=3.0 ████████░░░░░░░░░░░░ ~0.8(超高斯,部分失败)
α=5.0 ██████░░░░░░░░░░░░░░ ~0.6(接近均匀,失败)
```
**R² 在 α=2(高斯)处尖锐达到峰值**,完美验证定理2。
---
## 🔗 与 ICA 理论的深层联系
### 为什么 ICA 和 LeJEPA 的结论相反?
| 方法 | 目标 | 高斯的角色 |
|------|------|-----------|
| 线性 ICA | 最大化非高斯性(kurtosis | 高斯是"最难分离"的 |
| LeJEPA | 最大化 OU 相关性 | 高斯是"最容易识别"的 |
**根本原因:** ICA 利用高阶统计量(非高斯性)来分离信号;LeJEPA 利用时间结构(OU 相关性)来识别信号。这两种方法对高斯分布的"态度"完全相反。
### Hyvärinen & Pajunen (1999) 的经典结论
> 非线性 ICA 在一般情况下是不可识别的。
LeJEPA 通过**限制分布为高斯**和**使用时间结构**,绕过了这个不可识别性结果。
---
## ⚠️ 实践含义
### 什么时候潜变量近似高斯?
1. **中心极限定理**:如果潜变量是许多独立小因素的叠加,则趋向高斯
2. **宏观物理量**:温度、压力等宏观量通常近似高斯
3. **主成分**:PCA 后的主成分在许多情况下近似高斯
### 什么时候不是高斯?
1. **稀疏信号**:自然图像的小波系数(拉普拉斯分布)
2. **有界量**:角度、概率值(均匀或 Beta 分布)
3. **多峰分布**:类别标签、离散状态
**论文的建议:** 对于非高斯潜变量,LeJEPA 仍然有用,但线性可识别性保证不再成立(见 Topic 5 的近似界)。
---
## ✅ 小结
1. **定理2** 证明高斯分布是线性可识别性的**唯一**充要条件
2. **证明工具**Sturm-Liouville 特征值理论
3. **核心链条**:仿射特征函数 ⟺ 线性得分函数 ⟺ 高斯分布
4. **与 ICA 的对比**LeJEPA 完全颠倒了 ICA 中高斯分布的角色
5. **实验验证**:广义正态分布扫描显示 R² 在 α=2 处尖锐达到峰值
---
## ➡️ 下一步
→ [Topic 5:近似可识别性界](05_approximate_identifiability.md)——当假设只近似满足时,误差如何优雅降级?
+236
View File
@@ -0,0 +1,236 @@
# Topic 5:近似可识别性界(定理 3)
> **前置知识:** [Topic 3:谱分解与线性可识别性](03_spectral_identifiability.md)
> **目标:** 理解当理论假设只近似满足时,恢复误差如何被量化和控制
---
## 🎯 定理 3 的完整陈述
> **定理 3(近似可识别性):** 设编码器 `h` 满足:
> - **近似对齐**`L_align(h) ≤ 2(1-ρ)n + δ`(对齐损失比最优值多 `δ`)
> - **近似白化**`‖Cov(h(z)) - Iₙ‖_F ≤ ε`(协方差矩阵偏离单位阵 `ε`)
>
> 则存在正交矩阵 `Q ∈ O(n)` 使得:
> ```
> E[‖h(z) - Qz‖²] ≤ D + (ε + D)²
> ```
> 其中 `D = δ / (2ρ(1-ρ))`。
---
## 🤔 为什么需要近似版本?
定理1是**精确**结论:在完美条件下,`h(z) = Qz`
但在实践中:
1. **优化不完美**:梯度下降不一定找到全局最优
2. **有限样本**:用有限数据估计的协方差矩阵有误差
3. **模型容量**:神经网络可能无法精确表示线性函数
4. **非高斯数据**:真实数据可能不完全满足高斯假设
定理3告诉我们:**即使条件只近似满足,恢复误差也是有界的,且随误差优雅降级**。
---
## 📐 两个误差参数的含义
### 参数 δ:对齐间隙(Alignment Gap
```
δ = L_align(h) - 2(1-ρ)n ≥ 0
```
- `δ = 0`:完美对齐(定理1的条件)
- `δ > 0`:对齐损失比最优值多 `δ`
**物理含义:** 正样本对的嵌入有多"不相似"(超出理论最优的部分)。
### 参数 ε:白化误差(Whitening Error
```
ε = ‖Cov(h(z)) - Iₙ‖_F
```
- `ε = 0`:完美白化(嵌入是各向同性高斯)
- `ε > 0`:协方差矩阵偏离单位阵
**物理含义:** 嵌入分布有多"不高斯"(协方差矩阵偏离单位阵的程度)。
---
## 📐 归一化量 D 的推导
`δ``D` 的转换:
```
D = δ / (2ρ(1-ρ))
```
**为什么要除以 `2ρ(1-ρ)`**
回忆定理1的证明:对齐损失的最优值是 `2(1-ρ)n`,而相关性的"谱间隙"(线性成分 `ρ` 与二次成分 `ρ²` 之差)是:
```
ρ - ρ² = ρ(1-ρ)
```
所以 `2ρ(1-ρ)` 是"每单位非线性成分对对齐损失的贡献"。除以它可以把对齐间隙 `δ` 转换为"非线性成分的总权重"。
---
## 📐 界的推导(简化版)
### 第一步:从 δ 到非线性权重
由定理1的证明,对齐损失可以写成:
```
L_align = 2n - 2 Σᵢ corr_i = 2n - 2 Σᵢ Σ_d w_{i,d} ρᵈ
```
最优值是 `2(1-ρ)n`(所有 `w_{i,1} = 1`)。
对齐间隙 `δ` 对应于非线性成分的总权重:
```
Σᵢ Σ_{d≥2} w_{i,d} ≤ δ / (2ρ(1-ρ)) = D
```
### 第二步:从非线性权重到恢复误差
非线性成分的总权重 `D` 直接给出恢复误差的一部分:
```
E[‖h(z) - Az‖²] ≤ D
```
其中 `A` 是最优线性近似。
### 第三步:从线性近似到正交矩阵
`A` 不一定是正交的(因为白化误差 `ε`)。从 `A` 到最近的正交矩阵 `Q`Procrustes 问题)引入额外误差:
```
‖A - Q‖_F ≤ ε + D
```
### 第四步:三角不等式组合
```
E[‖h(z) - Qz‖²] ≤ E[‖h(z) - Az‖²] + ‖A - Q‖_F²
≤ D + (ε + D)²
```
---
## 📊 界的数值感受
`ρ = 0.9`,考虑不同的误差水平:
| δ(对齐间隙) | ε(白化误差) | D = δ/(2×0.9×0.1) | 界 D + (ε+D)² |
|-------------|-------------|-------------------|--------------|
| 0 | 0 | 0 | 0(完美!) |
| 0.018 | 0 | 0.1 | 0.1 + 0.01 = 0.11 |
| 0.018 | 0.1 | 0.1 | 0.1 + 0.04 = 0.14 |
| 0.018 | 0.5 | 0.1 | 0.1 + 0.36 = 0.46 |
| 0.18 | 0 | 1.0 | 1.0 + 1.0 = 2.0 |
**观察:**
- 对齐间隙 `δ` 是主要误差来源(通过 `D`
- 白化误差 `ε` 的影响是二阶的(`(ε+D)²` 中的 `ε`
-`D` 很小时,`ε` 的影响可以忽略
---
## 🔧 代码中的量化
在 [`metrics.py`](../lejepa-identifiability/experiments/lejepa_id/metrics.py:16) 中,所有界的量都被计算:
```python
def compute_all_metrics(z, x, h, h_prime, rho, N):
# 白化误差 ε
cov_h = torch.cov(h.T)
epsilon = torch.linalg.norm(cov_h - torch.eye(N), 'fro').item()
# 对齐损失 L_h
L_h = ((h_prime - h) ** 2).sum(dim=1).mean().item()
# 对齐间隙 δ(与理论最优 2(1-ρ)·trace_cov 的差)
delta = max(L_h - 2 * (1 - rho) * trace_cov, 0.0)
# 归一化量 D
spectral_gap = 2 * rho * (1 - rho)
D_bound = delta / spectral_gap
# 近似界
approx_bound = D_bound + (epsilon + D_bound) ** 2
```
---
## 📈 实验验证
论文在所有实验运行中验证了定理3
**图(a)(官网):** 横轴是理论界 `D + (ε+D)²`,纵轴是实际恢复误差。
```
实际误差
│ ●
│ ●●
│ ●●●
│ ●●●●
│●●●●
└──────────────────→ 理论界
所有点在对角线下方(界成立)
```
**关键发现:**
- 所有运行的实际误差均**低于**理论界(界是有效的)
- 对齐损失 `L_h` 是可识别性的**最强预测指标**
- 白化误差 `ε` 的影响相对较小
---
## 🎯 实践含义
### 对训练的指导
1. **优先优化对齐损失**`δ` 是主要误差来源,应该尽量减小
2. **白化误差是次要的**`ε` 的影响是二阶的,不需要过度追求完美白化
3. **监控 D_bound**:训练时可以用 `D_bound` 作为可识别性的代理指标
### 对超参数选择的指导
- **`ρ` 的选择**`ρ` 越大,`2ρ(1-ρ)` 越小,`D` 越大(对 `δ` 更敏感)
- `ρ = 0.5` 时:`2ρ(1-ρ) = 0.5`(最大谱间隙)
- `ρ = 0.9` 时:`2ρ(1-ρ) = 0.18`(较小谱间隙)
- 实践中 `ρ ∈ [0.8, 0.95]` 是好的选择
- **`λ` 的选择**:正则化权重影响白化误差 `ε`
- `λ` 太小:白化不充分,`ε`
- `λ` 太大:对齐损失被忽视,`δ`
---
## 🔬 Lean 4 验证
在 [`Approx.lean`](../lejepa-identifiability/lean/LeJEPA/Approx.lean) 中形式化验证了定理3的核心不等式链。
---
## ✅ 小结
1. **定理3** 量化了"近似满足条件时"的恢复误差
2. **两个误差参数**:对齐间隙 `δ`(主要)和白化误差 `ε`(次要)
3. **界的形式**`D + (ε+D)²`,其中 `D = δ/(2ρ(1-ρ))`
4. **优雅降级**:误差随 `δ, ε → 0` 连续趋向零
5. **实践指导**:优先减小对齐损失,白化误差是次要的
---
## ➡️ 下一步
→ [Topic 6:正交不变性与最优规划](06_planning_equivalence.md)——线性可识别性如何使潜空间规划与真实世界规划等价?
+272
View File
@@ -0,0 +1,272 @@
# Topic 6:正交不变性与最优规划(定理 4)
> **前置知识:** [Topic 3:谱分解与线性可识别性](03_spectral_identifiability.md)、基础控制理论(可选)
> **目标:** 理解为什么线性可识别性足以保证在学到的潜空间中规划与在真实世界中规划完全等价
---
## 🎯 定理 4 的完整陈述
> **定理 4(最优潜空间规划):** 设 `h(z) = Qz``Q ∈ O(n)`,由定理1保证)。对任意有限时域控制问题,若代价函数关于状态是 **O(n)-不变的**,则:
>
> ```
> V̂*(h(z₀)) = V*(z₀) (最优值函数相等)
> â*_{1:T}(h(z₀)) = a*_{1:T}(z₀) (最优动作序列相等)
> ```
**白话翻译:** 如果代价函数不区分旋转方向,那么在学到的潜空间 `ĥ = Qz` 中规划,与在真实潜空间 `z` 中规划,得到的最优策略完全相同。
---
## 🤔 为什么这个结论重要?
### 世界模型的终极目标
学习世界模型的目的是**规划**:给定当前状态,找到最优动作序列。
如果学到的表示 `h(z)` 不能支持正确的规划,那么世界模型就没有实用价值。
定理4说明:**线性可识别性(正交等价)已经足够支持最优规划**——不需要精确恢复 `z`,只需要恢复到旋转等价。
---
## 📐 关键概念:O(n)-不变代价函数
### 定义
代价函数 `(z, a)`**O(n)-不变的**,如果对所有正交矩阵 `Q ∈ O(n)`
```
(Qz, a) = (z, a) 对所有 z, a
```
**直觉:** 代价函数不依赖于坐标系的旋转方向,只依赖于状态的"本质"(如距离、范数等)。
### 常见的 O(n)-不变代价函数
| 代价函数 | 形式 | 不变性 |
|---------|------|--------|
| 欧氏距离到目标 | `‖z - z_goal‖²` | ✅(若 `z_goal` 也旋转) |
| 线性二次调节(LQR | `z^T P z + a^T R a` | ✅(若 `P = cI` |
| 范数惩罚 | `‖z‖²` | ✅ |
| 目标到达 | `𝟙[‖z - z_goal‖ < r]` | ✅ |
| 任意旋转不变量 | `f(‖z‖, ‖a‖, ...)` | ✅ |
### 不满足 O(n)-不变性的代价函数
| 代价函数 | 形式 | 原因 |
|---------|------|------|
| 坐标惩罚 | `z₁²`(只惩罚第一维) | ❌ 旋转后变成 `(Qz)₁²` |
| 非对称目标 | `‖z - [1,0,...,0]‖²` | ❌ 目标方向固定 |
---
## 📐 证明的核心思路
### 关键引理:代价等价
`h(z) = Qz``Q ∈ O(n)`。对任意 O(n)-不变代价函数 ``
```
(h(z), a) = (Qz, a) = (z, a)
```
**这一步是整个证明的核心!** 正交变换不改变 O(n)-不变代价函数的值。
### 轨迹推前(Trajectory Pushforward
设真实动力学为 `p(z'|z, a)`,学到的潜空间动力学为 `p̂(ẑ'|ẑ, a)`(其中 `ẑ = Qz`)。
由于 `h(z) = Qz` 是线性双射,学到的动力学是真实动力学的**推前**:
```
p̂(ẑ'|ẑ, a) = p(Q⁻¹ẑ'|Q⁻¹ẑ, a) = p(z'|z, a)
```
(因为 `Q⁻¹ = Q^T` 对正交矩阵成立)
### 总代价等价
对任意动作序列 `a_{1:T}`,从初始状态 `z₀` 出发的总期望代价:
```
J(a_{1:T}; ẑ₀) = E[Σ_t (ẑ_t, a_t) + _T(ẑ_T) | ẑ₀ = Qz₀]
= E[Σ_t (Qz_t, a_t) + _T(Qz_T) | z₀]
= E[Σ_t (z_t, a_t) + _T(z_T) | z₀] O(n)-不变性)
= J(a_{1:T}; z₀)
```
**结论:** 对任意动作序列,两个空间中的总代价完全相同!
### 最优性等价
由于对所有 `a_{1:T}` 代价相等,最小化代价的动作序列也相同:
```
a*_{1:T}(ẑ₀) = argmin_a J(a; ẑ₀) = argmin_a J(a; z₀) = a*_{1:T}(z₀)
```
最优值函数也相等:
```
V̂*(ẑ₀) = min_a J(a; ẑ₀) = min_a J(a; z₀) = V*(z₀)
```
---
## 🎨 几何直觉
```
真实潜空间 z: 学到的潜空间 ẑ = Qz:
z₂ ẑ₂
↑ ↑
│ ●goal │ ●goal'
│ │
│●start │ ●start'
└──────→ z₁ └──────→ ẑ₁
最优路径(蓝色): 最优路径(蓝色):
start → goal start' → goal'
(直线,欧氏距离最短) (直线,欧氏距离最短)
两条路径在旋转意义下完全相同!
```
---
## 🔧 Lean 4 验证([`Planning.lean`](../lejepa-identifiability/lean/LeJEPA/Planning.lean)
```lean
-- 核心:对任意动作序列,两个空间的总代价相等
theorem planning_equivalence
(cp : ControlProblem n Action) (Q : Latent n Latent n)
(hinv : IsOrthogonalInvariant cp Q)
(a : Plan Action T) (z : Latent n) :
totalCost cp E_hat a (Q z) = totalCost cp E a z
-- 推论:最优动作序列相同
theorem minimizer_equivalence ... :
( a', cost_hat a (Q z) cost_hat a' (Q z))
( a', cost a z cost a' z)
-- 推论:最优值函数相等
theorem value_equivalence ... :
totalCost cp E a z = V
totalCost cp E_hat a (Q z) = V
```
---
## 🔬 实验验证:DMC Reacher
### 实验设置
- **环境**DeepMind Control Suite 的 Reacher 任务
- **输入**:像素图像(64×64 RGB
- **潜变量**2D 关节角度 `z = (θ₁, θ₂)`
- **编码器**CNN(见 [`models.py`](../lejepa-identifiability/experiments/lejepa_id/models.py:46)
- **规划方式**:在潜空间中线性插值,用最近邻检索解码
### 两种训练数据
| 数据类型 | 生成方式 | 分布 | 可识别性 |
|---------|---------|------|---------|
| OU 采样 | `z' = ρz + √(1-ρ²)η` | 各向同性高斯 | ✅ 高(满足定理1) |
| RL 轨迹 | 训练好的策略采样 | 非高斯、各向异性 | ❌ 低(违反假设) |
### 实验结果
```
规划代价(路径长度,越低越好,理想值=1):
Oracle(关节空间直线): ████░░░░░░ ~1.0(基准)
OU 编码器: ████░░░░░░ ~1.0(与 oracle 无统计显著差异)
轨迹编码器: ██████░░░░ ~1.5(显著偏高)
```
**结论:** OU 编码器(满足定理1条件)的规划质量与 oracle 相当;轨迹编码器(违反假设)的规划质量显著下降。
### 可视化
```
[顶行] Oracle
●──────────────────● (关节空间直线,平滑弧线)
[中行] OU 编码器(可识别):
●──────────────────● (紧密跟随 oracle)
[底行] 轨迹编码器(不可识别):
●────╮╰──────────● (偏离,因为潜空间扭曲)
```
---
## 🔗 与世界模型的联系
### 什么是"可证明地学到世界模型"?
论文的标题问题:"When Does LeJEPA Learn a World Model?"
答案(由定理4给出):
> **LeJEPA 学到世界模型,当且仅当它实现了线性可识别性。**
因为:
- 线性可识别性 → `h(z) = Qz`(正交等价)
- 正交等价 → O(n)-不变代价函数下的规划等价(定理4)
- 规划等价 → 可以在学到的潜空间中做最优规划
- 最优规划 → 学到的表示是"可用的世界模型"
---
## ⚠️ 定理4的局限性
### 1. 只覆盖 O(n)-不变代价函数
如果代价函数依赖于特定坐标方向(如"向北走"),则定理4不适用。
**实践中:** 大多数物理任务的代价函数(距离、能量、时间)都是旋转不变的。
### 2. 只处理编码器侧
定理4假设动力学 `p̂(ẑ'|ẑ, a)` 是真实动力学的推前。但在实践中,还需要学习一个**转移模型**(predictor)。
**未来工作:** 动作条件转移 `p̂(ẑ'|ẑ, a)` 的可识别性(与因果表示学习相关)。
### 3. 有限时域
定理4是有限时域(`T` 步)的结论。无限时域(折扣 MDP)的情况需要额外分析。
---
## ✅ 小结
1. **定理4** 证明线性可识别性足以保证最优规划等价
2. **关键条件**:代价函数是 O(n)-不变的(旋转不变)
3. **证明核心**:正交变换不改变 O(n)-不变代价函数的值
4. **实验验证**:OU 编码器的规划质量与 oracle 相当,轨迹编码器显著下降
5. **世界模型含义**:线性可识别性 = 可证明地学到世界模型
---
## 🏁 四个定理的完整图景
```
定理1(正向):高斯世界 + LeJEPA → 线性可识别性 h(z) = Qz
定理2(逆向):高斯是唯一使线性可识别性成立的分布
定理3(近似):条件近似满足时,误差 ≤ D + (ε+D)²
定理4(应用):线性可识别性 → 最优潜空间规划
```
**核心信息:** LeJEPA 在高斯世界中可证明地学到世界模型,且这个保证对近似条件优雅降级,并直接支持最优规划。
---
## ➡️ 返回总览
← [README:数学 Topic 导航](README.md)
← [论文完整笔记](../lejepa_world_model_notes.md)
+129
View File
@@ -0,0 +1,129 @@
# LeJEPA 数学证明分解导航
> 本目录将论文 *When Does LeJEPA Learn a World Model?* 的数学证明拆分为 6 个独立 topic,每个 topic 专注一个概念,循序渐进。
>
> **建议阅读顺序:** Topic 1 → 2 → 3 → 4 → 5 → 6
---
## 📚 Topic 列表
| # | 文件 | 核心概念 | 对应定理 | 难度 |
|---|------|---------|---------|------|
| 1 | [Hermite 多项式](01_hermite_polynomials.md) | 高斯分布下的函数分解工具 | 定理1基础 | ⭐⭐ |
| 2 | [OU 过程与 Mehler 公式](02_ou_process_mehler.md) | 正样本对生成 + 高阶衰减 | 定理1基础 | ⭐⭐ |
| 3 | [谱分解与线性可识别性](03_spectral_identifiability.md) | 定理1完整证明 | **定理 1** | ⭐⭐⭐ |
| 4 | [Sturm-Liouville 与高斯唯一性](04_sturm_liouville_uniqueness.md) | 为什么只有高斯分布有效 | **定理 2** | ⭐⭐⭐ |
| 5 | [近似可识别性界](05_approximate_identifiability.md) | 误差如何优雅降级 | **定理 3** | ⭐⭐ |
| 6 | [正交不变性与最优规划](06_planning_equivalence.md) | 潜空间规划等价于真实规划 | **定理 4** | ⭐⭐ |
---
## 🗺️ 知识依赖图
```
Topic 1: Hermite 多项式
Topic 2: OU 过程 + Mehler 公式
Topic 3: 谱分解 → 线性可识别性(定理1)
│ │
↓ ↓
Topic 4: 高斯唯一性 Topic 5: 近似界 Topic 6: 最优规划
(定理2) (定理3) (定理4)
```
---
## 🎯 四大定理速查
### 定理 1:线性可识别性(正向)
> 高斯世界 + LeJEPA 最优 → `h(z) = Qz`(正交矩阵)
**核心工具:** Hermite 谱分解 + OU 衰减 + 最优性条件
### 定理 2:高斯唯一性(逆向)
> 高斯分布是**唯一**使线性可识别性成立的分布
**核心工具:** Sturm-Liouville 特征值理论 + 得分函数分析
### 定理 3:近似可识别性
> 条件近似满足时,误差 `≤ D + (ε+D)²`,其中 `D = δ/(2ρ(1-ρ))`
**核心工具:** 三角不等式 + Procrustes 分析
### 定理 4:最优潜空间规划
> 线性可识别性 → O(n)-不变代价函数下的规划完全等价
**核心工具:** 正交不变性 + 轨迹推前
---
## 🔑 关键公式速查
### LeJEPA 训练目标
```
L(h) = λ · L_SIG + (1-λ) · L_align
L_align = E[‖h(z') - h(z)‖²] # 对齐损失
L_SIG = SIGReg(h(z), N(0,I)) # 高斯正则化
```
### OU 过程(正样本对生成)
```
z' = ρz + √(1-ρ²) η, η ~ N(0, I_n), ρ ∈ (0,1)
```
### Mehler 公式(核心不等式)
```
E[h_i(z') · h_i(z)] = Σ_d w_{i,d} · ρᵈ ≤ ρ
等号 ⟺ w_{i,1} = 1(纯线性)
```
### 近似界
```
E[‖h(z) - Qz‖²] ≤ D + (ε + D)²
D = δ / (2ρ(1-ρ))
δ = L_align - 2(1-ρ)n(对齐间隙)
ε = ‖Cov(h(z)) - I‖_F(白化误差)
```
---
## 🔧 代码对应关系
| 数学概念 | 代码实现 |
|---------|---------|
| SIGReg 正则化 | [`losses.py:SIGReg`](../lejepa-identifiability/experiments/lejepa_id/losses.py) |
| 对齐损失 | [`losses.py:alignment_loss`](../lejepa-identifiability/experiments/lejepa_id/losses.py) |
| OU 增强 | [`data.py:ou_augment`](../lejepa-identifiability/experiments/lejepa_id/data.py) |
| R²、正交误差、近似界 | [`metrics.py:compute_all_metrics`](../lejepa-identifiability/experiments/lejepa_id/metrics.py) |
| 训练循环 | [`engine.py:train_and_evaluate`](../lejepa-identifiability/experiments/lejepa_id/engine.py) |
---
## 🔬 Lean 4 形式化验证对应
| 定理 | Lean 文件 | 验证状态 |
|------|----------|---------|
| 定理1Hermite 路径) | [`lean/LeJEPA/Hermite.lean`](../lejepa-identifiability/lean/LeJEPA/Hermite.lean) | ✅ 零 sorry |
| 定理2(高斯唯一性) | [`lean/LeJEPA/Uniqueness.lean`](../lejepa-identifiability/lean/LeJEPA/Uniqueness.lean) | ✅ 零 sorry |
| 定理3(近似界) | [`lean/LeJEPA/Approx.lean`](../lejepa-identifiability/lean/LeJEPA/Approx.lean) | ✅ 零 sorry |
| 定理4(规划等价) | [`lean/LeJEPA/Planning.lean`](../lejepa-identifiability/lean/LeJEPA/Planning.lean) | ✅ 零 sorry |
| 附录EDirichlet 路径) | [`lean/LeJEPA/Dirichlet.lean`](../lejepa-identifiability/lean/LeJEPA/Dirichlet.lean) | ✅ 零 sorry |
---
## 💡 核心洞见(一句话总结)
> **LeJEPA 将经典 ICA 的叙事完全颠倒:** 在线性 ICA 中,高斯分布是源分离**失败**的唯一情况;在 LeJEPA 的非线性设置中,高斯分布恰恰是使线性可识别性**成立**的唯一分布。
---
## 📖 相关文件
- [论文完整笔记](../lejepa_world_model_notes.md) — 综合分析(含代码实现、官网图示)
- [资源汇总](../lejepa_resources.md) — 视频、论文、代码、HuggingFace 模型
- [代码仓库](../lejepa-identifiability/) — 本地 clone 的官方实现