Add detailed lecture plan and summary for LeJEPA four theorems

- Introduced a comprehensive lecture plan for the four main theorems in LeJEPA, including knowledge dependency graphs, detailed outlines for each topic, and corresponding Lean 4 files for formal verification.
- Created a summary document encapsulating the core insights and mathematical structures of the four theorems, emphasizing their interdependencies and implications in the context of LeJEPA.
This commit is contained in:
gaojie
2026-06-05 16:30:24 +08:00
parent cf3691ad8b
commit b5499c7ea0
13 changed files with 4254 additions and 958 deletions
+247
View File
@@ -0,0 +1,247 @@
# LeJEPA 研究全面分析
> **项目位置:** [`/Users/mac/code/worldmodel/JEPA/`](../JEPA/)
> **分析日期:** 2026-06-05
---
## 📌 一、LeJEPA 是什么?
**LeJEPA** = **L**ean **E**fficient **JEA**PAYann LeCun 团队的自监督学习框架)
### 核心组成
```
LeJEPA = JEPA (Joint-Embedding Predictive Architecture) + SIGReg
```
| 组件 | 作用 |
|------|------|
| **JEPA** | 在表示空间做预测,避免像素级生成的容量浪费 |
| **SIGReg** | Sketched Isotropic Gaussian Regularization(切片各向同性高斯正则化)|
| **对齐损失** | 拉近正样本对的嵌入表示 |
### SIGReg 的核心设计
```python
# 特征函数方法(而非矩匹配)
L_SIG = E[|φ_h(t) - φ_N(0,I)(t)|²] # 特征函数差异
```
- 用**特征函数(Fourier变换)**的实部/虚部偏差度量分布差异
- 随机切片将高维问题降为一维投影,线性时间复杂度
- `knots=17` 个积分节点 + `n_slices=256` 个随机方向
---
## 📐 二、四大定理——理论核心贡献
### 数学框架:世界的三条假设
| 假设 | 数学表述 | 直觉 |
|------|---------|------|
| **独立性** | p(zᵢ) ⊥ p(zⱼ),转移也独立 | 世界的各自由度互不干扰 |
| **平稳性** | p(z) = p(z') | 两个视图来自同一生成过程 |
| **加性噪声** | z'ᵢ = mᵢ(zᵢ) + ηᵢ | 扰动是叠加在信号上的噪声 |
### 高斯世界(Gaussian World
```
z' = ρz + √(1-ρ²)η, η ~ N(0, Iₙ), ρ ∈ (0,1)
```
### 定理总览图
```
┌─────────────────────────────────────────────────────┐
│ 四大定理闭环 │
├─────────────────────────────────────────────────────┤
│ │
│ 定理1(正向):高斯世界 + LeJEPA → h(z) = Qz │
│ ↕ │
│ 定理2(逆向):高斯是唯一使可识别性成立的分布 │
│ ↓ │
│ 定理3(近似):条件近似满足时,误差有界 │
│ ↓ │
│ 定理4(应用):线性可识别 → 潜空间规划 = 真实世界 │
│ │
└─────────────────────────────────────────────────────┘
```
### 定理1:线性可识别性(正向)
> **在高斯世界中,满足 LeJEPA 目标的最优表示 h 当且仅当 h(z) = QzQ ∈ O(n)**
**证明链条(6步):**
```
高斯约束 + 最优对齐
[步骤1] Hermite展开:hᵢ(z) = Σ cₐ Heₐ(z)
[步骤2] Mehler公式:corrᵢ = Σ wₐ ρᵈ
[步骤3] 关键不等式:corrᵢ ≤ ρ(等号 ⟺ w₁=1)
[步骤4] 最优性条件:L_align = 2(1-ρ)n → 每个 corrᵢ = ρ
[步骤5] 线性性:每个 hᵢ 是线性函数
[步骤6] 正交性:高斯约束 + 线性 → Q ∈ O(n)
```
**核心直觉:** OU过程对高阶非线性成分衰减更快(ρᵈ 随 d 指数衰减),所以线性映射是唯一最优解。
### 定理2:高斯分布的唯一性(逆向)
> **在满足世界假设的所有分布中,高斯分布是唯一使 LeJEPA 实现线性可识别性的分布**
**与 ICA 的完全反转:**
| 场景 | 高斯分布 | 非高斯分布 |
|------|---------|-----------|
| **线性 ICA** | ❌ 失败(旋转不可区分) | ✅ 成功 |
| **LeJEPA** | ✅ 成功 | ❌ 失败 |
### 定理3:近似可识别性
> **当条件只近似满足时,恢复误差优雅降级:**
```
E[‖h(z) - Qz‖²] ≤ D + (ε + D)²
```
| 参数 | 定义 | 含义 |
|------|------|------|
| δ(对齐间隙) | L_align(h) - 2(1-ρ)n ≥ 0 | 正样本对有多"不相似" |
| ε(白化误差) | ‖Cov(h(z)) - Iₙ‖_F | 嵌入分布有多"不高斯" |
**关键发现:**
- **对齐质量 δ 是主要瓶颈**(通过 D 线性传播)
- **白化误差 ε 影响是二阶的**(在平方项中)
### 定理4:最优潜空间规划
> **若 h(z) = Qz,则在任意 O(n)-不变代价函数下,潜空间规划与真实世界规划完全等价**
```
V̂*(h(z₀)) = V*(z₀) 且 â*_{1:T}(h(z₀)) = a*_{1:T}(z₀)
```
**覆盖的控制问题:** 欧氏距离到目标、LQR(P=cI)、范数惩罚、目标到达
---
## 🔬 三、实验验证体系
### 四类实验对应四大定理
| 实验 | 验证目标 | 关键结果 |
|------|---------|---------|
| **实验1:正向可识别性** | 定理1 | SIGReg R² > 0.999N=2→1024 |
| **实验2:逆向验证** | 定理2 | R²在α=2(高斯)处尖锐峰值 |
| **实验3:近似界验证** | 定理3 | 实际误差均低于理论界 |
| **实验4:潜空间规划** | 定理4 | OU编码器与oracle无差异 |
### 三种正则化方法对比
| N | SIGReg R²(h→z) | VICReg R²(h→z) | InfoNCE R²(h→z) |
|---|----------------|----------------|-----------------|
| 2 | **0.999998** | 0.999996 | 0.951 |
| 256 | **0.999884** | 0.999889 | 0.697 |
| 1024 | **0.999561** | 0.999582 | 0.720 |
> SIGReg和VICReg在所有维度保持 R² > 0.999InfoNCE在高维退化
---
## 🔧 四、代码仓库结构
```
lejepa-identifiability/
├── lean/ # Lean4 形式化证明(零sorry
│ └── LeJEPA/
│ ├── Hermite.lean # 定理1Hermite多项式路径)
│ ├── Uniqueness.lean # 定理2(高斯唯一性,Sturm-Liouville
│ ├── Approx.lean # 定理3(近似可识别性界)
│ ├── Dirichlet.lean # 附录EDirichlet能量替代证明)
│ └── Planning.lean # 定理4(规划等价)
├── experiments/
│ ├── lejepa_id/ # 核心实验代码
│ │ ├── mixing.py # 非线性混合(spiral/banana/sinusoid/coupling
│ │ ├── losses.py # SIGReg、白化损失、对齐损失、InfoNCE
│ │ ├── models.py # MLP/CNN编码器、MatchedEncoder
│ │ ├── data.py # 潜变量采样、OU增强
│ │ ├── metrics.py # R²、正交误差、近似界量化、Procrustes
│ │ ├── reacher.py # DMC Reacher渲染与数据集
│ │ └── engine.py # 训练循环(warmup + cosine LR
│ ├── run.py # 2D/scaling/gennorm/grid统一入口
│ └── configs/ # 实验超参数YAML
```
---
## 📊 五、与相关工作的关系
### LeJEPA vs SFA(慢特征分析)
| 维度 | Sprekeler et al. (2014) SFA | LeJEPA(本文)|
|------|---------------------------|------------|
| 可识别性类 | 置换等价 | **正交等价** |
| 潜变量分布 | 任意独立 | **高斯(或i.i.d.** |
| 转移结构 | 需要不同速率 | **需要各向同性** |
| 提取方式 | 顺序(贪心) | **同时** |
| 函数空间 | 固定多项式核 | **学习(神经网络)** |
| 近似界 | ❌ 无 | ✅ D+(ε+D)² |
| 实用算法 | xSFA(脆弱,≤6个潜变量) | **LeJEPA/SIGReg(可扩展)** |
### LeJEPA 生态系统
```
LeJEPA 生态
├── 理论基础
│ ├── arXiv:2511.08544 (LeJEPA原始论文)
│ └── arXiv:2605.26379 (可识别性理论,本文)
├── 应用扩展
│ ├── arXiv:2603.19312 (LeWorldModel,像素控制)
│ └── arXiv:2602.11389 (Causal-JEPA,因果干预)
├── 代码
│ ├── github.com/rbalestr-lab/lejepa (LeJEPA训练)
│ └── github.com/klindtlab/lejepa-identifiability (可识别性实验)
└── 演示
├── YouTube: youtu.be/EioGDo67ZDs (官方视频)
└── Colab: 交互式2D演示 (~30秒,T4 GPU)
```
---
## 💡 六、核心洞见与启示
### 一句话总结
> **LeJEPA将经典ICA的叙事完全颠倒:** 在线性ICA中,高斯分布是源分离**失败**的唯一情况;在LeJEPA的非线性设置中,高斯分布恰恰是使线性可识别性**成立**的唯一分布。
### 对 WorldModel/PRISM 项目的启示
1. **探索策略的重要性:** 近似各向同性随机游走的探索策略能保持数据在理论覆盖范围内
2. **SIGReg优于VICReg** 对非高斯潜变量更鲁棒,适合真实场景
3. **对齐质量是关键瓶颈:** 训练中应优先减小对齐损失
4. **线性可识别性 → 规划等价:** 为PRISM空间记忆架构中的潜空间规划提供理论保障
---
## ⚠️ 七、局限性与未来方向
| 局限 | 说明 |
|------|------|
| **潜变量是否真的高斯?** | 中心极限定理支持宏观量趋向高斯,但无法从观测中验证 |
| **维度不匹配(m≠n** | 编码器维度与真实潜变量维度不同时的行为未理论化 |
| **有限样本** | 定理3是总体层面结论,样本复杂度和训练动态未涉及 |
| **动作条件转移** | 本文只处理编码器侧,p̂(ẑ'|ẑ,a)的可识别性是下一步 |
---
## 📚 八、项目内相关文件索引
| 资源类型 | 路径 |
|---------|------|
| **论文精读** | [`JEPA/LeJEPA/paper_reading.md`](../JEPA/LeJEPA/paper_reading.md) |
| **综合笔记** | [`JEPA/README.md`](../JEPA/README.md) |
| **数学证明分解** | [`JEPA/math/`](../math/) — 6个topic拆解四大定理 |
| **代码仓库** | [`JEPA/lejepa-identifiability/`](../lejepa-identifiability/) |
| **Lean4证明** | [`JEPA/lejepa-identifiability/lean/`](../lejepa-identifiability/lean/) |
| **论文PDF** | [`research/papers/2605.26379v1.pdf`](../research/papers/2605.26379v1.pdf) |
---
## 🎯 九、下一步研究建议
基于以上分析,以下是可能的后续研究方向:
1. **扩展动作条件转移的可识别性理论**(定理4的下一步)
2. **探索非高斯分布下的近似可识别性界**(定理3的推广)
3. **将LeJEPA框架应用于PRISM空间记忆架构**(定理4的实际应用)
4. **研究有限样本下的收敛速率和泛化界**(理论完善)