Files
worldmodel/plans/LEJEPA_research_analysis.md
gaojie b5499c7ea0 Add detailed lecture plan and summary for LeJEPA four theorems
- Introduced a comprehensive lecture plan for the four main theorems in LeJEPA, including knowledge dependency graphs, detailed outlines for each topic, and corresponding Lean 4 files for formal verification.
- Created a summary document encapsulating the core insights and mathematical structures of the four theorems, emphasizing their interdependencies and implications in the context of LeJEPA.
2026-06-05 16:30:24 +08:00

248 lines
10 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# LeJEPA 研究全面分析
> **项目位置:** [`/Users/mac/code/worldmodel/JEPA/`](../JEPA/)
> **分析日期:** 2026-06-05
---
## 📌 一、LeJEPA 是什么?
**LeJEPA** = **L**ean **E**fficient **JEA**PAYann LeCun 团队的自监督学习框架)
### 核心组成
```
LeJEPA = JEPA (Joint-Embedding Predictive Architecture) + SIGReg
```
| 组件 | 作用 |
|------|------|
| **JEPA** | 在表示空间做预测,避免像素级生成的容量浪费 |
| **SIGReg** | Sketched Isotropic Gaussian Regularization(切片各向同性高斯正则化)|
| **对齐损失** | 拉近正样本对的嵌入表示 |
### SIGReg 的核心设计
```python
# 特征函数方法(而非矩匹配)
L_SIG = E[|φ_h(t) - φ_N(0,I)(t)|²] # 特征函数差异
```
- 用**特征函数(Fourier变换)**的实部/虚部偏差度量分布差异
- 随机切片将高维问题降为一维投影,线性时间复杂度
- `knots=17` 个积分节点 + `n_slices=256` 个随机方向
---
## 📐 二、四大定理——理论核心贡献
### 数学框架:世界的三条假设
| 假设 | 数学表述 | 直觉 |
|------|---------|------|
| **独立性** | p(zᵢ) ⊥ p(zⱼ),转移也独立 | 世界的各自由度互不干扰 |
| **平稳性** | p(z) = p(z') | 两个视图来自同一生成过程 |
| **加性噪声** | z'ᵢ = mᵢ(zᵢ) + ηᵢ | 扰动是叠加在信号上的噪声 |
### 高斯世界(Gaussian World
```
z' = ρz + √(1-ρ²)η, η ~ N(0, Iₙ), ρ ∈ (0,1)
```
### 定理总览图
```
┌─────────────────────────────────────────────────────┐
│ 四大定理闭环 │
├─────────────────────────────────────────────────────┤
│ │
│ 定理1(正向):高斯世界 + LeJEPA → h(z) = Qz │
│ ↕ │
│ 定理2(逆向):高斯是唯一使可识别性成立的分布 │
│ ↓ │
│ 定理3(近似):条件近似满足时,误差有界 │
│ ↓ │
│ 定理4(应用):线性可识别 → 潜空间规划 = 真实世界 │
│ │
└─────────────────────────────────────────────────────┘
```
### 定理1:线性可识别性(正向)
> **在高斯世界中,满足 LeJEPA 目标的最优表示 h 当且仅当 h(z) = QzQ ∈ O(n)**
**证明链条(6步):**
```
高斯约束 + 最优对齐
[步骤1] Hermite展开:hᵢ(z) = Σ cₐ Heₐ(z)
[步骤2] Mehler公式:corrᵢ = Σ wₐ ρᵈ
[步骤3] 关键不等式:corrᵢ ≤ ρ(等号 ⟺ w₁=1)
[步骤4] 最优性条件:L_align = 2(1-ρ)n → 每个 corrᵢ = ρ
[步骤5] 线性性:每个 hᵢ 是线性函数
[步骤6] 正交性:高斯约束 + 线性 → Q ∈ O(n)
```
**核心直觉:** OU过程对高阶非线性成分衰减更快(ρᵈ 随 d 指数衰减),所以线性映射是唯一最优解。
### 定理2:高斯分布的唯一性(逆向)
> **在满足世界假设的所有分布中,高斯分布是唯一使 LeJEPA 实现线性可识别性的分布**
**与 ICA 的完全反转:**
| 场景 | 高斯分布 | 非高斯分布 |
|------|---------|-----------|
| **线性 ICA** | ❌ 失败(旋转不可区分) | ✅ 成功 |
| **LeJEPA** | ✅ 成功 | ❌ 失败 |
### 定理3:近似可识别性
> **当条件只近似满足时,恢复误差优雅降级:**
```
E[‖h(z) - Qz‖²] ≤ D + (ε + D)²
```
| 参数 | 定义 | 含义 |
|------|------|------|
| δ(对齐间隙) | L_align(h) - 2(1-ρ)n ≥ 0 | 正样本对有多"不相似" |
| ε(白化误差) | ‖Cov(h(z)) - Iₙ‖_F | 嵌入分布有多"不高斯" |
**关键发现:**
- **对齐质量 δ 是主要瓶颈**(通过 D 线性传播)
- **白化误差 ε 影响是二阶的**(在平方项中)
### 定理4:最优潜空间规划
> **若 h(z) = Qz,则在任意 O(n)-不变代价函数下,潜空间规划与真实世界规划完全等价**
```
V̂*(h(z₀)) = V*(z₀) 且 â*_{1:T}(h(z₀)) = a*_{1:T}(z₀)
```
**覆盖的控制问题:** 欧氏距离到目标、LQR(P=cI)、范数惩罚、目标到达
---
## 🔬 三、实验验证体系
### 四类实验对应四大定理
| 实验 | 验证目标 | 关键结果 |
|------|---------|---------|
| **实验1:正向可识别性** | 定理1 | SIGReg R² > 0.999N=2→1024 |
| **实验2:逆向验证** | 定理2 | R²在α=2(高斯)处尖锐峰值 |
| **实验3:近似界验证** | 定理3 | 实际误差均低于理论界 |
| **实验4:潜空间规划** | 定理4 | OU编码器与oracle无差异 |
### 三种正则化方法对比
| N | SIGReg R²(h→z) | VICReg R²(h→z) | InfoNCE R²(h→z) |
|---|----------------|----------------|-----------------|
| 2 | **0.999998** | 0.999996 | 0.951 |
| 256 | **0.999884** | 0.999889 | 0.697 |
| 1024 | **0.999561** | 0.999582 | 0.720 |
> SIGReg和VICReg在所有维度保持 R² > 0.999InfoNCE在高维退化
---
## 🔧 四、代码仓库结构
```
lejepa-identifiability/
├── lean/ # Lean4 形式化证明(零sorry
│ └── LeJEPA/
│ ├── Hermite.lean # 定理1Hermite多项式路径)
│ ├── Uniqueness.lean # 定理2(高斯唯一性,Sturm-Liouville
│ ├── Approx.lean # 定理3(近似可识别性界)
│ ├── Dirichlet.lean # 附录EDirichlet能量替代证明)
│ └── Planning.lean # 定理4(规划等价)
├── experiments/
│ ├── lejepa_id/ # 核心实验代码
│ │ ├── mixing.py # 非线性混合(spiral/banana/sinusoid/coupling
│ │ ├── losses.py # SIGReg、白化损失、对齐损失、InfoNCE
│ │ ├── models.py # MLP/CNN编码器、MatchedEncoder
│ │ ├── data.py # 潜变量采样、OU增强
│ │ ├── metrics.py # R²、正交误差、近似界量化、Procrustes
│ │ ├── reacher.py # DMC Reacher渲染与数据集
│ │ └── engine.py # 训练循环(warmup + cosine LR
│ ├── run.py # 2D/scaling/gennorm/grid统一入口
│ └── configs/ # 实验超参数YAML
```
---
## 📊 五、与相关工作的关系
### LeJEPA vs SFA(慢特征分析)
| 维度 | Sprekeler et al. (2014) SFA | LeJEPA(本文)|
|------|---------------------------|------------|
| 可识别性类 | 置换等价 | **正交等价** |
| 潜变量分布 | 任意独立 | **高斯(或i.i.d.** |
| 转移结构 | 需要不同速率 | **需要各向同性** |
| 提取方式 | 顺序(贪心) | **同时** |
| 函数空间 | 固定多项式核 | **学习(神经网络)** |
| 近似界 | ❌ 无 | ✅ D+(ε+D)² |
| 实用算法 | xSFA(脆弱,≤6个潜变量) | **LeJEPA/SIGReg(可扩展)** |
### LeJEPA 生态系统
```
LeJEPA 生态
├── 理论基础
│ ├── arXiv:2511.08544 (LeJEPA原始论文)
│ └── arXiv:2605.26379 (可识别性理论,本文)
├── 应用扩展
│ ├── arXiv:2603.19312 (LeWorldModel,像素控制)
│ └── arXiv:2602.11389 (Causal-JEPA,因果干预)
├── 代码
│ ├── github.com/rbalestr-lab/lejepa (LeJEPA训练)
│ └── github.com/klindtlab/lejepa-identifiability (可识别性实验)
└── 演示
├── YouTube: youtu.be/EioGDo67ZDs (官方视频)
└── Colab: 交互式2D演示 (~30秒,T4 GPU)
```
---
## 💡 六、核心洞见与启示
### 一句话总结
> **LeJEPA将经典ICA的叙事完全颠倒:** 在线性ICA中,高斯分布是源分离**失败**的唯一情况;在LeJEPA的非线性设置中,高斯分布恰恰是使线性可识别性**成立**的唯一分布。
### 对 WorldModel/PRISM 项目的启示
1. **探索策略的重要性:** 近似各向同性随机游走的探索策略能保持数据在理论覆盖范围内
2. **SIGReg优于VICReg** 对非高斯潜变量更鲁棒,适合真实场景
3. **对齐质量是关键瓶颈:** 训练中应优先减小对齐损失
4. **线性可识别性 → 规划等价:** 为PRISM空间记忆架构中的潜空间规划提供理论保障
---
## ⚠️ 七、局限性与未来方向
| 局限 | 说明 |
|------|------|
| **潜变量是否真的高斯?** | 中心极限定理支持宏观量趋向高斯,但无法从观测中验证 |
| **维度不匹配(m≠n** | 编码器维度与真实潜变量维度不同时的行为未理论化 |
| **有限样本** | 定理3是总体层面结论,样本复杂度和训练动态未涉及 |
| **动作条件转移** | 本文只处理编码器侧,p̂(ẑ'|ẑ,a)的可识别性是下一步 |
---
## 📚 八、项目内相关文件索引
| 资源类型 | 路径 |
|---------|------|
| **论文精读** | [`JEPA/LeJEPA/paper_reading.md`](../JEPA/LeJEPA/paper_reading.md) |
| **综合笔记** | [`JEPA/README.md`](../JEPA/README.md) |
| **数学证明分解** | [`JEPA/math/`](../math/) — 6个topic拆解四大定理 |
| **代码仓库** | [`JEPA/lejepa-identifiability/`](../lejepa-identifiability/) |
| **Lean4证明** | [`JEPA/lejepa-identifiability/lean/`](../lejepa-identifiability/lean/) |
| **论文PDF** | [`research/papers/2605.26379v1.pdf`](../research/papers/2605.26379v1.pdf) |
---
## 🎯 九、下一步研究建议
基于以上分析,以下是可能的后续研究方向:
1. **扩展动作条件转移的可识别性理论**(定理4的下一步)
2. **探索非高斯分布下的近似可识别性界**(定理3的推广)
3. **将LeJEPA框架应用于PRISM空间记忆架构**(定理4的实际应用)
4. **研究有限样本下的收敛速率和泛化界**(理论完善)