Files
worldmodel/plans/LEJEPA_research_analysis.md
gaojie b5499c7ea0 Add detailed lecture plan and summary for LeJEPA four theorems
- Introduced a comprehensive lecture plan for the four main theorems in LeJEPA, including knowledge dependency graphs, detailed outlines for each topic, and corresponding Lean 4 files for formal verification.
- Created a summary document encapsulating the core insights and mathematical structures of the four theorems, emphasizing their interdependencies and implications in the context of LeJEPA.
2026-06-05 16:30:24 +08:00

10 KiB
Raw Permalink Blame History

LeJEPA 研究全面分析

项目位置: /Users/mac/code/worldmodel/JEPA/ 分析日期: 2026-06-05


📌 一、LeJEPA 是什么?

LeJEPA = Lean Efficient JEAPAYann LeCun 团队的自监督学习框架)

核心组成

LeJEPA = JEPA (Joint-Embedding Predictive Architecture) + SIGReg
组件 作用
JEPA 在表示空间做预测,避免像素级生成的容量浪费
SIGReg Sketched Isotropic Gaussian Regularization(切片各向同性高斯正则化)
对齐损失 拉近正样本对的嵌入表示

SIGReg 的核心设计

# 特征函数方法(而非矩匹配)
L_SIG = E[|φ_h(t) - φ_N(0,I)(t)|²]  # 特征函数差异
  • 用**特征函数(Fourier变换)**的实部/虚部偏差度量分布差异
  • 随机切片将高维问题降为一维投影,线性时间复杂度
  • knots=17 个积分节点 + n_slices=256 个随机方向

📐 二、四大定理——理论核心贡献

数学框架:世界的三条假设

假设 数学表述 直觉
独立性 p(zᵢ) ⊥ p(zⱼ),转移也独立 世界的各自由度互不干扰
平稳性 p(z) = p(z') 两个视图来自同一生成过程
加性噪声 z'ᵢ = mᵢ(zᵢ) + ηᵢ 扰动是叠加在信号上的噪声

高斯世界(Gaussian World

z' = ρz + √(1-ρ²)η,   η ~ N(0, Iₙ),   ρ ∈ (0,1)

定理总览图

┌─────────────────────────────────────────────────────┐
│                   四大定理闭环                        │
├─────────────────────────────────────────────────────┤
│                                                     │
│  定理1(正向):高斯世界 + LeJEPA → h(z) = Qz       │
│         ↕                                           │
│  定理2(逆向):高斯是唯一使可识别性成立的分布        │
│         ↓                                           │
│  定理3(近似):条件近似满足时,误差有界              │
│         ↓                                           │
│  定理4(应用):线性可识别 → 潜空间规划 = 真实世界    │
│                                                     │
└─────────────────────────────────────────────────────┘

定理1:线性可识别性(正向)

在高斯世界中,满足 LeJEPA 目标的最优表示 h 当且仅当 h(z) = QzQ ∈ O(n)

证明链条(6步):

高斯约束 + 最优对齐
        ↓
[步骤1] Hermite展开:hᵢ(z) = Σ cₐ Heₐ(z)
        ↓
[步骤2] Mehler公式:corrᵢ = Σ wₐ ρᵈ
        ↓
[步骤3] 关键不等式:corrᵢ ≤ ρ(等号 ⟺ w₁=1)
        ↓
[步骤4] 最优性条件:L_align = 2(1-ρ)n → 每个 corrᵢ = ρ
        ↓
[步骤5] 线性性:每个 hᵢ 是线性函数
        ↓
[步骤6] 正交性:高斯约束 + 线性 → Q ∈ O(n)

核心直觉: OU过程对高阶非线性成分衰减更快(ρᵈ 随 d 指数衰减),所以线性映射是唯一最优解。

定理2:高斯分布的唯一性(逆向)

在满足世界假设的所有分布中,高斯分布是唯一使 LeJEPA 实现线性可识别性的分布

与 ICA 的完全反转:

场景 高斯分布 非高斯分布
线性 ICA 失败(旋转不可区分) 成功
LeJEPA 成功 失败

定理3:近似可识别性

当条件只近似满足时,恢复误差优雅降级:

E[‖h(z) - Qz‖²] ≤ D + (ε + D)²
参数 定义 含义
δ(对齐间隙) L_align(h) - 2(1-ρ)n ≥ 0 正样本对有多"不相似"
ε(白化误差) ‖Cov(h(z)) - Iₙ‖_F 嵌入分布有多"不高斯"

关键发现:

  • 对齐质量 δ 是主要瓶颈(通过 D 线性传播)
  • 白化误差 ε 影响是二阶的(在平方项中)

定理4:最优潜空间规划

若 h(z) = Qz,则在任意 O(n)-不变代价函数下,潜空间规划与真实世界规划完全等价

V̂*(h(z₀)) = V*(z₀)   且   â*_{1:T}(h(z₀)) = a*_{1:T}(z₀)

覆盖的控制问题: 欧氏距离到目标、LQR(P=cI)、范数惩罚、目标到达


🔬 三、实验验证体系

四类实验对应四大定理

实验 验证目标 关键结果
实验1:正向可识别性 定理1 SIGReg R² > 0.999N=2→1024
实验2:逆向验证 定理2 R²在α=2(高斯)处尖锐峰值
实验3:近似界验证 定理3 实际误差均低于理论界
实验4:潜空间规划 定理4 OU编码器与oracle无差异

三种正则化方法对比

N SIGReg R²(h→z) VICReg R²(h→z) InfoNCE R²(h→z)
2 0.999998 0.999996 0.951
256 0.999884 0.999889 0.697
1024 0.999561 0.999582 0.720

SIGReg和VICReg在所有维度保持 R² > 0.999InfoNCE在高维退化


🔧 四、代码仓库结构

lejepa-identifiability/
├── lean/                    # Lean4 形式化证明(零sorry
│   └── LeJEPA/
│       ├── Hermite.lean     # 定理1Hermite多项式路径)
│       ├── Uniqueness.lean  # 定理2(高斯唯一性,Sturm-Liouville
│       ├── Approx.lean      # 定理3(近似可识别性界)
│       ├── Dirichlet.lean   # 附录EDirichlet能量替代证明)
│       └── Planning.lean    # 定理4(规划等价)
├── experiments/
│   ├── lejepa_id/           # 核心实验代码
│   │   ├── mixing.py        # 非线性混合(spiral/banana/sinusoid/coupling
│   │   ├── losses.py        # SIGReg、白化损失、对齐损失、InfoNCE
│   │   ├── models.py        # MLP/CNN编码器、MatchedEncoder
│   │   ├── data.py          # 潜变量采样、OU增强
│   │   ├── metrics.py       # R²、正交误差、近似界量化、Procrustes
│   │   ├── reacher.py       # DMC Reacher渲染与数据集
│   │   └── engine.py        # 训练循环(warmup + cosine LR
│   ├── run.py               # 2D/scaling/gennorm/grid统一入口
│   └── configs/             # 实验超参数YAML

📊 五、与相关工作的关系

LeJEPA vs SFA(慢特征分析)

维度 Sprekeler et al. (2014) SFA LeJEPA(本文)
可识别性类 置换等价 正交等价
潜变量分布 任意独立 高斯(或i.i.d.
转移结构 需要不同速率 需要各向同性
提取方式 顺序(贪心) 同时
函数空间 固定多项式核 学习(神经网络)
近似界 D+(ε+D)²
实用算法 xSFA(脆弱,≤6个潜变量) LeJEPA/SIGReg(可扩展)

LeJEPA 生态系统

LeJEPA 生态
├── 理论基础
│   ├── arXiv:2511.08544 (LeJEPA原始论文)
│   └── arXiv:2605.26379 (可识别性理论,本文)
├── 应用扩展
│   ├── arXiv:2603.19312 (LeWorldModel,像素控制)
│   └── arXiv:2602.11389 (Causal-JEPA,因果干预)
├── 代码
│   ├── github.com/rbalestr-lab/lejepa (LeJEPA训练)
│   └── github.com/klindtlab/lejepa-identifiability (可识别性实验)
└── 演示
    ├── YouTube: youtu.be/EioGDo67ZDs (官方视频)
    └── Colab: 交互式2D演示 (~30秒,T4 GPU)

💡 六、核心洞见与启示

一句话总结

LeJEPA将经典ICA的叙事完全颠倒: 在线性ICA中,高斯分布是源分离失败的唯一情况;在LeJEPA的非线性设置中,高斯分布恰恰是使线性可识别性成立的唯一分布。

对 WorldModel/PRISM 项目的启示

  1. 探索策略的重要性: 近似各向同性随机游走的探索策略能保持数据在理论覆盖范围内
  2. SIGReg优于VICReg 对非高斯潜变量更鲁棒,适合真实场景
  3. 对齐质量是关键瓶颈: 训练中应优先减小对齐损失
  4. 线性可识别性 → 规划等价: 为PRISM空间记忆架构中的潜空间规划提供理论保障

⚠️ 七、局限性与未来方向

局限 说明
潜变量是否真的高斯? 中心极限定理支持宏观量趋向高斯,但无法从观测中验证
维度不匹配(m≠n 编码器维度与真实潜变量维度不同时的行为未理论化
有限样本 定理3是总体层面结论,样本复杂度和训练动态未涉及
动作条件转移 本文只处理编码器侧,p̂(ẑ'

📚 八、项目内相关文件索引

资源类型 路径
论文精读 JEPA/LeJEPA/paper_reading.md
综合笔记 JEPA/README.md
数学证明分解 JEPA/math/ — 6个topic拆解四大定理
代码仓库 JEPA/lejepa-identifiability/
Lean4证明 JEPA/lejepa-identifiability/lean/
论文PDF research/papers/2605.26379v1.pdf

🎯 九、下一步研究建议

基于以上分析,以下是可能的后续研究方向:

  1. 扩展动作条件转移的可识别性理论(定理4的下一步)
  2. 探索非高斯分布下的近似可识别性界(定理3的推广)
  3. 将LeJEPA框架应用于PRISM空间记忆架构(定理4的实际应用)
  4. 研究有限样本下的收敛速率和泛化界(理论完善)