b5499c7ea0
- Introduced a comprehensive lecture plan for the four main theorems in LeJEPA, including knowledge dependency graphs, detailed outlines for each topic, and corresponding Lean 4 files for formal verification. - Created a summary document encapsulating the core insights and mathematical structures of the four theorems, emphasizing their interdependencies and implications in the context of LeJEPA.
10 KiB
10 KiB
LeJEPA 研究全面分析
项目位置:
/Users/mac/code/worldmodel/JEPA/分析日期: 2026-06-05
📌 一、LeJEPA 是什么?
LeJEPA = Lean Efficient JEAPA(Yann LeCun 团队的自监督学习框架)
核心组成
LeJEPA = JEPA (Joint-Embedding Predictive Architecture) + SIGReg
| 组件 | 作用 |
|---|---|
| JEPA | 在表示空间做预测,避免像素级生成的容量浪费 |
| SIGReg | Sketched Isotropic Gaussian Regularization(切片各向同性高斯正则化) |
| 对齐损失 | 拉近正样本对的嵌入表示 |
SIGReg 的核心设计
# 特征函数方法(而非矩匹配)
L_SIG = E[|φ_h(t) - φ_N(0,I)(t)|²] # 特征函数差异
- 用**特征函数(Fourier变换)**的实部/虚部偏差度量分布差异
- 随机切片将高维问题降为一维投影,线性时间复杂度
knots=17个积分节点 +n_slices=256个随机方向
📐 二、四大定理——理论核心贡献
数学框架:世界的三条假设
| 假设 | 数学表述 | 直觉 |
|---|---|---|
| 独立性 | p(zᵢ) ⊥ p(zⱼ),转移也独立 | 世界的各自由度互不干扰 |
| 平稳性 | p(z) = p(z') | 两个视图来自同一生成过程 |
| 加性噪声 | z'ᵢ = mᵢ(zᵢ) + ηᵢ | 扰动是叠加在信号上的噪声 |
高斯世界(Gaussian World)
z' = ρz + √(1-ρ²)η, η ~ N(0, Iₙ), ρ ∈ (0,1)
定理总览图
┌─────────────────────────────────────────────────────┐
│ 四大定理闭环 │
├─────────────────────────────────────────────────────┤
│ │
│ 定理1(正向):高斯世界 + LeJEPA → h(z) = Qz │
│ ↕ │
│ 定理2(逆向):高斯是唯一使可识别性成立的分布 │
│ ↓ │
│ 定理3(近似):条件近似满足时,误差有界 │
│ ↓ │
│ 定理4(应用):线性可识别 → 潜空间规划 = 真实世界 │
│ │
└─────────────────────────────────────────────────────┘
定理1:线性可识别性(正向)
在高斯世界中,满足 LeJEPA 目标的最优表示 h 当且仅当 h(z) = Qz,Q ∈ O(n)
证明链条(6步):
高斯约束 + 最优对齐
↓
[步骤1] Hermite展开:hᵢ(z) = Σ cₐ Heₐ(z)
↓
[步骤2] Mehler公式:corrᵢ = Σ wₐ ρᵈ
↓
[步骤3] 关键不等式:corrᵢ ≤ ρ(等号 ⟺ w₁=1)
↓
[步骤4] 最优性条件:L_align = 2(1-ρ)n → 每个 corrᵢ = ρ
↓
[步骤5] 线性性:每个 hᵢ 是线性函数
↓
[步骤6] 正交性:高斯约束 + 线性 → Q ∈ O(n)
核心直觉: OU过程对高阶非线性成分衰减更快(ρᵈ 随 d 指数衰减),所以线性映射是唯一最优解。
定理2:高斯分布的唯一性(逆向)
在满足世界假设的所有分布中,高斯分布是唯一使 LeJEPA 实现线性可识别性的分布
与 ICA 的完全反转:
| 场景 | 高斯分布 | 非高斯分布 |
|---|---|---|
| 线性 ICA | ❌ 失败(旋转不可区分) | ✅ 成功 |
| LeJEPA | ✅ 成功 | ❌ 失败 |
定理3:近似可识别性
当条件只近似满足时,恢复误差优雅降级:
E[‖h(z) - Qz‖²] ≤ D + (ε + D)²
| 参数 | 定义 | 含义 |
|---|---|---|
| δ(对齐间隙) | L_align(h) - 2(1-ρ)n ≥ 0 | 正样本对有多"不相似" |
| ε(白化误差) | ‖Cov(h(z)) - Iₙ‖_F | 嵌入分布有多"不高斯" |
关键发现:
- 对齐质量 δ 是主要瓶颈(通过 D 线性传播)
- 白化误差 ε 影响是二阶的(在平方项中)
定理4:最优潜空间规划
若 h(z) = Qz,则在任意 O(n)-不变代价函数下,潜空间规划与真实世界规划完全等价
V̂*(h(z₀)) = V*(z₀) 且 â*_{1:T}(h(z₀)) = a*_{1:T}(z₀)
覆盖的控制问题: 欧氏距离到目标、LQR(P=cI)、范数惩罚、目标到达
🔬 三、实验验证体系
四类实验对应四大定理
| 实验 | 验证目标 | 关键结果 |
|---|---|---|
| 实验1:正向可识别性 | 定理1 | SIGReg R² > 0.999(N=2→1024) |
| 实验2:逆向验证 | 定理2 | R²在α=2(高斯)处尖锐峰值 |
| 实验3:近似界验证 | 定理3 | 实际误差均低于理论界 |
| 实验4:潜空间规划 | 定理4 | OU编码器与oracle无差异 |
三种正则化方法对比
| N | SIGReg R²(h→z) | VICReg R²(h→z) | InfoNCE R²(h→z) |
|---|---|---|---|
| 2 | 0.999998 | 0.999996 | 0.951 |
| 256 | 0.999884 | 0.999889 | 0.697 |
| 1024 | 0.999561 | 0.999582 | 0.720 |
SIGReg和VICReg在所有维度保持 R² > 0.999;InfoNCE在高维退化
🔧 四、代码仓库结构
lejepa-identifiability/
├── lean/ # Lean4 形式化证明(零sorry)
│ └── LeJEPA/
│ ├── Hermite.lean # 定理1(Hermite多项式路径)
│ ├── Uniqueness.lean # 定理2(高斯唯一性,Sturm-Liouville)
│ ├── Approx.lean # 定理3(近似可识别性界)
│ ├── Dirichlet.lean # 附录E(Dirichlet能量替代证明)
│ └── Planning.lean # 定理4(规划等价)
├── experiments/
│ ├── lejepa_id/ # 核心实验代码
│ │ ├── mixing.py # 非线性混合(spiral/banana/sinusoid/coupling)
│ │ ├── losses.py # SIGReg、白化损失、对齐损失、InfoNCE
│ │ ├── models.py # MLP/CNN编码器、MatchedEncoder
│ │ ├── data.py # 潜变量采样、OU增强
│ │ ├── metrics.py # R²、正交误差、近似界量化、Procrustes
│ │ ├── reacher.py # DMC Reacher渲染与数据集
│ │ └── engine.py # 训练循环(warmup + cosine LR)
│ ├── run.py # 2D/scaling/gennorm/grid统一入口
│ └── configs/ # 实验超参数YAML
📊 五、与相关工作的关系
LeJEPA vs SFA(慢特征分析)
| 维度 | Sprekeler et al. (2014) SFA | LeJEPA(本文) |
|---|---|---|
| 可识别性类 | 置换等价 | 正交等价 |
| 潜变量分布 | 任意独立 | 高斯(或i.i.d.) |
| 转移结构 | 需要不同速率 | 需要各向同性 |
| 提取方式 | 顺序(贪心) | 同时 |
| 函数空间 | 固定多项式核 | 学习(神经网络) |
| 近似界 | ❌ 无 | ✅ D+(ε+D)² |
| 实用算法 | xSFA(脆弱,≤6个潜变量) | LeJEPA/SIGReg(可扩展) |
LeJEPA 生态系统
LeJEPA 生态
├── 理论基础
│ ├── arXiv:2511.08544 (LeJEPA原始论文)
│ └── arXiv:2605.26379 (可识别性理论,本文)
├── 应用扩展
│ ├── arXiv:2603.19312 (LeWorldModel,像素控制)
│ └── arXiv:2602.11389 (Causal-JEPA,因果干预)
├── 代码
│ ├── github.com/rbalestr-lab/lejepa (LeJEPA训练)
│ └── github.com/klindtlab/lejepa-identifiability (可识别性实验)
└── 演示
├── YouTube: youtu.be/EioGDo67ZDs (官方视频)
└── Colab: 交互式2D演示 (~30秒,T4 GPU)
💡 六、核心洞见与启示
一句话总结
LeJEPA将经典ICA的叙事完全颠倒: 在线性ICA中,高斯分布是源分离失败的唯一情况;在LeJEPA的非线性设置中,高斯分布恰恰是使线性可识别性成立的唯一分布。
对 WorldModel/PRISM 项目的启示
- 探索策略的重要性: 近似各向同性随机游走的探索策略能保持数据在理论覆盖范围内
- SIGReg优于VICReg: 对非高斯潜变量更鲁棒,适合真实场景
- 对齐质量是关键瓶颈: 训练中应优先减小对齐损失
- 线性可识别性 → 规划等价: 为PRISM空间记忆架构中的潜空间规划提供理论保障
⚠️ 七、局限性与未来方向
| 局限 | 说明 |
|---|---|
| 潜变量是否真的高斯? | 中心极限定理支持宏观量趋向高斯,但无法从观测中验证 |
| 维度不匹配(m≠n) | 编码器维度与真实潜变量维度不同时的行为未理论化 |
| 有限样本 | 定理3是总体层面结论,样本复杂度和训练动态未涉及 |
| 动作条件转移 | 本文只处理编码器侧,p̂(ẑ' |
📚 八、项目内相关文件索引
| 资源类型 | 路径 |
|---|---|
| 论文精读 | JEPA/LeJEPA/paper_reading.md |
| 综合笔记 | JEPA/README.md |
| 数学证明分解 | JEPA/math/ — 6个topic拆解四大定理 |
| 代码仓库 | JEPA/lejepa-identifiability/ |
| Lean4证明 | JEPA/lejepa-identifiability/lean/ |
| 论文PDF | research/papers/2605.26379v1.pdf |
🎯 九、下一步研究建议
基于以上分析,以下是可能的后续研究方向:
- 扩展动作条件转移的可识别性理论(定理4的下一步)
- 探索非高斯分布下的近似可识别性界(定理3的推广)
- 将LeJEPA框架应用于PRISM空间记忆架构(定理4的实际应用)
- 研究有限样本下的收敛速率和泛化界(理论完善)