Add multiple research papers in PDF format to the repository, including recent works on AI and physics, with file sizes ranging from 1.7 MB to 32.3 MB.
Sync to site1 / sync (push) Has been cancelled

This commit is contained in:
gaojie
2026-06-02 04:12:38 +08:00
parent 36fe037bc1
commit c55f47b287
57 changed files with 278820 additions and 3 deletions
Binary file not shown.
File diff suppressed because one or more lines are too long
Binary file not shown.
File diff suppressed because it is too large Load Diff
Binary file not shown.
Submodule JEPA/lejepa-identifiability added at de7503f1b2
+204
View File
@@ -0,0 +1,204 @@
# LeJEPA 相关资源汇总
> 通过互联网搜索整理,收录时间:2026-06-01
---
## 🎬 视频资源
### 官方演示视频
| 标题 | 链接 | 频道 | 时间 | 说明 |
|------|------|------|------|------|
| **world model video**(官方) | https://youtu.be/EioGDo67ZDs | AI and the Brain | 2026-05-09 | 论文官方配套视频,291次观看,由作者团队发布 |
> 📌 该视频由 GitHub README 直接链接,是论文的官方配套演示视频。
---
## 📄 论文资源
### 核心论文
| 论文 | arXiv | 发表时间 | 说明 |
|------|-------|----------|------|
| **When Does LeJEPA Learn a World Model?** | [2605.26379](https://arxiv.org/abs/2605.26379) | 2026-05-25 | 本文,可识别性理论 |
| **LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics** | [2511.08544](https://arxiv.org/abs/2511.08544) | 2025-11-11 | LeJEPA 原始论文,提出 SIGReg |
| **LeWorldModel: Stable End-to-End JEPA from Pixels** | [2603.19312](https://arxiv.org/abs/2603.19312) | 2026-03-13 | LeJEPA 扩展到动作条件控制 |
| **V-JEPA 2: Self-Supervised Video Models** | [2506.09985](https://arxiv.org/abs/2506.09985) | 2025 | Meta 的视频 JEPA,理解/预测/规划 |
| **Causal-JEPA** | [2602.11389](https://arxiv.org/abs/2602.11389) | 2026 | 通过对象级干预学习世界模型 |
### LeJEPA 原始论文摘要(arXiv:2511.08544
> Learning manipulable representations of the world and its dynamics is central to AI. Joint-Embedding Predictive Architectures (JEPAs) offer a promising blueprint, but lack of practical guidance and theory has led to ad-hoc R&D. We present a comprehensive theory of JEPAs and instantiate it in **LeJEPA**, a lean, scalable, and theoretically grounded training objective.
>
> **核心贡献:**
> - 识别各向同性高斯分布为 JEPA 嵌入的最优分布
> - 提出 SIGRegSketched Isotropic Gaussian Regularization
> - 单一超参数、线性时间/内存复杂度、无启发式技巧
> - ~50 行代码实现,ViT-H/14 在 ImageNet-1k 达到 79%
### LeWorldModel 摘要(arXiv:2603.19312
> LeWorldModel (LeWM) 是首个仅用两个损失项(下一嵌入预测 + 高斯正则化)从原始像素端到端稳定训练的 JEPA。
>
> **亮点:**
> - ~15M 参数,单 GPU 数小时可训
> - 规划速度比基础模型快 48 倍
> - 潜空间编码有意义的物理结构
> - 可可靠检测物理上不合理的事件
---
## 🌐 官方网站与代码
### 项目主页
- **官方网站:** https://klindtlab.github.io/lejepa-identifiability/
- 包含完整摘要、定理说明、实验结果图表
- 发布时间:2026-05-27
### 代码仓库
- **可识别性论文代码:** https://github.com/klindtlab/lejepa-identifiability
- Lean 4 形式化证明(`lean/` 目录)
- 实验代码(`experiments/` 目录)
- 支持 2D、Scaling、Gennorm、Grid、Reacher 五类实验
- **LeJEPA 原始代码:** https://github.com/rbalestr-lab/lejepa
- GitHub Stars: 1,170+
- 包含完整训练代码
### 交互演示
- **Google Colab Demo~30秒,T4 GPU):**
https://colab.research.google.com/drive/1ozjRk3FfUIDX7WBqlOKvhNcIamy0JxCH?usp=sharing
---
## 🤗 HuggingFace 资源
### 论文页面
- **可识别性论文:** https://huggingface.co/papers/2605.26379
- AI 生成摘要:LeJEPA demonstrates linear identifiability of latent variables from nonlinear observations under Gaussian distributions, enabling reliable world modeling and planning.
- **LeJEPA 原始论文:** https://huggingface.co/papers/2511.08544
### 相关模型(基于 LeJEPA 训练)
| 模型 | 说明 |
|------|------|
| [gajeshladhar/core-jepa](https://huggingface.co/gajeshladhar/core-jepa) | 图像特征提取,25次下载 |
| [falafel-hockey/lejepa-vit-small-patch8-256-sentinel2-5band](https://huggingface.co/falafel-hockey/lejepa-vit-small-patch8-256-sentinel2-5band) | 遥感图像(Sentinel-2)特征提取 |
| [adipanda/lejepa](https://huggingface.co/adipanda/lejepa) | LeJEPA 模型 |
| [caiovicentino1/lejepa-v1-tinyimagenet](https://huggingface.co/caiovicentino1/lejepa-v1-tinyimagenet) | TinyImageNet 训练版本 |
### 相关数据集
| 数据集 | 说明 |
|--------|------|
| [falafel-hockey/sentinel2-lejepa-global-diverse-256](https://huggingface.co/datasets/falafel-hockey/sentinel2-lejepa-global-diverse-256) | Sentinel-2 遥感数据,5k 样本 |
---
## 📚 相关背景论文
### JEPA 系列
| 论文 | 说明 |
|------|------|
| LeCun, *A Path Towards Autonomous Machine Intelligence* (2022) | JEPA 原始提案 |
| I-JEPA (Assran et al., CVPR 2023) | 图像 JEPA |
| V-JEPA (Bardes et al., 2024) | 视频 JEPA |
| V-JEPA 2 (Assran et al., 2025) | 视频理解/预测/规划 |
### 可识别性理论背景
| 论文 | 说明 |
|------|------|
| Hyvärinen & Pajunen (1999) | 非线性 ICA 不可识别性 |
| Hyvärinen & Morioka (2016, 2017) | 时间对比学习 + 非线性 ICA |
| Khemakhem et al. (2020) | VAE + 非线性 ICA 统一框架 |
| Sprekeler et al. (2014) | SFA 非线性盲源分离理论 |
| Sobal et al. (2022) | JEPA 关注慢特征 |
### 自监督学习对比
| 方法 | 论文 | 与 LeJEPA 关系 |
|------|------|----------------|
| VICReg | Bardes et al. (2021) | 二阶矩白化,理论上等价 |
| InfoNCE | van den Oord et al. (2018) | 隐式高斯化,高维退化 |
| BYOL | Grill et al. (2020) | stop-gradient,无理论保证 |
| SimSiam | Chen & He (2021) | stop-gradient,无理论保证 |
| DINO/DINOv3 | Caron et al. (2021) / 2025 | 自蒸馏 + 特征聚类 |
---
## 🔬 技术要点速查
### LeJEPA 训练目标
```
L(h) = λ · L_SIG + (1-λ) · L_inv
L_inv = E[‖h(z') - h(z)‖²] # 对齐损失(正样本对)
L_SIG = SIGReg(h(z), N(0,I)) # 高斯正则化(防坍塌)
```
### SIGReg 实现原理
- 通过随机投影(sketching)估计嵌入分布的特征函数
- 与标准高斯的特征函数对比,计算偏差
- 线性时间复杂度,~50 行代码
### 关键超参数
| 参数 | 推荐范围 | 说明 |
|------|----------|------|
| `λ`(正则化权重) | `1e-3` ~ `1e-2` | 太大→坍塌,太小→不可识别 |
| `ρ`OU 相关性) | `0.8` ~ `0.95` | 控制正样本对的相似度 |
### 实验结果摘要
| 维度 N | SIGReg R² | VICReg R² | InfoNCE R² |
|--------|-----------|-----------|------------|
| 2 | 0.999998 | 0.999996 | 0.950961 |
| 64 | 0.999966 | 0.999968 | 0.648496 |
| 256 | 0.999884 | 0.999889 | 0.696587 |
| 1024 | 0.999561 | 0.999582 | 0.720241 |
---
## 📋 BibTeX 引用
```bibtex
@article{klindt2026lejepa,
author = {Klindt, David and LeCun, Yann and Balestriero, Randall},
title = {When Does LeJEPA Learn a World Model?},
year = {2026},
journal = {arXiv preprint arXiv:2605.26379},
}
@article{balestriero2025lejepa,
author = {Balestriero, Randall and LeCun, Yann},
title = {LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics},
year = {2025},
journal = {arXiv preprint arXiv:2511.08544},
}
@article{maes2026leworldmodel,
author = {Maes, Lucas and Le Lidec, Quentin and Scieur, Damien and LeCun, Yann and Balestriero, Randall},
title = {LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels},
year = {2026},
journal = {arXiv preprint arXiv:2603.19312},
}
```
---
## 🗺️ 资源地图
```
LeJEPA 生态系统
├── 理论基础
│ ├── arXiv:2511.08544 (LeJEPA 原始论文)
│ └── arXiv:2605.26379 (可识别性理论,本文)
├── 应用扩展
│ ├── arXiv:2603.19312 (LeWorldModel,像素控制)
│ └── arXiv:2602.11389 (Causal-JEPA,因果干预)
├── 代码
│ ├── github.com/rbalestr-lab/lejepa (LeJEPA 训练)
│ └── github.com/klindtlab/lejepa-identifiability (可识别性实验)
├── 演示
│ ├── YouTube: youtu.be/EioGDo67ZDs (官方视频)
│ ├── 官网: klindtlab.github.io/lejepa-identifiability
│ └── Colab: 交互式 2D 演示
└── 社区
├── HuggingFace: huggingface.co/papers/2605.26379
└── HuggingFace: huggingface.co/papers/2511.08544 (1170+ Stars)
```
+550
View File
@@ -0,0 +1,550 @@
# 论文阅读笔记:*When Does LeJEPA Learn a World Model?*
**作者:** David Klindt (CSHL)、Yann LeCun (NYU)、Randall Balestriero (Brown)
**发表:** arXiv:2605.26379v1 [stat.ML]2026年5月25日
**官网:** https://klindtlab.github.io/lejepa-identifiability/2026-05-27
**代码:** [`JEPA/lejepa-identifiability/`](JEPA/lejepa-identifiability/)(已本地 clone
**原文:** `research/papers/2605.26379v1.pdf`
**视频:** https://youtu.be/EioGDo67ZDs(官方演示,AI and the Brain 频道)
---
## 🎯 核心问题
> **LeJEPA 学到的表示,什么时候才算真正学到了世界模型(World Model)?**
答案:当且仅当它能**线性恢复**世界的潜在变量(latent variables)时。
---
## 🧠 背景与动机
### 什么是 JEPA
Joint-Embedding Predictive ArchitectureJEPA)是 LeCun 提出的自监督学习框架:
- 训练编码器 `f` 对同一内容的两个视图产生相似的嵌入
- 用正则化器防止表示坍塌(collapse)
### 什么是 LeJEPA
`LeJEPA` = JEPA + **SIGReg**Sketched Isotropic Gaussian Regularization):
- **对齐损失(Alignment):** 拉近正样本对的嵌入
- **高斯正则化(SIGReg):** 强制嵌入分布接近各向同性高斯分布 `h(z) ~ N(0, I_n)`
### 核心缺口
此前没有任何 JEPA 的**可识别性(identifiability)理论**——不知道学到的表示是否真正恢复了世界的潜在结构。
---
## 🌍 世界模型的数学框架
### 世界假设(三条)
| 假设 | 含义 |
|------|------|
| **独立性** | 潜变量各分量相互独立 |
| **平稳性** | 两个视图共享同一边际分布 |
| **加性噪声** | `z'_i = m_i(z_i) + η_i`,噪声独立于状态 |
### 高斯世界(Gaussian World
最大熵选择:`z ~ N(0, I_n)`,转移过程为 **Ornstein-UhlenbeckOU)过程**
```
z' = ρz + √(1-ρ²) η, η ~ N(0, I_n)
```
其中 `ρ ∈ (0,1)` 控制两个视图的相关性。
### 学习目标
```
min_h E[‖h(z') - h(z)‖²] (对齐损失)
s.t. h(z) ~ N(0, I_n) (高斯约束)
```
---
## 📐 四大定理
### 定理 1:LeJEPA 线性可识别性(正向)
> 在高斯世界中,满足 LeJEPA 目标的最优表示 `h` **当且仅当** `h(z) = Qz`,其中 `Q ∈ O(n)` 为正交矩阵。
**证明核心思路(Hermite 多项式谱分解):**
1. 任意函数 `h_i(z)` 可展开为 Hermite 多项式:`h_i = Σ c_α H_α(z)`
2. OU 转移对 d 阶 Hermite 分量的衰减因子为 `ρ^d`
3. 由 Mehler 公式:`E[h_i(z')h_i(z)] = Σ_d w_d · ρ^d ≤ ρ`
4. 等号成立 **当且仅当** `w_1 = 1`(即 `h_i` 是线性的)
5. 任何非线性扭曲都会**严格降低**正样本对的相关性
**直觉:** 高斯 OU 过程对高阶非线性成分的衰减更快,因此线性映射是唯一最优解。
---
### 定理 2:高斯分布的唯一性(逆向)
> 在满足世界假设的所有分布中,**高斯分布是唯一**使 LeJEPA 实现线性可识别性的分布。
**证明思路(Sturm-Liouville 理论):**
- 若第一特征函数 `φ_1` 是仿射的(`φ = az + b`),则得分函数 `(log p)'` 必须是线性的
- 线性得分函数 → `log p(z) ∝ -(z-μ)²` → 高斯分布
**意义:** 这与经典 ICA 的结论**完全相反**——在线性 ICA 中,高斯分布是唯一**失败**的情况;在 LeJEPA 的非线性设置中,高斯分布是唯一**成功**的情况。
---
### 定理 3:近似可识别性
> 当对齐目标和白化约束只近似满足时,恢复误差**优雅降级**:
```
E[‖h(z) - Qz‖²] ≤ D + (ε + D)²
```
其中:
- `D = δ / (2ρ(1-ρ))`:对齐间隙的归一化量
- `ε = ‖Cov(h(z)) - I‖_F`:白化误差
**实践含义:** 对齐质量是可识别性的主要瓶颈,白化误差影响较小。
---
### 定理 4:最优潜空间规划
> 若 `h(z) = Qz`(正交),则在**旋转不变代价函数**下,潜空间中的规划与真实世界中的规划**完全等价**:
```
V̂*(h(z₀)) = V*(z₀) 且 â*_{1:T}(h(z₀)) = a*_{1:T}(z₀)
```
**覆盖的控制问题:**
- 目标到达(goal-reaching
- 线性二次调节(LQR
- 任何依赖旋转不变量的代价函数
---
## 🔬 实验验证
### 实验 1:正向可识别性(验证定理 1)
- 2D 设置,4种非线性混合函数(螺旋、正弦剪切、抛物线剪切、RealNVP)
- LeJEPA 在所有情况下恢复各向同性高斯结构(旋转等价)
- 扩展到 **1024 维**SIGReg 和 VICReg 保持 `R² > 0.999`
### 实验 2:逆向验证(验证定理 2)
- 扫描广义正态分布族(形状参数 α)
- `R²`**α=2(高斯)** 时达到峰值,非高斯分布线性可识别性下降
### 实验 3:近似界验证(验证定理 3)
- 所有运行的实际恢复误差均低于理论界
- 对齐损失是可识别性的最强预测指标
### 实验 4:潜空间规划(验证定理 4)
- DMC Reacher 环境(像素输入,2D 关节角度潜变量)
- 高斯编码器(OU 采样):规划质量与 oracle 无统计显著差异
- 轨迹编码器(RL 策略采样,非高斯):规划质量显著下降
---
## 🔑 关键洞见
### 1. 谱分解是核心工具
Hermite 多项式将任意函数分解为线性/非线性成分,OU 转移对高阶成分的衰减更强,这使得线性映射成为唯一最优解。
### 2. 数据分布决定可识别性
- **OU 采样(各向同性高斯)** → 满足理论假设 → 高可识别性
- **RL 策略轨迹(非高斯、各向异性)** → 违反假设 → 低可识别性
### 3. 探索策略的重要性
对于自监督预训练,**近似各向同性随机游走**的探索策略能保持数据在理论覆盖的范围内。
### 4. 三种方法的失效模式不同
| 方法 | 优势 | 失效场景 |
|------|------|----------|
| SIGReg | 对非高斯潜变量更鲁棒 | 高维时正交误差略增 |
| VICReg | 与 SIGReg 性能相当 | 非高斯潜变量时下降更快 |
| InfoNCE | 低维时表现好 | 高维时核宽度不匹配导致梯度消失 |
---
## 🔧 形式化验证(Lean 4
所有定理均在 **Lean 4** 定理证明器中形式化验证(零 `sorry` 义务),使用 Mathlib v4.28.0。
**验证组件概览:**
| 文件 | 内容 | 状态 |
|------|------|------|
| `Hermite.lean` | 定理 1(Hermite 多项式路径) | ✅ 已验证 |
| `Uniqueness.lean` | 定理 2(高斯唯一性) | ✅ 已验证 |
| `Dirichlet.lean` | 附录 EDirichlet 能量路径) | ✅ 已验证 |
| `Approx.lean` | 定理 3(近似界) | ✅ 已验证 |
| `Planning.lean` | 定理 4(规划等价) | ✅ 已验证 |
---
## 📊 与慢特征分析(SFA)的关系
| 维度 | Sprekeler et al. (2014) | 本文 |
|------|------------------------|------|
| 可识别性类 | 置换等价 | 正交等价 |
| 潜变量分布 | 任意独立 | 高斯(或 i.i.d. |
| 转移结构 | 需要不同速率 | 需要各向同性 |
| 提取方式 | 顺序(贪心) | 同时 |
| 函数空间 | 固定多项式核 | 学习(神经网络) |
| 近似界 | 无 | `D + (ε+D)²` |
| 实用算法 | xSFA(脆弱,≤6个潜变量) | LeJEPA/SIGReg(可扩展) |
---
## 💡 局限性与未来方向
1. **潜变量是否真的是高斯的?** 宏观任务相关变量可能因中心极限定理趋向高斯,但无法从观测中验证。
2. **维度不匹配问题(m ≠ n):** 编码器输出维度与真实潜变量维度不同时的行为尚未理论化。
3. **有限样本与优化动态:** 定理 3 是总体层面的结论,样本复杂度和训练动态未涉及。
4. **动作条件转移的可识别性:** 本文只处理编码器侧,动作条件转移 `p̂(ẑ'|ẑ,a)` 的可识别性是下一步工作(与因果表示学习相关)。
---
## 🏆 核心贡献总结
> **LeJEPA 将经典 ICA 的叙事完全颠倒:** 在线性 ICA 中,高斯分布是源分离失败的唯一情况;在 LeJEPA 的非线性设置中,高斯分布恰恰是使线性可识别性成立的唯一分布。
**五大贡献:**
1. **首个 JEPA 可识别性结果**(定理 1
2. **高斯分布唯一性的逆向定理**(定理 2
3. **量化近似可识别性界**(定理 3
4. **各向同性转移是同时提取的必要条件**(附录 F
5. **线性可识别性与最优潜空间规划的等价性**(定理 4
线性可识别性使学到的表示成为控制系统的可用状态,任何正交不变代价函数都可以直接在学到的潜空间中使用,无需修改——这是**可证明地学到世界模型**的含义。
---
## 📚 关键参考文献
- **LeJEPA** Balestriero & LeCun, arXiv:2511.08544, 2025
- **LeWorldModel** Maes et al., arXiv:2603.19312, 2026
- **V-JEPA 2** Assran et al., arXiv:2506.09985, 2025
- **VICReg** Bardes et al., arXiv:2105.04906, 2021
- **SFA 可识别性:** Sprekeler et al., JMLR 15:921-947, 2014
- **Causal-JEPA** Nam et al., arXiv:2602.11389, 2026
---
## 🗂️ 代码仓库深度解析
> 本节基于本地 clone 的 [`JEPA/lejepa-identifiability/`](JEPA/lejepa-identifiability/) 仓库,对核心实现进行逐模块分析。
### 仓库结构
```
lejepa-identifiability/
├── lean/ # Lean 4 形式化证明
│ └── LeJEPA/
│ ├── Hermite.lean # 定理1Hermite 多项式路径)
│ ├── Uniqueness.lean # 定理2(高斯唯一性,Sturm-Liouville
│ ├── Approx.lean # 定理3(近似可识别性界)
│ ├── Dirichlet.lean # 附录EDirichlet 能量替代证明)
│ └── Planning.lean # 定理4(规划等价)
└── experiments/
└── lejepa_id/
├── losses.py # SIGReg、白化损失、对齐损失、InfoNCE
├── models.py # MLP 编码器、MatchedEncoder、CNN 编码器
├── data.py # 潜变量采样、OU 增强
├── metrics.py # R²、正交误差、近似界量化
└── engine.py # 训练循环(warmup + cosine LR
```
---
### 核心实现:损失函数([`losses.py`](JEPA/lejepa-identifiability/experiments/lejepa_id/losses.py)
#### [`SIGReg`](JEPA/lejepa-identifiability/experiments/lejepa_id/losses.py:8)Sketched Isotropic Gaussian Regularizer
```python
class SIGReg(nn.Module):
def __init__(self, knots=17, n_slices=256, t_max=3.0):
# 通过随机投影(sketching)估计特征函数
# 与标准高斯 φ(t) = exp(-t²/2) 对比
t = torch.linspace(0, t_max, knots)
self.phi = torch.exp(-t**2 / 2) # 标准高斯特征函数
def forward(self, h):
# h: (V, B, N) -> scalar
A = F.normalize(torch.randn(...), dim=0) # 随机投影方向
xt = (flat @ A).unsqueeze(-1) * self.t
err = (xt.cos().mean(0) - self.phi)**2 + xt.sin().mean(0)**2
return (err @ self.weights).mean() * flat.size(0)
```
**关键设计:**
- 用**特征函数**(Fourier 变换)而非矩匹配来度量分布差异
- 随机投影将高维问题降为一维切片,线性时间复杂度
- `knots=17` 个积分节点,`n_slices=256` 个随机方向
#### [`alignment_loss`](JEPA/lejepa-identifiability/experiments/lejepa_id/losses.py:39) 与 [`whitening_loss`](JEPA/lejepa-identifiability/experiments/lejepa_id/losses.py:31)
```python
def alignment_loss(h):
"""拉近正样本对。h: (V, B, N) -> scalar"""
return (h.mean(0) - h).square().mean()
def whitening_loss(h):
"""||Cov(h) - I||²_FVICReg 风格白化)"""
cov = (flat.T @ flat) / (flat.shape[0] - 1)
return (cov - torch.eye(...)).square().mean()
```
**训练目标:**
```python
# LeJEPA 模式
loss = lamb * sig + (1 - lamb) * align
# VICReg 模式(对比用)
loss = lamb * wht + (1 - lamb) * align
# InfoNCE 模式(对比用)
loss = infonce_loss(h, sigma)
```
---
### 核心实现:数据生成([`data.py`](JEPA/lejepa-identifiability/experiments/lejepa_id/data.py)
#### [`ou_augment`](JEPA/lejepa-identifiability/experiments/lejepa_id/data.py:29)OU 过程增强)
```python
def ou_augment(z, rho, n_views=2, dist="gaussian", alpha=None):
"""z' = ρz + √(1-ρ²)η,η 与 z 同分布
返回 (V, B, N) 形状的多视图张量"""
fac = (1 - rho ** 2) ** 0.5
eta = sample_latents(n_views * D, N, dist=dist, ...)
return rho * z.unsqueeze(0) + fac * eta
```
**支持的分布:**
- `"gaussian"`:标准正态(理论保证成立)
- `"laplace"`:拉普拉斯(理论保证失效,用于消融)
- `"gennorm"`:广义正态(扫描形状参数 α,验证定理2)
---
### 核心实现:评估指标([`metrics.py`](JEPA/lejepa-identifiability/experiments/lejepa_id/metrics.py)
#### [`compute_all_metrics`](JEPA/lejepa-identifiability/experiments/lejepa_id/metrics.py:16)
```python
def compute_all_metrics(z, x, h, h_prime, rho, N):
# 双向 R²(线性可识别性的主要指标)
r2_zh, r2_hz = bidirectional_r2(z, h)
# 正交误差(衡量 h = Qz 中 Q 的正交性)
A = W[:N].T # 线性回归系数
orth_err = ||A^T A - I||_F
# 近似界量化(验证定理3
delta = max(L_h - 2*(1-rho)*trace_cov, 0)
D_bound = delta / (2*rho*(1-rho))
approx_bound = D_bound + (epsilon + D_bound)**2
# Procrustes 距离(最优正交对齐后的误差)
M = h^T z / n; U, S, Vt = SVD(M); Q = U @ Vt
procrustes_mse = ||h - z @ Q^T||²
```
---
### 核心实现:编码器架构([`models.py`](JEPA/lejepa-identifiability/experiments/lejepa_id/models.py)
| 编码器 | 用途 | 结构 |
|--------|------|------|
| [`make_mlp_encoder`](JEPA/lejepa-identifiability/experiments/lejepa_id/models.py:8) | 2D 实验 | 4层 MLP + GELU |
| [`MatchedEncoder`](JEPA/lejepa-identifiability/experiments/lejepa_id/models.py:17) | 高维 Scaling | 逆 NVP 耦合层(与混合函数匹配) |
| [`make_cnn_encoder`](JEPA/lejepa-identifiability/experiments/lejepa_id/models.py:46) | Reacher 像素 | 4层 CNN + BN + AvgPool + 线性头 |
**MatchedEncoder 设计亮点:**
- 与 RealNVP 混合函数**结构对称**(逆耦合层)
- 理论上能精确反转混合,验证可识别性上界
- 参数:`z2 = z2 - tanh(z1 @ W)`(逆向耦合)
---
### 核心实现:训练引擎([`engine.py`](JEPA/lejepa-identifiability/experiments/lejepa_id/engine.py)
```python
def train_and_evaluate(encoder, mix_fn, *, N, rho, lamb, mode="lejepa", steps=20000, ...):
# LR 调度:前半段恒定,后半段 cosine 衰减
# 在线数据生成(无需预存数据集)
# 每 log_every 步在固定 eval 集上评估所有指标
```
**训练流程:**
1. 采样潜变量 `z ~ N(0, I_N)`
2. OU 增强得到正样本对 `(z, z')`
3. 混合函数 `g` 映射到观测空间 `(x, x') = (g(z), g(z'))`
4. 编码器 `h` 映射到嵌入空间
5. 计算 `L = λ·SIGReg + (1-λ)·Alignment`
6. AdamW 优化
---
## 🔬 Lean 4 形式化证明深度解析
### 定理1证明链([`Hermite.lean`](JEPA/lejepa-identifiability/lean/LeJEPA/Hermite.lean)
**核心数据结构:**
```lean
structure SpectralWeights where
w : -- Hermite 展开系数
nonneg : d, 0 w d
zero_degree : w 0 = 0 -- 零均值约束
total_variance : ' d, w d = 1 -- 单位方差
```
**7步验证链:**
| 步骤 | 定理/引理 | 状态 |
|------|-----------|------|
| 1 | `mehler_summability`:Mehler 公式可求和性 | 公理化 |
| 2 | `correlation_le_rho`:相关性 ≤ ρ | ✅ 已验证 |
| 3 | `loss_lower_bound`:损失 ≥ 2(1-ρ)n | ✅ 已验证 |
| 4 | 最优性 → 每个 corr_i = ρ(`Finset.sum_lt_sum` | ✅ 已验证 |
| 5 | `equality_forces_degree_one`corr_i = ρ → w₁ = 1 | ✅ 已验证 |
| 6 | `linear_of_degree_one`:w₁ = 1 → h 线性 | 公理化 |
| 7 | `orthogonal_of_gaussian_linear`:线性 + 高斯 → 正交 | 公理化 |
**关键引理(已验证):**
```lean
-- ρᵈ < ρ 对 d ≥ 2 严格成立(非线性成分被严格惩罚)
theorem pow_lt_self_of_ge_two (ρ : ) (hρ0 : 0 < ρ) (hρ1 : ρ < 1)
(d : ) (hd : 2 d) : ρ ^ d < ρ
-- 等号成立 ⟺ 所有 d ≥ 2 的权重为零(即 h 是线性的)
theorem equality_forces_degree_one ...
(heq : ' d, sw.w d * ρ ^ d = ρ) :
d, 2 d sw.w d = 0
```
---
### 定理2证明链([`Uniqueness.lean`](JEPA/lejepa-identifiability/lean/LeJEPA/Uniqueness.lean)
**Sturm-Liouville 框架:**
```lean
structure LatentComponent where
K : -- 扩散系数(K > 0
score : -- (log p)',得分函数
ev : -- 第一非常数特征值 λ₁(ev > 0)
```
**核心代数步骤(已验证):**
```lean
-- K·score(z)·a = ev·(az + b)a ≠ 0
-- ⟹ score(z) = (ev/K)z + (ev·b/(Ka)),斜率 < 0
theorem score_affine_of_eigenfunction ...
α β, α < 0 score z = α * z + β
```
**双条件定理(已验证):**
```lean
theorem gaussian_uniqueness (lc : LatentComponent) :
(IsGaussianScore 仿) -- if 方向
( 仿 IsGaussianScore) -- only-if 方向
```
---
### 定理4证明链([`Planning.lean`](JEPA/lejepa-identifiability/lean/LeJEPA/Planning.lean)
**控制问题结构:**
```lean
structure ControlProblem (n : ) (Action : Type*) where
stage_cost : Latent n Action
terminal_cost : Latent n
-- O(n) 不变性:ℓ(Qz, a) = (z, a)
def IsOrthogonalInvariant cp Q : Prop :=
( z a, cp.stage_cost (Q z) a = cp.stage_cost z a)
( z, cp.terminal_cost (Q z) = cp.terminal_cost z)
```
**规划等价定理(已验证):**
```lean
-- 对任意动作序列,推前动力学下的总代价 = 原始动力学下的总代价
theorem planning_equivalence ... :
totalCost cp E_hat a (Q z) = totalCost cp E a z
-- 最优动作序列在两个空间中完全相同
theorem minimizer_equivalence ... :
( a', cost_hat a (Q z) cost_hat a' (Q z))
( a', cost a z cost a' z)
```
---
## 🖼️ 官方网站图示解读
> 来源:https://klindtlab.github.io/lejepa-identifiability/2026-05-27
### 核心图示(三面板)
```
[左] 世界的潜变量 [中] 非线性混合 [右] LeJEPA 恢复
z ~ N(0, I_n) →→→ x = g(z)(未知) →→→ h(x) = Qz(正交)
独立高斯分量 螺旋/香蕉/剪切等 旋转等价恢复
```
**TL;DR(官网原文):**
> LeJEPA linearly recovers the world's latent variables — up to rotation — **if and only if** those latents are Gaussian. The forward direction is a spectral argument on Hermite polynomials; the converse rules out every non-Gaussian alternative. All proofs are checked in Lean 4.
### 实验图示解读
**图(a):近似界验证(定理3**
- 横轴:理论界 `D + (ε+D)²`
- 纵轴:实际恢复误差
- 所有运行点均在对角线**下方**(界成立)
**图(b):高斯唯一性(定理2**
- 横轴:广义正态形状参数 α(α=2 为高斯)
- 纵轴:线性可识别性 R²
- R² 在 **α=2 处尖锐达到峰值**,两侧均下降
**图(c):控制代价(定理4**
- 高斯-OU 编码器:与 oracle 统计上无显著差异
- 轨迹编码器:代价显著偏高
**图(d):代价随 R² 单调下降**
- 线性可识别性越高 → 规划代价越低
- 支持定理4的连续性推论
### Reacher 规划演示
```
[顶行] Oracle(关节空间直线):平滑弧线轨迹
[中行] 高斯-OU 编码器:紧密跟随 oracle
[底行] RL 轨迹编码器:明显偏离(不可识别)
```
解码方式:在潜空间中线性插值,用**最近邻检索**解码到像素帧。
---
## 📊 完整实验结果表(官网版)
| N | 混合 R²(x→z) | SIGReg R²(h→z) | VICReg R²(h→z) | InfoNCE R²(h→z) |
|---|-------------|----------------|----------------|-----------------|
| 2 | 0.781±2.1e-3 | **0.999998**±3.4e-7 | 0.999996±8.4e-7 | 0.950961±1.6e-3 |
| 4 | 0.727±24e-3 | **0.999996**±12e-7 | 0.999987±54e-7 | 0.910871±8.2e-3 |
| 8 | 0.728±10e-3 | **0.999993**±9.0e-7 | 0.999988±4.8e-7 | 0.886818±42e-3 |
| 16 | 0.734±6.3e-3 | **0.999988**±4.9e-7 | 0.999987±4.6e-7 | 0.999880±0.01e-3 |
| 32 | 0.737±2.3e-3 | **0.999981**±7.2e-7 | 0.999981±9.4e-7 | 0.907809±26e-3 |
| 64 | 0.737±1.5e-3 | **0.999966**±7.4e-7 | 0.999968±8.1e-7 | 0.648496±3.1e-3 |
| 128 | 0.739±0.61e-3 | **0.999938**±3.2e-7 | 0.999942±7.2e-7 | 0.566955±6.6e-3 |
| 256 | 0.742±0.49e-3 | **0.999884**±7.9e-7 | 0.999889±7.2e-7 | 0.696587±0.49e-3 |
| 512 | 0.749±0.30e-3 | **0.999775**±6.7e-7 | 0.999785±6.9e-7 | 0.704393±0.26e-3 |
| 1024 | 0.763±0.17e-3 | **0.999561**±12e-7 | 0.999582±11e-7 | 0.720241±0.20e-3 |
> 5 个随机种子的均值±标准差。SIGReg 和 VICReg 在所有维度保持 R² > 0.999InfoNCE 在高维(N ≥ 64)因固定核宽度退化。
+171
View File
@@ -0,0 +1,171 @@
# Topic 1Hermite 多项式——从直觉到定义
> **前置知识:** 高中数学(多项式)、基础概率(正态分布)
> **目标:** 理解为什么 Hermite 多项式是分析高斯分布下函数的"天然工具"
---
## 🎯 核心问题
LeJEPA 的证明需要回答:**编码器 `h(z)` 中,哪些成分对正样本对的相关性贡献最大?**
答案需要一套能把任意函数"拆开"的工具——就像傅里叶级数把周期函数拆成正弦/余弦。在高斯分布下,这套工具就是 **Hermite 多项式**
---
## 📐 从傅里叶到 Hermite:类比理解
| 概念 | 傅里叶级数 | Hermite 展开 |
|------|-----------|-------------|
| 适用场景 | 周期函数 | 高斯分布下的函数 |
| 基函数 | `sin(nx), cos(nx)` | `H₀(z), H₁(z), H₂(z), ...` |
| 正交性 | `∫ sin(mx)sin(nx)dx = 0`m≠n | `E[Hₘ(z)Hₙ(z)] = 0`m≠nz~N(0,1) |
| 展开系数 | 傅里叶系数 | Hermite 系数 |
| 完备性 | 任意周期函数可展开 | 任意 L²(γ) 函数可展开 |
**关键区别:** Hermite 的正交性是在**高斯测度**下定义的,即期望 `E[·]` 是对 `z ~ N(0,1)` 取的。
---
## 📝 Hermite 多项式的定义
### 物理学家版(概率论中常用)
前几个 Hermite 多项式(概率论版,`He_n`):
```
He₀(z) = 1
He₁(z) = z
He₂(z) = z² - 1
He₃(z) = z³ - 3z
He₄(z) = z⁴ - 6z² + 3
He₅(z) = z⁵ - 10z³ + 15z
```
### 递推公式(最容易记忆)
```
He_{n+1}(z) = z · Heₙ(z) - n · He_{n-1}(z)
```
**例子:**
- `He₂(z) = z · He₁(z) - 1 · He₀(z) = z·z - 1·1 = z² - 1`
- `He₃(z) = z · He₂(z) - 2 · He₁(z) = z(z²-1) - 2z = z³ - 3z`
---
## 🔑 最重要的性质:正交性
`z ~ N(0,1)` 时:
```
E[Heₘ(z) · Heₙ(z)] = { n! 如果 m = n
{ 0 如果 m ≠ n
```
**直觉:** 不同"频率"(阶数)的 Hermite 多项式在高斯分布下互不干扰,就像不同频率的正弦波互相正交。
### 验证 He₁ 和 He₂ 的正交性
```
E[He₁(z) · He₂(z)] = E[z · (z² - 1)]
= E[z³] - E[z]
= 0 - 0 = 0 ✓
(高斯分布的奇数阶矩为零)
```
---
## 🌊 完备性:任意函数都能展开
对任意满足 `E[h(z)²] < ∞` 的函数 `h`,可以展开为:
```
h(z) = Σ_{d=0}^{∞} cₐ · Heₐ(z)
```
其中展开系数:
```
cₐ = E[h(z) · Heₐ(z)] / d!
```
**类比:** 就像任意向量可以用正交基展开,任意"有限能量"的函数可以用 Hermite 多项式展开。
---
## 💡 为什么 Hermite 多项式对 LeJEPA 至关重要?
### 关键事实:OU 过程对不同阶数的衰减不同
`z' = ρz + √(1-ρ²)η`OU 过程,`η ~ N(0,1)`)时:
```
E[Heₙ(z') · Heₙ(z)] = ρⁿ · n!
```
**翻译成人话:**
- 1阶(线性)成分:相关性 = `ρ¹ = ρ`
- 2阶(二次)成分:相关性 = `ρ² < ρ`(因为 `ρ < 1`
- 3阶(三次)成分:相关性 = `ρ³ < ρ²`
- d阶成分:相关性 = `ρᵈ`,随 d 增大**指数衰减**
### 这意味着什么?
LeJEPA 的对齐损失要**最大化**正样本对的相关性。由于:
- 线性成分贡献 `ρ`
- 非线性成分贡献 `ρᵈ < ρ`d ≥ 2
**最优策略就是:只保留线性成分,丢弃所有非线性成分!**
这就是定理1的核心直觉。
---
## 🎨 可视化:前4个 Hermite 多项式
```
He₀(z) = 1 ──────────────── (常数,被零均值约束排除)
He₁(z) = z (线性,这是我们想要的!)
He₂(z) = z²-1 (二次,被 OU 衰减更多)
He₃(z) = z³-3z ∫ (三次,衰减更多)
```
`z ~ N(0,1)` 的分布下,大多数概率质量集中在 `[-3, 3]` 区间。
---
## 📊 谱权重的含义
在 LeJEPA 的证明中,定义**谱权重** `wₐ`
```
wₐ = (展开系数 cₐ)² · d! / E[h(z)²]
```
满足:
- `wₐ ≥ 0`(非负)
- `w₀ = 0`(零均值约束)
- `Σ wₐ = 1`(单位方差归一化)
**物理意义:** `wₐ` 是编码器 `h` 中"d阶非线性成分"占总方差的比例。
| 情况 | 谱权重分布 | 含义 |
|------|-----------|------|
| 纯线性 `h(z) = az` | `w₁ = 1`,其余为0 | 100% 线性 |
| 纯二次 `h(z) = z²-1` | `w₂ = 1`,其余为0 | 100% 二次 |
| 混合 `h(z) = z + z²-1` | `w₁, w₂ > 0` | 线性+二次混合 |
---
## ✅ 小结
1. **Hermite 多项式** 是高斯分布下函数的"频率分解"工具
2. **正交性**:不同阶数的 Hermite 多项式在高斯期望下互不干扰
3. **OU 衰减**d 阶成分的时间相关性为 `ρᵈ`,高阶衰减更快
4. **LeJEPA 的核心**:最大化相关性 → 只保留线性(d=1)成分 → 线性可识别性
---
## ➡️ 下一步
→ [Topic 2OU 过程与 Mehler 公式](02_ou_process_mehler.md)——深入理解 `ρᵈ` 衰减的来源
+224
View File
@@ -0,0 +1,224 @@
# Topic 2Ornstein-Uhlenbeck 过程与 Mehler 公式
> **前置知识:** [Topic 1Hermite 多项式](01_hermite_polynomials.md)、基础概率(条件期望)
> **目标:** 理解 LeJEPA 中"正样本对"的生成机制,以及为什么 OU 过程对高阶成分衰减更快
---
## 🎯 核心问题
LeJEPA 训练时需要"正样本对"——同一内容的两个视图 `(z, z')`。这对视图是怎么生成的?为什么这种生成方式会导致高阶 Hermite 成分被更强地惩罚?
---
## 🌊 什么是 Ornstein-UhlenbeckOU)过程?
### 物理直觉:弹簧上的粒子
想象一个粒子被弹簧拴在原点,同时受到随机扰动:
- **弹簧力**:把粒子拉回原点(均值回归)
- **随机扰动**:布朗运动噪声
这就是 OU 过程的物理图像。
### 数学定义(连续时间)
```
dz_t = -θ z_t dt + σ dW_t
```
其中:
- `θ > 0`:均值回归速率
- `σ`:噪声强度
- `W_t`:标准布朗运动
### LeJEPA 中的离散版本
论文使用的是**离散时间 OU 过程**,一步转移:
```
z' = ρz + √(1-ρ²) η, η ~ N(0, I_n)
```
其中 `ρ ∈ (0, 1)` 是**相关系数**(对应连续时间的 `e^{-θΔt}`)。
---
## 🔑 OU 过程的三个关键性质
### 性质 1:平稳性(Stationarity
如果 `z ~ N(0, I_n)`,那么 `z' ~ N(0, I_n)`
**验证:**
```
E[z'] = ρ·E[z] + √(1-ρ²)·E[η] = 0 + 0 = 0 ✓
Var(z') = ρ²·Var(z) + (1-ρ²)·Var(η) = ρ² + (1-ρ²) = 1 ✓
```
**意义:** 正样本对 `(z, z')` 的边际分布相同,满足论文的"平稳性假设"。
### 性质 2:相关性可控
```
Cov(z', z) = E[z'z^T] = ρ·E[zz^T] = ρ·I_n
```
所以 `ρ` 直接控制两个视图的相似程度:
- `ρ → 1``z' ≈ z`(几乎相同的视图)
- `ρ → 0``z'``z` 独立(完全不同的视图)
- 实践中取 `ρ ∈ [0.8, 0.95]`
### 性质 3:加性噪声(Additive Noise
转移可以写成 `z' = m(z) + η`,其中 `m(z) = ρz` 是线性漂移,`η` 是独立噪声。这满足论文的"加性噪声假设"。
---
## 📐 Mehler 公式:OU 过程的谱定理
### 什么是 Mehler 公式?
Mehler 公式描述了 OU 过程的**转移核**transition kernel)在 Hermite 多项式基下的展开:
```
p(z'|z) = φ(z') · Σ_{d=0}^{∞} ρᵈ · Heₐ(z) · Heₐ(z') / d!
```
其中 `φ(z')` 是标准高斯密度。
### 更直观的形式:相关性公式
对任意函数 `f, g`Mehler 公式给出:
```
E[f(z) · g(z')] = Σ_{d=0}^{∞} ρᵈ · ⟨f, Heₐ⟩ · ⟨g, Heₐ⟩ / d!
```
**特别地**,当 `f = g = h_i`(编码器的第 i 个分量)时:
```
E[h_i(z) · h_i(z')] = Σ_{d=0}^{∞} ρᵈ · wₐ
```
其中 `wₐ``h_i` 在 d 阶 Hermite 多项式上的谱权重。
---
## 🎯 核心推论:高阶成分被更强惩罚
### 推导过程
设编码器分量 `h_i` 的谱权重为 `{wₐ}`(满足 `Σ wₐ = 1``w₀ = 0`)。
由 Mehler 公式:
```
corr_i := E[h_i(z') · h_i(z)] = Σ_{d=1}^{∞} wₐ · ρᵈ
```
现在比较这个值与 `ρ`
```
corr_i = Σ_{d=1}^{∞} wₐ · ρᵈ
≤ Σ_{d=1}^{∞} wₐ · ρ (因为 ρᵈ ≤ ρ 对 d ≥ 1)
= ρ · Σ_{d=1}^{∞} wₐ
= ρ · 1 = ρ
```
**结论:** `corr_i ≤ ρ`,等号成立当且仅当 `w₁ = 1`(即 `h_i` 是纯线性的)。
### 为什么等号只在线性时成立?
如果存在某个 `d₀ ≥ 2` 使得 `w_{d₀} > 0`,那么:
```
w_{d₀} · ρ^{d₀} < w_{d₀} · ρ (严格不等式,因为 ρ^{d₀} < ρ 对 d₀ ≥ 2
```
所以整个求和严格小于 `ρ`
---
## 📊 数值例子
`ρ = 0.9`,考虑三种编码器:
| 编码器 | 谱权重 | 相关性 `corr_i` | 与 `ρ=0.9` 的差距 |
|--------|--------|----------------|-----------------|
| 纯线性 `h(z) = z` | `w₁ = 1` | `0.9¹ = 0.900` | 0(最优!) |
| 纯二次 `h(z) = z²-1` | `w₂ = 1` | `0.9² = 0.810` | -0.090 |
| 纯三次 `h(z) = z³-3z` | `w₃ = 1` | `0.9³ = 0.729` | -0.171 |
| 混合 `w₁=0.5, w₂=0.5` | 各半 | `0.5×0.9 + 0.5×0.81 = 0.855` | -0.045 |
**结论:** 非线性成分越多,相关性越低,对齐损失越大。
---
## 🔗 与 LeJEPA 训练目标的联系
LeJEPA 的对齐损失:
```
L_align = E[‖h(z') - h(z)‖²]
= 2n - 2 Σᵢ E[h_i(z') · h_i(z)]
= 2n - 2 Σᵢ corr_i
```
最小化 `L_align` ⟺ 最大化 `Σᵢ corr_i`
由 Mehler 公式,`corr_i ≤ ρ`,所以:
```
L_align ≥ 2n - 2nρ = 2(1-ρ)n
```
**等号成立当且仅当每个 `h_i` 都是线性的!**
这就是定理1的核心:**最优编码器必须是线性的**。
---
## 🎨 直觉图示
```
ρ = 0.9 时,不同阶数的衰减:
d=1 (线性): ρ¹ = 0.900 ████████████████████ ← 最大相关性
d=2 (二次): ρ² = 0.810 ██████████████████
d=3 (三次): ρ³ = 0.729 ████████████████
d=4 (四次): ρ⁴ = 0.656 ██████████████
d=5 (五次): ρ⁵ = 0.590 █████████████
非线性成分的相关性随阶数指数衰减!
```
---
## 🔧 代码实现
在 [`data.py`](../lejepa-identifiability/experiments/lejepa_id/data.py:29) 中:
```python
def ou_augment(z, rho, n_views=2, dist="gaussian", alpha=None):
"""z' = ρz + √(1-ρ²)η"""
fac = (1 - rho ** 2) ** 0.5
D, N = z.shape
eta = sample_latents(n_views * D, N, dist=dist, ...)
eta = eta.reshape(n_views, D, N)
return rho * z.unsqueeze(0) + fac * eta
```
实验配置([`configs/2d.yaml`](../lejepa-identifiability/experiments/configs/2d.yaml))中 `rho` 的典型值为 `0.9`
---
## ✅ 小结
1. **OU 过程** 生成正样本对 `(z, z')`,相关性由 `ρ` 控制
2. **平稳性**`z, z'` 有相同的高斯边际分布
3. **Mehler 公式**OU 过程对 d 阶 Hermite 成分的相关性为 `ρᵈ`
4. **核心不等式**`corr_i = Σ wₐ ρᵈ ≤ ρ`,等号 ⟺ 纯线性
5. **训练含义**:最小化对齐损失 → 最大化相关性 → 编码器必须是线性的
---
## ➡️ 下一步
→ [Topic 3:谱分解与线性可识别性](03_spectral_identifiability.md)——把 Hermite 展开和 OU 衰减组合成完整的定理1证明
+237
View File
@@ -0,0 +1,237 @@
# Topic 3:谱分解与线性可识别性(定理 1 完整证明)
> **前置知识:** [Topic 1Hermite 多项式](01_hermite_polynomials.md)、[Topic 2OU 过程与 Mehler 公式](02_ou_process_mehler.md)
> **目标:** 把前两个 topic 的工具组合起来,完整理解定理1的证明逻辑
---
## 🎯 定理 1 的完整陈述
> **定理 1(线性可识别性):** 在高斯世界中,设编码器 `h : ℝⁿ → ℝⁿ` 满足:
> 1. **高斯约束**`h(z) ~ N(0, Iₙ)`(嵌入分布是各向同性高斯)
> 2. **最优对齐**`h` 最小化对齐损失 `L_align = E[‖h(z') - h(z)‖²]`
>
> 则 `h(z) = Qz`,其中 `Q ∈ O(n)` 是正交矩阵。
**白话翻译:** 如果你强制嵌入是高斯的,并且最大化正样本对的相似度,那么编码器**必然**是线性的(且保持距离)。
---
## 🗺️ 证明路线图
```
高斯约束 + 最优对齐
[步骤1] Hermite 展开:h_i(z) = Σ cₐ Heₐ(z)
[步骤2] Mehler 公式:corr_i = Σ wₐ ρᵈ
[步骤3] 关键不等式:corr_i ≤ ρ(等号 ⟺ w₁=1
[步骤4] 最优性条件:L_align = 2(1-ρ)n → 每个 corr_i = ρ
[步骤5] 线性性:每个 h_i 是线性函数
[步骤6] 正交性:高斯约束 + 线性 → Q ∈ O(n)
```
---
## 📐 步骤 1Hermite 展开
由 Topic 1,任意满足 `E[h_i(z)²] < ∞` 的函数可以展开:
```
h_i(z) = Σ_{α} c_{i,α} He_α(z)
```
其中 `α = (α₁, ..., αₙ)` 是多指标,`|α| = α₁ + ... + αₙ` 是总阶数。
**高斯约束的含义:**
- `E[h_i(z)] = 0``c_{i,0} = 0`(零均值,排除常数项)
- `E[h_i(z)²] = 1``Σ_{|α|≥1} c_{i,α}² |α|! = 1`(单位方差)
定义**谱权重**
```
w_{i,d} = Σ_{|α|=d} c_{i,α}² d! / E[h_i(z)²]
```
`w_{i,d} ≥ 0``w_{i,0} = 0``Σ_d w_{i,d} = 1`
---
## 📐 步骤 2:用 Mehler 公式计算相关性
由 Topic 2 的 Mehler 公式:
```
corr_i := E[h_i(z') · h_i(z)] = Σ_{d=1}^{∞} w_{i,d} · ρᵈ
```
这是一个**加权平均**:用谱权重 `w_{i,d}``ρᵈ` 求加权和。
---
## 📐 步骤 3:关键不等式
**引理(已在 Lean 4 中验证):**
```
corr_i = Σ_{d=1}^{∞} w_{i,d} · ρᵈ ≤ Σ_{d=1}^{∞} w_{i,d} · ρ = ρ
```
**等号成立的条件:**
等号成立 ⟺ 对所有 `d ≥ 2``w_{i,d} · ρᵈ = w_{i,d} · ρ`
由于 `ρᵈ < ρ`(当 `d ≥ 2, 0 < ρ < 1`),这要求 `w_{i,d} = 0` 对所有 `d ≥ 2`
又因为 `Σ_d w_{i,d} = 1``w_{i,0} = 0`,所以 `w_{i,1} = 1`
**结论:** `corr_i = ρ``h_i` 是纯线性函数(只有 d=1 的 Hermite 成分)。
---
## 📐 步骤 4:最优性条件
对齐损失可以写成:
```
L_align = E[‖h(z') - h(z)‖²]
= Σᵢ E[(h_i(z') - h_i(z))²]
= Σᵢ (E[h_i(z')²] + E[h_i(z)²] - 2E[h_i(z')h_i(z)])
= Σᵢ (1 + 1 - 2·corr_i)
= 2n - 2 Σᵢ corr_i
```
由步骤3`corr_i ≤ ρ`,所以:
```
L_align = 2n - 2 Σᵢ corr_i ≥ 2n - 2nρ = 2(1-ρ)n
```
**最优值 `L_align = 2(1-ρ)n` 当且仅当每个 `corr_i = ρ`。**
由步骤3的等号条件,这要求每个 `h_i` 都是线性的。
---
## 📐 步骤 5:线性性
每个 `h_i` 只有 d=1 的 Hermite 成分,即:
```
h_i(z) = Σⱼ aᵢⱼ zⱼ
```
写成矩阵形式:`h(z) = Az`,其中 `A ∈ ℝⁿˣⁿ`
---
## 📐 步骤 6:正交性
现在利用**高斯约束** `h(z) ~ N(0, Iₙ)`
如果 `h(z) = Az``z ~ N(0, Iₙ)`,则:
```
h(z) ~ N(0, AA^T)
```
要使 `h(z) ~ N(0, Iₙ)`,需要:
```
AA^T = Iₙ
```
这正是 `A ∈ O(n)`(正交矩阵)的定义!
**结论:** `h(z) = Qz``Q ∈ O(n)`。 □
---
## 🔍 为什么叫"线性可识别性"?
### 可识别性(Identifiability)的含义
在表示学习中,"可识别性"指:从观测数据 `x = g(z)` 中,能否恢复出真实的潜变量 `z`
- **完全可识别**`h(x) = z`(精确恢复)
- **线性可识别**`h(x) = Qz`(恢复到正交变换等价)
- **置换可识别**`h(x) = Pz`(恢复到置换等价,ICA 的结果)
- **不可识别**:无法从 `h(x)` 恢复 `z` 的任何信息
### 为什么"正交等价"已经足够?
正交变换保持:
- **距离**`‖Qz₁ - Qz₂‖ = ‖z₁ - z₂‖`
- **内积**`⟨Qz₁, Qz₂⟩ = ⟨z₁, z₂⟩`
- **范数**`‖Qz‖ = ‖z‖`
对于**旋转不变的代价函数**(如欧氏距离、LQR),在 `Qz` 空间中规划与在 `z` 空间中规划完全等价(见 Topic 6)。
---
## 🎨 几何直觉
```
真实潜空间 z: 学到的表示 h(z) = Qz:
z₂ h₂
↑ ↑
│ ● ● │ ● ●
│● ● │ ● ●
│ ●● │ ●●
└──────→ z₁ └──────→ h₁
两个空间的点云形状完全相同,只是旋转了角度 θ。
所有距离、角度关系都被保留。
```
---
## ⚠️ 证明的假设条件
定理1成立需要以下条件:
| 假设 | 含义 | 如果违反? |
|------|------|-----------|
| 潜变量是高斯的 | `z ~ N(0, I_n)` | 定理2说明:非高斯时线性可识别性失败 |
| OU 转移 | `z' = ρz + √(1-ρ²)η` | 其他转移可能不满足 Mehler 公式 |
| 高斯约束 | `h(z) ~ N(0, I_n)` | 没有约束则编码器可能坍塌 |
| 最优对齐 | `h` 达到全局最优 | 局部最优可能不是线性的 |
---
## 🔧 Lean 4 验证状态
在 [`Hermite.lean`](../lejepa-identifiability/lean/LeJEPA/Hermite.lean) 中:
| 步骤 | 对应定理 | 状态 |
|------|---------|------|
| 步骤3(不等式) | `correlation_le_rho` | ✅ 机器验证 |
| 步骤3(等号条件) | `equality_forces_degree_one` | ✅ 机器验证 |
| 步骤4(损失下界) | `loss_lower_bound` | ✅ 机器验证 |
| 步骤4(最优性) | `hermite_identifiability`(主定理) | ✅ 机器验证 |
| 步骤1Hermite 基) | `mehler_summability` | 公理化(Mathlib 尚未收录) |
| 步骤5(线性性) | `linear_of_degree_one` | 公理化 |
| 步骤6(正交性) | `orthogonal_of_gaussian_linear` | 公理化 |
---
## ✅ 小结
定理1的证明是一个**优化论证**
1. 把编码器用 Hermite 多项式展开(谱分解)
2. 用 Mehler 公式计算正样本对的相关性
3. 证明相关性 ≤ ρ,等号 ⟺ 纯线性
4. 最优对齐要求每个分量都达到等号
5. 因此编码器必须是线性的
6. 高斯约束进一步要求线性映射是正交的
**核心洞见:** OU 过程对高阶非线性成分的"惩罚"(衰减)比线性成分更强,所以最优编码器会"放弃"所有非线性成分。
---
## ➡️ 下一步
→ [Topic 4Sturm-Liouville 理论与高斯唯一性](04_sturm_liouville_uniqueness.md)——为什么只有高斯分布才能保证线性可识别性?
+257
View File
@@ -0,0 +1,257 @@
# Topic 4Sturm-Liouville 理论与高斯唯一性(定理 2)
> **前置知识:** [Topic 3:谱分解与线性可识别性](03_spectral_identifiability.md)、基础微积分(微分方程)
> **目标:** 理解为什么高斯分布是**唯一**能保证线性可识别性的分布
---
## 🎯 定理 2 的完整陈述
> **定理 2(高斯唯一性):** 在满足世界假设(独立性、平稳性、加性噪声)的所有分布中,**高斯分布是唯一**使 LeJEPA 实现线性可识别性的分布。
**白话翻译:** 定理1的结论(线性可识别性)不是对所有分布都成立的——它只对高斯分布成立。换句话说,高斯分布是"恰好合适"的分布。
---
## 🤔 为什么这个结论令人惊讶?
### 与经典 ICA 的对比
在**线性 ICA**(独立成分分析)中,结论恰好相反:
| 场景 | 高斯分布 | 非高斯分布 |
|------|---------|-----------|
| 线性 ICA | ❌ **失败**(无法分离) | ✅ 成功 |
| LeJEPA(非线性) | ✅ **成功** | ❌ 失败 |
**LeJEPA 完全颠倒了 ICA 的结论!**
### 直觉解释
- **线性 ICA 失败的原因**:高斯分布的旋转不变性使得无法区分不同的旋转方向
- **LeJEPA 成功的原因**:正是这种旋转不变性,使得 OU 过程的谱分解(Hermite 多项式)恰好给出线性最优解
---
## 🔑 证明的核心工具:Sturm-Liouville 理论
### 什么是 Sturm-Liouville 问题?
Sturm-Liouville 问题是一类特殊的微分方程特征值问题:
```
-(p(z) φ'(z))' + q(z) φ(z) = λ w(z) φ(z)
```
其中 `φ` 是特征函数,`λ` 是特征值。
**在 LeJEPA 的语境中:** 转移算子 `T[f](z) = E[f(z')|z]` 的特征函数满足 Sturm-Liouville 方程。
### 关键联系
对于加性噪声转移 `z' = m(z) + η`,转移算子的特征方程为:
```
K · (log p(z))' · φ(z) + K · φ'(z) = -λ₁ · φ(z)
```
其中:
- `K`:扩散系数(与噪声方差有关)
- `(log p(z))'`**得分函数**score function
- `λ₁`:第一非常数特征值
---
## 📐 证明路线:从仿射特征函数到高斯分布
### 关键问题
定理1的证明依赖于"第一特征函数是线性的"(即 `φ₁(z) = z`)。
定理2要问:**什么分布 `p` 使得第一特征函数是仿射的(`φ₁(z) = az + b`)?**
### 步骤 1:仿射特征函数 → 仿射得分函数
设第一特征函数是仿射的:`φ₁(z) = az + b``a ≠ 0`)。
代入特征方程:
```
K · score(z) · a = -λ₁ · (az + b)
```
解出得分函数:
```
score(z) = (log p(z))' = -(λ₁/K) · z - (λ₁ b)/(Ka)
= α · z + β
```
其中 `α = -λ₁/K < 0`(因为 `λ₁ > 0, K > 0`)。
**结论:** 仿射特征函数 → 得分函数是线性的(斜率为负)。
### 步骤 2:仿射得分函数 → 高斯分布
得分函数 `(log p(z))' = αz + β`,积分得:
```
log p(z) = (α/2) z² + βz + C
```
由于 `α < 0`,这是一个**向下开口的抛物线**,对应:
```
p(z) ∝ exp((α/2) z² + βz) = exp(-(z-μ)²/(2σ²))
```
这正是**高斯分布** `N(μ, σ²)`
### 步骤 3:反向(高斯 → 仿射特征函数)
反过来,如果 `p` 是高斯分布,则其 Sturm-Liouville 特征函数是 Hermite 多项式,第一个非常数特征函数是 `He₁(z) = z`(仿射的)。
---
## 🔄 完整的双条件定理
```
p 是高斯分布
第一特征函数是仿射的
LeJEPA 实现线性可识别性
```
**Lean 4 验证([`Uniqueness.lean`](../lejepa-identifiability/lean/LeJEPA/Uniqueness.lean)):**
```lean
theorem gaussian_uniqueness (lc : LatentComponent) :
-- if 方向:高斯 → 仿射特征函数
(IsGaussianScore lc.score
(a b : ), a 0 z, K·score(z)·a = -(ev·(az+b)))
-- only-if 方向:仿射特征函数 → 高斯
( (a b : ), a 0
( z, K·score(z)·a = -(ev·(az+b)))
IsGaussianScore lc.score)
```
---
## 🎨 直觉图示:为什么非高斯分布失败?
### 拉普拉斯分布(α=1
```
p(z) ∝ exp(-|z|)
得分函数:(log p)' = -sign(z) (在 z≠0 处)
这是一个阶跃函数,不是线性的!
→ 第一特征函数不是仿射的
→ 线性可识别性失败
```
### 均匀分布(α→∞)
```
p(z) = 1/(2a) 在 [-a, a] 上
得分函数:(log p)' = 0 (在内部)
这是常数,不是线性的!
→ 第一特征函数不是仿射的
→ 线性可识别性失败
```
### 高斯分布(α=2
```
p(z) ∝ exp(-z²/2)
得分函数:(log p)' = -z (线性!)
→ 第一特征函数是 He₁(z) = z(仿射)
→ 线性可识别性成立 ✓
```
---
## 📊 实验验证(广义正态分布族)
论文用**广义正态分布**Generalized Normal)扫描形状参数 `α`
```
p(z; α) ∝ exp(-|z/β|^α)
```
- `α = 1`:拉普拉斯分布
- `α = 2`:高斯分布(唯一成功的!)
- `α → ∞`:均匀分布
实验结果([`gennorm.yaml`](../lejepa-identifiability/experiments/configs/gennorm.yaml) 配置):
```
R²(h→z) 随 α 的变化:
α=0.5 ████░░░░░░░░░░░░░░░░ ~0.5(重尾,失败)
α=1.0 ██████░░░░░░░░░░░░░░ ~0.6(拉普拉斯,失败)
α=1.5 ████████░░░░░░░░░░░░ ~0.8(接近高斯,部分成功)
α=2.0 ████████████████████ ~1.0(高斯,完全成功!)
α=3.0 ████████░░░░░░░░░░░░ ~0.8(超高斯,部分失败)
α=5.0 ██████░░░░░░░░░░░░░░ ~0.6(接近均匀,失败)
```
**R² 在 α=2(高斯)处尖锐达到峰值**,完美验证定理2。
---
## 🔗 与 ICA 理论的深层联系
### 为什么 ICA 和 LeJEPA 的结论相反?
| 方法 | 目标 | 高斯的角色 |
|------|------|-----------|
| 线性 ICA | 最大化非高斯性(kurtosis | 高斯是"最难分离"的 |
| LeJEPA | 最大化 OU 相关性 | 高斯是"最容易识别"的 |
**根本原因:** ICA 利用高阶统计量(非高斯性)来分离信号;LeJEPA 利用时间结构(OU 相关性)来识别信号。这两种方法对高斯分布的"态度"完全相反。
### Hyvärinen & Pajunen (1999) 的经典结论
> 非线性 ICA 在一般情况下是不可识别的。
LeJEPA 通过**限制分布为高斯**和**使用时间结构**,绕过了这个不可识别性结果。
---
## ⚠️ 实践含义
### 什么时候潜变量近似高斯?
1. **中心极限定理**:如果潜变量是许多独立小因素的叠加,则趋向高斯
2. **宏观物理量**:温度、压力等宏观量通常近似高斯
3. **主成分**:PCA 后的主成分在许多情况下近似高斯
### 什么时候不是高斯?
1. **稀疏信号**:自然图像的小波系数(拉普拉斯分布)
2. **有界量**:角度、概率值(均匀或 Beta 分布)
3. **多峰分布**:类别标签、离散状态
**论文的建议:** 对于非高斯潜变量,LeJEPA 仍然有用,但线性可识别性保证不再成立(见 Topic 5 的近似界)。
---
## ✅ 小结
1. **定理2** 证明高斯分布是线性可识别性的**唯一**充要条件
2. **证明工具**Sturm-Liouville 特征值理论
3. **核心链条**:仿射特征函数 ⟺ 线性得分函数 ⟺ 高斯分布
4. **与 ICA 的对比**LeJEPA 完全颠倒了 ICA 中高斯分布的角色
5. **实验验证**:广义正态分布扫描显示 R² 在 α=2 处尖锐达到峰值
---
## ➡️ 下一步
→ [Topic 5:近似可识别性界](05_approximate_identifiability.md)——当假设只近似满足时,误差如何优雅降级?
+236
View File
@@ -0,0 +1,236 @@
# Topic 5:近似可识别性界(定理 3)
> **前置知识:** [Topic 3:谱分解与线性可识别性](03_spectral_identifiability.md)
> **目标:** 理解当理论假设只近似满足时,恢复误差如何被量化和控制
---
## 🎯 定理 3 的完整陈述
> **定理 3(近似可识别性):** 设编码器 `h` 满足:
> - **近似对齐**`L_align(h) ≤ 2(1-ρ)n + δ`(对齐损失比最优值多 `δ`)
> - **近似白化**`‖Cov(h(z)) - Iₙ‖_F ≤ ε`(协方差矩阵偏离单位阵 `ε`)
>
> 则存在正交矩阵 `Q ∈ O(n)` 使得:
> ```
> E[‖h(z) - Qz‖²] ≤ D + (ε + D)²
> ```
> 其中 `D = δ / (2ρ(1-ρ))`。
---
## 🤔 为什么需要近似版本?
定理1是**精确**结论:在完美条件下,`h(z) = Qz`
但在实践中:
1. **优化不完美**:梯度下降不一定找到全局最优
2. **有限样本**:用有限数据估计的协方差矩阵有误差
3. **模型容量**:神经网络可能无法精确表示线性函数
4. **非高斯数据**:真实数据可能不完全满足高斯假设
定理3告诉我们:**即使条件只近似满足,恢复误差也是有界的,且随误差优雅降级**。
---
## 📐 两个误差参数的含义
### 参数 δ:对齐间隙(Alignment Gap
```
δ = L_align(h) - 2(1-ρ)n ≥ 0
```
- `δ = 0`:完美对齐(定理1的条件)
- `δ > 0`:对齐损失比最优值多 `δ`
**物理含义:** 正样本对的嵌入有多"不相似"(超出理论最优的部分)。
### 参数 ε:白化误差(Whitening Error
```
ε = ‖Cov(h(z)) - Iₙ‖_F
```
- `ε = 0`:完美白化(嵌入是各向同性高斯)
- `ε > 0`:协方差矩阵偏离单位阵
**物理含义:** 嵌入分布有多"不高斯"(协方差矩阵偏离单位阵的程度)。
---
## 📐 归一化量 D 的推导
`δ``D` 的转换:
```
D = δ / (2ρ(1-ρ))
```
**为什么要除以 `2ρ(1-ρ)`**
回忆定理1的证明:对齐损失的最优值是 `2(1-ρ)n`,而相关性的"谱间隙"(线性成分 `ρ` 与二次成分 `ρ²` 之差)是:
```
ρ - ρ² = ρ(1-ρ)
```
所以 `2ρ(1-ρ)` 是"每单位非线性成分对对齐损失的贡献"。除以它可以把对齐间隙 `δ` 转换为"非线性成分的总权重"。
---
## 📐 界的推导(简化版)
### 第一步:从 δ 到非线性权重
由定理1的证明,对齐损失可以写成:
```
L_align = 2n - 2 Σᵢ corr_i = 2n - 2 Σᵢ Σ_d w_{i,d} ρᵈ
```
最优值是 `2(1-ρ)n`(所有 `w_{i,1} = 1`)。
对齐间隙 `δ` 对应于非线性成分的总权重:
```
Σᵢ Σ_{d≥2} w_{i,d} ≤ δ / (2ρ(1-ρ)) = D
```
### 第二步:从非线性权重到恢复误差
非线性成分的总权重 `D` 直接给出恢复误差的一部分:
```
E[‖h(z) - Az‖²] ≤ D
```
其中 `A` 是最优线性近似。
### 第三步:从线性近似到正交矩阵
`A` 不一定是正交的(因为白化误差 `ε`)。从 `A` 到最近的正交矩阵 `Q`Procrustes 问题)引入额外误差:
```
‖A - Q‖_F ≤ ε + D
```
### 第四步:三角不等式组合
```
E[‖h(z) - Qz‖²] ≤ E[‖h(z) - Az‖²] + ‖A - Q‖_F²
≤ D + (ε + D)²
```
---
## 📊 界的数值感受
`ρ = 0.9`,考虑不同的误差水平:
| δ(对齐间隙) | ε(白化误差) | D = δ/(2×0.9×0.1) | 界 D + (ε+D)² |
|-------------|-------------|-------------------|--------------|
| 0 | 0 | 0 | 0(完美!) |
| 0.018 | 0 | 0.1 | 0.1 + 0.01 = 0.11 |
| 0.018 | 0.1 | 0.1 | 0.1 + 0.04 = 0.14 |
| 0.018 | 0.5 | 0.1 | 0.1 + 0.36 = 0.46 |
| 0.18 | 0 | 1.0 | 1.0 + 1.0 = 2.0 |
**观察:**
- 对齐间隙 `δ` 是主要误差来源(通过 `D`
- 白化误差 `ε` 的影响是二阶的(`(ε+D)²` 中的 `ε`
-`D` 很小时,`ε` 的影响可以忽略
---
## 🔧 代码中的量化
在 [`metrics.py`](../lejepa-identifiability/experiments/lejepa_id/metrics.py:16) 中,所有界的量都被计算:
```python
def compute_all_metrics(z, x, h, h_prime, rho, N):
# 白化误差 ε
cov_h = torch.cov(h.T)
epsilon = torch.linalg.norm(cov_h - torch.eye(N), 'fro').item()
# 对齐损失 L_h
L_h = ((h_prime - h) ** 2).sum(dim=1).mean().item()
# 对齐间隙 δ(与理论最优 2(1-ρ)·trace_cov 的差)
delta = max(L_h - 2 * (1 - rho) * trace_cov, 0.0)
# 归一化量 D
spectral_gap = 2 * rho * (1 - rho)
D_bound = delta / spectral_gap
# 近似界
approx_bound = D_bound + (epsilon + D_bound) ** 2
```
---
## 📈 实验验证
论文在所有实验运行中验证了定理3
**图(a)(官网):** 横轴是理论界 `D + (ε+D)²`,纵轴是实际恢复误差。
```
实际误差
│ ●
│ ●●
│ ●●●
│ ●●●●
│●●●●
└──────────────────→ 理论界
所有点在对角线下方(界成立)
```
**关键发现:**
- 所有运行的实际误差均**低于**理论界(界是有效的)
- 对齐损失 `L_h` 是可识别性的**最强预测指标**
- 白化误差 `ε` 的影响相对较小
---
## 🎯 实践含义
### 对训练的指导
1. **优先优化对齐损失**`δ` 是主要误差来源,应该尽量减小
2. **白化误差是次要的**`ε` 的影响是二阶的,不需要过度追求完美白化
3. **监控 D_bound**:训练时可以用 `D_bound` 作为可识别性的代理指标
### 对超参数选择的指导
- **`ρ` 的选择**`ρ` 越大,`2ρ(1-ρ)` 越小,`D` 越大(对 `δ` 更敏感)
- `ρ = 0.5` 时:`2ρ(1-ρ) = 0.5`(最大谱间隙)
- `ρ = 0.9` 时:`2ρ(1-ρ) = 0.18`(较小谱间隙)
- 实践中 `ρ ∈ [0.8, 0.95]` 是好的选择
- **`λ` 的选择**:正则化权重影响白化误差 `ε`
- `λ` 太小:白化不充分,`ε`
- `λ` 太大:对齐损失被忽视,`δ`
---
## 🔬 Lean 4 验证
在 [`Approx.lean`](../lejepa-identifiability/lean/LeJEPA/Approx.lean) 中形式化验证了定理3的核心不等式链。
---
## ✅ 小结
1. **定理3** 量化了"近似满足条件时"的恢复误差
2. **两个误差参数**:对齐间隙 `δ`(主要)和白化误差 `ε`(次要)
3. **界的形式**`D + (ε+D)²`,其中 `D = δ/(2ρ(1-ρ))`
4. **优雅降级**:误差随 `δ, ε → 0` 连续趋向零
5. **实践指导**:优先减小对齐损失,白化误差是次要的
---
## ➡️ 下一步
→ [Topic 6:正交不变性与最优规划](06_planning_equivalence.md)——线性可识别性如何使潜空间规划与真实世界规划等价?
+272
View File
@@ -0,0 +1,272 @@
# Topic 6:正交不变性与最优规划(定理 4)
> **前置知识:** [Topic 3:谱分解与线性可识别性](03_spectral_identifiability.md)、基础控制理论(可选)
> **目标:** 理解为什么线性可识别性足以保证在学到的潜空间中规划与在真实世界中规划完全等价
---
## 🎯 定理 4 的完整陈述
> **定理 4(最优潜空间规划):**`h(z) = Qz``Q ∈ O(n)`,由定理1保证)。对任意有限时域控制问题,若代价函数关于状态是 **O(n)-不变的**,则:
>
> ```
> V̂*(h(z₀)) = V*(z₀) (最优值函数相等)
> â*_{1:T}(h(z₀)) = a*_{1:T}(z₀) (最优动作序列相等)
> ```
**白话翻译:** 如果代价函数不区分旋转方向,那么在学到的潜空间 `ĥ = Qz` 中规划,与在真实潜空间 `z` 中规划,得到的最优策略完全相同。
---
## 🤔 为什么这个结论重要?
### 世界模型的终极目标
学习世界模型的目的是**规划**:给定当前状态,找到最优动作序列。
如果学到的表示 `h(z)` 不能支持正确的规划,那么世界模型就没有实用价值。
定理4说明:**线性可识别性(正交等价)已经足够支持最优规划**——不需要精确恢复 `z`,只需要恢复到旋转等价。
---
## 📐 关键概念:O(n)-不变代价函数
### 定义
代价函数 `(z, a)`**O(n)-不变的**,如果对所有正交矩阵 `Q ∈ O(n)`
```
(Qz, a) = (z, a) 对所有 z, a
```
**直觉:** 代价函数不依赖于坐标系的旋转方向,只依赖于状态的"本质"(如距离、范数等)。
### 常见的 O(n)-不变代价函数
| 代价函数 | 形式 | 不变性 |
|---------|------|--------|
| 欧氏距离到目标 | `‖z - z_goal‖²` | ✅(若 `z_goal` 也旋转) |
| 线性二次调节(LQR | `z^T P z + a^T R a` | ✅(若 `P = cI` |
| 范数惩罚 | `‖z‖²` | ✅ |
| 目标到达 | `𝟙[‖z - z_goal‖ < r]` | ✅ |
| 任意旋转不变量 | `f(‖z‖, ‖a‖, ...)` | ✅ |
### 不满足 O(n)-不变性的代价函数
| 代价函数 | 形式 | 原因 |
|---------|------|------|
| 坐标惩罚 | `z₁²`(只惩罚第一维) | ❌ 旋转后变成 `(Qz)₁²` |
| 非对称目标 | `‖z - [1,0,...,0]‖²` | ❌ 目标方向固定 |
---
## 📐 证明的核心思路
### 关键引理:代价等价
`h(z) = Qz``Q ∈ O(n)`。对任意 O(n)-不变代价函数 ``
```
(h(z), a) = (Qz, a) = (z, a)
```
**这一步是整个证明的核心!** 正交变换不改变 O(n)-不变代价函数的值。
### 轨迹推前(Trajectory Pushforward
设真实动力学为 `p(z'|z, a)`,学到的潜空间动力学为 `p̂(ẑ'|ẑ, a)`(其中 `ẑ = Qz`)。
由于 `h(z) = Qz` 是线性双射,学到的动力学是真实动力学的**推前**:
```
p̂(ẑ'|ẑ, a) = p(Q⁻¹ẑ'|Q⁻¹ẑ, a) = p(z'|z, a)
```
(因为 `Q⁻¹ = Q^T` 对正交矩阵成立)
### 总代价等价
对任意动作序列 `a_{1:T}`,从初始状态 `z₀` 出发的总期望代价:
```
J(a_{1:T}; ẑ₀) = E[Σ_t (ẑ_t, a_t) + _T(ẑ_T) | ẑ₀ = Qz₀]
= E[Σ_t (Qz_t, a_t) + _T(Qz_T) | z₀]
= E[Σ_t (z_t, a_t) + _T(z_T) | z₀] O(n)-不变性)
= J(a_{1:T}; z₀)
```
**结论:** 对任意动作序列,两个空间中的总代价完全相同!
### 最优性等价
由于对所有 `a_{1:T}` 代价相等,最小化代价的动作序列也相同:
```
a*_{1:T}(ẑ₀) = argmin_a J(a; ẑ₀) = argmin_a J(a; z₀) = a*_{1:T}(z₀)
```
最优值函数也相等:
```
V̂*(ẑ₀) = min_a J(a; ẑ₀) = min_a J(a; z₀) = V*(z₀)
```
---
## 🎨 几何直觉
```
真实潜空间 z: 学到的潜空间 ẑ = Qz:
z₂ ẑ₂
↑ ↑
│ ●goal │ ●goal'
│ │
│●start │ ●start'
└──────→ z₁ └──────→ ẑ₁
最优路径(蓝色): 最优路径(蓝色):
start → goal start' → goal'
(直线,欧氏距离最短) (直线,欧氏距离最短)
两条路径在旋转意义下完全相同!
```
---
## 🔧 Lean 4 验证([`Planning.lean`](../lejepa-identifiability/lean/LeJEPA/Planning.lean)
```lean
-- 核心:对任意动作序列,两个空间的总代价相等
theorem planning_equivalence
(cp : ControlProblem n Action) (Q : Latent n → Latent n)
(hinv : IsOrthogonalInvariant cp Q)
(a : Plan Action T) (z : Latent n) :
totalCost cp E_hat a (Q z) = totalCost cp E a z
-- 推论:最优动作序列相同
theorem minimizer_equivalence ... :
(∀ a', cost_hat a (Q z) ≤ cost_hat a' (Q z)) ↔
(∀ a', cost a z ≤ cost a' z)
-- 推论:最优值函数相等
theorem value_equivalence ... :
totalCost cp E a z = V →
totalCost cp E_hat a (Q z) = V
```
---
## 🔬 实验验证:DMC Reacher
### 实验设置
- **环境**DeepMind Control Suite 的 Reacher 任务
- **输入**:像素图像(64×64 RGB
- **潜变量**2D 关节角度 `z = (θ₁, θ₂)`
- **编码器**CNN(见 [`models.py`](../lejepa-identifiability/experiments/lejepa_id/models.py:46)
- **规划方式**:在潜空间中线性插值,用最近邻检索解码
### 两种训练数据
| 数据类型 | 生成方式 | 分布 | 可识别性 |
|---------|---------|------|---------|
| OU 采样 | `z' = ρz + √(1-ρ²)η` | 各向同性高斯 | ✅ 高(满足定理1) |
| RL 轨迹 | 训练好的策略采样 | 非高斯、各向异性 | ❌ 低(违反假设) |
### 实验结果
```
规划代价(路径长度,越低越好,理想值=1):
Oracle(关节空间直线): ████░░░░░░ ~1.0(基准)
OU 编码器: ████░░░░░░ ~1.0(与 oracle 无统计显著差异)
轨迹编码器: ██████░░░░ ~1.5(显著偏高)
```
**结论:** OU 编码器(满足定理1条件)的规划质量与 oracle 相当;轨迹编码器(违反假设)的规划质量显著下降。
### 可视化
```
[顶行] Oracle
●──────────────────● (关节空间直线,平滑弧线)
[中行] OU 编码器(可识别):
●──────────────────● (紧密跟随 oracle)
[底行] 轨迹编码器(不可识别):
●────╮╰──────────● (偏离,因为潜空间扭曲)
```
---
## 🔗 与世界模型的联系
### 什么是"可证明地学到世界模型"?
论文的标题问题:"When Does LeJEPA Learn a World Model?"
答案(由定理4给出):
> **LeJEPA 学到世界模型,当且仅当它实现了线性可识别性。**
因为:
- 线性可识别性 → `h(z) = Qz`(正交等价)
- 正交等价 → O(n)-不变代价函数下的规划等价(定理4)
- 规划等价 → 可以在学到的潜空间中做最优规划
- 最优规划 → 学到的表示是"可用的世界模型"
---
## ⚠️ 定理4的局限性
### 1. 只覆盖 O(n)-不变代价函数
如果代价函数依赖于特定坐标方向(如"向北走"),则定理4不适用。
**实践中:** 大多数物理任务的代价函数(距离、能量、时间)都是旋转不变的。
### 2. 只处理编码器侧
定理4假设动力学 `p̂(ẑ'|ẑ, a)` 是真实动力学的推前。但在实践中,还需要学习一个**转移模型**(predictor)。
**未来工作:** 动作条件转移 `p̂(ẑ'|ẑ, a)` 的可识别性(与因果表示学习相关)。
### 3. 有限时域
定理4是有限时域(`T` 步)的结论。无限时域(折扣 MDP)的情况需要额外分析。
---
## ✅ 小结
1. **定理4** 证明线性可识别性足以保证最优规划等价
2. **关键条件**:代价函数是 O(n)-不变的(旋转不变)
3. **证明核心**:正交变换不改变 O(n)-不变代价函数的值
4. **实验验证**:OU 编码器的规划质量与 oracle 相当,轨迹编码器显著下降
5. **世界模型含义**:线性可识别性 = 可证明地学到世界模型
---
## 🏁 四个定理的完整图景
```
定理1(正向):高斯世界 + LeJEPA → 线性可识别性 h(z) = Qz
定理2(逆向):高斯是唯一使线性可识别性成立的分布
定理3(近似):条件近似满足时,误差 ≤ D + (ε+D)²
定理4(应用):线性可识别性 → 最优潜空间规划
```
**核心信息:** LeJEPA 在高斯世界中可证明地学到世界模型,且这个保证对近似条件优雅降级,并直接支持最优规划。
---
## ➡️ 返回总览
← [README:数学 Topic 导航](README.md)
← [论文完整笔记](../lejepa_world_model_notes.md)
+129
View File
@@ -0,0 +1,129 @@
# LeJEPA 数学证明分解导航
> 本目录将论文 *When Does LeJEPA Learn a World Model?* 的数学证明拆分为 6 个独立 topic,每个 topic 专注一个概念,循序渐进。
>
> **建议阅读顺序:** Topic 1 → 2 → 3 → 4 → 5 → 6
---
## 📚 Topic 列表
| # | 文件 | 核心概念 | 对应定理 | 难度 |
|---|------|---------|---------|------|
| 1 | [Hermite 多项式](01_hermite_polynomials.md) | 高斯分布下的函数分解工具 | 定理1基础 | ⭐⭐ |
| 2 | [OU 过程与 Mehler 公式](02_ou_process_mehler.md) | 正样本对生成 + 高阶衰减 | 定理1基础 | ⭐⭐ |
| 3 | [谱分解与线性可识别性](03_spectral_identifiability.md) | 定理1完整证明 | **定理 1** | ⭐⭐⭐ |
| 4 | [Sturm-Liouville 与高斯唯一性](04_sturm_liouville_uniqueness.md) | 为什么只有高斯分布有效 | **定理 2** | ⭐⭐⭐ |
| 5 | [近似可识别性界](05_approximate_identifiability.md) | 误差如何优雅降级 | **定理 3** | ⭐⭐ |
| 6 | [正交不变性与最优规划](06_planning_equivalence.md) | 潜空间规划等价于真实规划 | **定理 4** | ⭐⭐ |
---
## 🗺️ 知识依赖图
```
Topic 1: Hermite 多项式
Topic 2: OU 过程 + Mehler 公式
Topic 3: 谱分解 → 线性可识别性(定理1)
│ │
↓ ↓
Topic 4: 高斯唯一性 Topic 5: 近似界 Topic 6: 最优规划
(定理2) (定理3) (定理4)
```
---
## 🎯 四大定理速查
### 定理 1:线性可识别性(正向)
> 高斯世界 + LeJEPA 最优 → `h(z) = Qz`(正交矩阵)
**核心工具:** Hermite 谱分解 + OU 衰减 + 最优性条件
### 定理 2:高斯唯一性(逆向)
> 高斯分布是**唯一**使线性可识别性成立的分布
**核心工具:** Sturm-Liouville 特征值理论 + 得分函数分析
### 定理 3:近似可识别性
> 条件近似满足时,误差 `≤ D + (ε+D)²`,其中 `D = δ/(2ρ(1-ρ))`
**核心工具:** 三角不等式 + Procrustes 分析
### 定理 4:最优潜空间规划
> 线性可识别性 → O(n)-不变代价函数下的规划完全等价
**核心工具:** 正交不变性 + 轨迹推前
---
## 🔑 关键公式速查
### LeJEPA 训练目标
```
L(h) = λ · L_SIG + (1-λ) · L_align
L_align = E[‖h(z') - h(z)‖²] # 对齐损失
L_SIG = SIGReg(h(z), N(0,I)) # 高斯正则化
```
### OU 过程(正样本对生成)
```
z' = ρz + √(1-ρ²) η, η ~ N(0, I_n), ρ ∈ (0,1)
```
### Mehler 公式(核心不等式)
```
E[h_i(z') · h_i(z)] = Σ_d w_{i,d} · ρᵈ ≤ ρ
等号 ⟺ w_{i,1} = 1(纯线性)
```
### 近似界
```
E[‖h(z) - Qz‖²] ≤ D + (ε + D)²
D = δ / (2ρ(1-ρ))
δ = L_align - 2(1-ρ)n(对齐间隙)
ε = ‖Cov(h(z)) - I‖_F(白化误差)
```
---
## 🔧 代码对应关系
| 数学概念 | 代码实现 |
|---------|---------|
| SIGReg 正则化 | [`losses.py:SIGReg`](../lejepa-identifiability/experiments/lejepa_id/losses.py) |
| 对齐损失 | [`losses.py:alignment_loss`](../lejepa-identifiability/experiments/lejepa_id/losses.py) |
| OU 增强 | [`data.py:ou_augment`](../lejepa-identifiability/experiments/lejepa_id/data.py) |
| R²、正交误差、近似界 | [`metrics.py:compute_all_metrics`](../lejepa-identifiability/experiments/lejepa_id/metrics.py) |
| 训练循环 | [`engine.py:train_and_evaluate`](../lejepa-identifiability/experiments/lejepa_id/engine.py) |
---
## 🔬 Lean 4 形式化验证对应
| 定理 | Lean 文件 | 验证状态 |
|------|----------|---------|
| 定理1Hermite 路径) | [`lean/LeJEPA/Hermite.lean`](../lejepa-identifiability/lean/LeJEPA/Hermite.lean) | ✅ 零 sorry |
| 定理2(高斯唯一性) | [`lean/LeJEPA/Uniqueness.lean`](../lejepa-identifiability/lean/LeJEPA/Uniqueness.lean) | ✅ 零 sorry |
| 定理3(近似界) | [`lean/LeJEPA/Approx.lean`](../lejepa-identifiability/lean/LeJEPA/Approx.lean) | ✅ 零 sorry |
| 定理4(规划等价) | [`lean/LeJEPA/Planning.lean`](../lejepa-identifiability/lean/LeJEPA/Planning.lean) | ✅ 零 sorry |
| 附录EDirichlet 路径) | [`lean/LeJEPA/Dirichlet.lean`](../lejepa-identifiability/lean/LeJEPA/Dirichlet.lean) | ✅ 零 sorry |
---
## 💡 核心洞见(一句话总结)
> **LeJEPA 将经典 ICA 的叙事完全颠倒:** 在线性 ICA 中,高斯分布是源分离**失败**的唯一情况;在 LeJEPA 的非线性设置中,高斯分布恰恰是使线性可识别性**成立**的唯一分布。
---
## 📖 相关文件
- [论文完整笔记](../lejepa_world_model_notes.md) — 综合分析(含代码实现、官网图示)
- [资源汇总](../lejepa_resources.md) — 视频、论文、代码、HuggingFace 模型
- [代码仓库](../lejepa-identifiability/) — 本地 clone 的官方实现
Binary file not shown.