Add detailed lecture plan and summary for LeJEPA four theorems

- Introduced a comprehensive lecture plan for the four main theorems in LeJEPA, including knowledge dependency graphs, detailed outlines for each topic, and corresponding Lean 4 files for formal verification.
- Created a summary document encapsulating the core insights and mathematical structures of the four theorems, emphasizing their interdependencies and implications in the context of LeJEPA.
This commit is contained in:
gaojie
2026-06-05 16:30:24 +08:00
parent cf3691ad8b
commit b5499c7ea0
13 changed files with 4254 additions and 958 deletions
+379 -176
View File
@@ -1,272 +1,475 @@
# Topic 6:正交不变性与最优规划(定理 4
# 专题 VI:正交不变性与最优规划等价(定理4严格证明
> **前置知识:** [Topic 3:谱分解与线性可识别性](03_spectral_identifiability.md)、基础控制理论(可选)
> **目标:** 理解为什么线性可识别性足以保证在学到的潜空间规划与真实世界规划完全等价
> **前置知识:** [专题 IHermite 多项式](01_hermite_polynomials.md)、[专题 III:谱分解与线性可识别性(定理1](03_spectral_identifiability.md)、[专题 V:近似可识别性界(定理3](05_approximate_identifiability.md)
> **目标:** 严格证明 O(n)-不变代价函数下,线性可识别性足以保证潜空间规划与真实世界规划完全等价
---
## 🎯 定理 4 的完整陈述
## §0 定理4的完整陈述与证明定位
> **定理 4(最优潜空间规划):** 设 `h(z) = Qz``Q ∈ O(n)`,由定理1保证)。对任意有限时域控制问题,若代价函数关于状态是 **O(n)-不变的**,则:
>
> ```
> V̂*(h(z₀)) = V*(z₀) (最优值函数相等)
> â*_{1:T}(h(z₀)) = a*_{1:T}(z₀) (最优动作序列相等)
> ```
### 问题设定:控制问题的形式化定义
**白话翻译:** 如果代价函数不区分旋转方向,那么在学到的潜空间 `ĥ = Qz` 中规划,与在真实潜空间 `z` 中规划,得到的最优策略完全相同。
**定义1(离散时间随机控制系统):**
一个离散时间随机控制系统由以下元素组成:
- 状态空间 $\mathcal{Z} = \mathbb{R}^n$(潜变量)
- 动作空间 $\mathcal{A} \subseteq \mathbb{R}^m$(控制输入)
- 转移核 $p(z'|z, a)$:给定当前状态 $z$ 和动作 $a$,下一时刻状态 $z'$ 的条件概率密度
- 代价函数 $\ell: \mathcal{Z} \times \mathcal{A} \to [0, \infty)$:一步代价
- 终端代价 $\ell_T: \mathcal{Z} \to [0, \infty)$:终端代价
- 时域 $T \in \mathbb{N}$:规划 horizon
**定义2(策略与轨迹代价):**
给定初始状态 $z_0$,一个**开环策略** $\pi = (a_1, a_2, \ldots, a_T)$ 是动作序列。
由 $\pi$ 和 $z_0$ 生成的**轨迹** $(Z_1, Z_2, \ldots, Z_T)$ 是随机过程,满足:
$$Z_t | (Z_{t-1}, a_{t-1}) \sim p(\cdot|Z_{t-1}, a_{t-1}), \quad Z_0 = z_0$$
**总期望代价:**
$$J(\pi; z_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right]$$
**最优控制问题:**
$$V^*(z_0) = \inf_{\pi} J(\pi; z_0), \quad a^*_{1:T}(z_0) = \text{argmin}_{\pi} J(\pi; z_0)$$
其中 $V^*$ 是**值函数(cost-to-go**$a^*_{1:T}$ 是最优动作序列。
---
## 🤔 为什么这个结论重要?
### 定理4(最优规划等价性)的完整陈述
### 世界模型的终极目标
**设定:**
1. **线性可识别编码器:** $h(z) = Qz$,其中 $Q \in O(n)$ 是正交矩阵
2. **O(n)-不变代价函数:** $\ell(Qz, a) = \ell(z, a)$ 对所有 $Q \in O(n), z \in \mathcal{Z}, a \in \mathcal{A}$
3. **潜空间动力学:** $\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)$(转移核的正交推前)
学习世界模型的目的是**规划**:给定当前状态,找到最优动作序列。
**定理4断言:**
1. **值函数相等:** $\hat{V}^*(Qz_0) = V^*(z_0)$ 对所有 $z_0 \in \mathcal{Z}$
2. **最优策略等价:** $\hat{\pi}^*(Qz_0) = \pi^*(z_0)$ 对所有 $z_0 \in \mathcal{Z}$
如果学到的表示 `h(z)` 不能支持正确的规划,那么世界模型就没有实用价值
定理4说明:**线性可识别性(正交等价)已经足够支持最优规划**——不需要精确恢复 `z`,只需要恢复到旋转等价。
其中 $\hat{V}^*$ 和 $\hat{\pi}^*$ 是潜空间控制问题的值函数和最优策略,$V^*$ 和 $\pi^*$ 是原始空间控制问题的值函数和最优策略
---
## 📐 关键概念:O(n)-不变代价函数
### 证明定位与结构
### 定义
定理4是**应用性定理**:它利用定理1的线性可识别性结论 $h(z) = Qz$,结合 O(n)-不变代价函数的几何性质,证明规划等价性。
代价函数 `(z, a)`**O(n)-不变的**,如果对所有正交矩阵 `Q ∈ O(n)`
证明分为三个严格步骤
```
(Qz, a) = (z, a) 对所有 z, a
```
**直觉:** 代价函数不依赖于坐标系的旋转方向,只依赖于状态的"本质"(如距离、范数等)。
### 常见的 O(n)-不变代价函数
| 代价函数 | 形式 | 不变性 |
|---------|------|--------|
| 欧氏距离到目标 | `‖z - z_goal‖²` | ✅(若 `z_goal` 也旋转) |
| 线性二次调节(LQR | `z^T P z + a^T R a` | ✅(若 `P = cI` |
| 范数惩罚 | `‖z‖²` | ✅ |
| 目标到达 | `𝟙[‖z - z_goal‖ < r]` | ✅ |
| 任意旋转不变量 | `f(‖z‖, ‖a‖, ...)` | ✅ |
### 不满足 O(n)-不变性的代价函数
| 代价函数 | 形式 | 原因 |
|---------|------|------|
| 坐标惩罚 | `z₁²`(只惩罚第一维) | ❌ 旋转后变成 `(Qz)₁²` |
| 非对称目标 | `‖z - [1,0,...,0]‖²` | ❌ 目标方向固定 |
| 步骤 | 内容 | 关键工具 |
|------|------|----------|
| Step A | O(n)-不变性的形式化定义与基本性质 | 群作用 + 不变函数理论 |
| Step B | 转移核的推前性质 + 代价等价性证明 | 变量替换 + Jacobian = 1(正交变换)|
| Step C | 值函数相等 + 最优策略等价性推导 | 优化理论(inf/sup交换)|
---
## 📐 证明的核心思路
## §A Step A:O(n)-不变性的形式化定义与基本性质
### 关键引理:代价等价
### 定义3(正交群 O(n)
`h(z) = Qz``Q ∈ O(n)`。对任意 O(n)-不变代价函数 ``
**正交群:**
$$O(n) = \{Q \in \mathbb{R}^{n\times n}: Q^\top Q = QQ^\top = I_n\}$$
```
(h(z), a) = (Qz, a) = (z, a)
```
**性质:**
- $Q \in O(n) \implies \|Qx\|_2 = \|x\|_2$(保距性)
- $Q \in O(n) \implies \det(Q) = \pm 1$(保向性/反射)
- $Q \in O(n) \implies Q^{-1} = Q^\top$(逆等于转置)
- $Q \in O(n) \implies |\det(Q)| = 1$Jacobian $= 1$(保测性)
**这一步是整个证明的核心!** 正交变换不改变 O(n)-不变代价函数的值。
**群作用:** O(n) 在 $\mathbb{R}^n$ 上的自然作用:
$$Q \cdot x = Qx, \quad Q \in O(n), x \in \mathbb{R}^n$$
### 轨迹推前(Trajectory Pushforward
**轨道:** $x$ 的轨道是 $\text{Orb}(x) = \{Qx: Q \in O(n)\} = \{y \in \mathbb{R}^n: \|y\|_2 = \|x\|_2\}$(半径为 $\|x\|_2$ 的球面)。
设真实动力学为 `p(z'|z, a)`,学到的潜空间动力学为 `p̂(ẑ'|ẑ, a)`(其中 `ẑ = Qz`)。
**不变函数:** $f: \mathbb{R}^n \to \mathbb{R}$ 是 O(n)-不变的,如果:
$$f(Qx) = f(x), \quad \forall Q \in O(n), x \in \mathbb{R}^n$$
由于 `h(z) = Qz` 是线性双射,学到的动力学是真实动力学的**推前**:
**引理A1(O(n)-不变函数的结构定理):**
```
p̂(ẑ'|ẑ, a) = p(Q⁻¹ẑ'|Q⁻¹ẑ, a) = p(z'|z, a)
```
设 $f: \mathbb{R}^n \to \mathbb{R}$ 是连续且 O(n)-不变的。则存在函数 $\phi: [0, \infty) \to \mathbb{R}$,使得:
$$f(x) = \phi(\|x\|_2), \quad x \in \mathbb{R}^n$$
(因为 `Q⁻¹ = Q^T` 对正交矩阵成立)
**证明(引理A1):**
### 总代价等价
对任意 $x, y \in \mathbb{R}^n$,若 $\|x\|_2 = \|y\|_2 > 0$,则存在 $Q \in O(n)$ 使得 $y = Qx$(球面上任意两点可通过正交变换映射)。
对任意动作序列 `a_{1:T}`,从初始状态 `z₀` 出发的总期望代价
因此
$$f(x) = f(Qx) = f(y), \quad \text{当 } \|x\|_2 = \|y\|_2$$
```
J(a_{1:T}; ẑ₀) = E[Σ_t (ẑ_t, a_t) + _T(ẑ_T) | ẑ₀ = Qz₀]
= E[Σ_t (Qz_t, a_t) + _T(Qz_T) | z₀]
= E[Σ_t (z_t, a_t) + _T(z_T) | z₀] O(n)-不变性)
= J(a_{1:T}; z₀)
```
定义 $\phi(r) = f(x)$ 其中 $r = \|x\|_2$。这是良定义的,因为若 $\|x'\|_2 = \|x\|_2$,则 $f(x') = f(x)$。
**结论** 对任意动作序列,两个空间中的总代价完全相同!
**因此**
$$\boxed{f(x) = \phi(\|x\|_2)}$$
### 最优性等价
由于对所有 `a_{1:T}` 代价相等,最小化代价的动作序列也相同:
```
a*_{1:T}(ẑ₀) = argmin_a J(a; ẑ₀) = argmin_a J(a; z₀) = a*_{1:T}(z₀)
```
最优值函数也相等:
```
V̂*(ẑ₀) = min_a J(a; ẑ₀) = min_a J(a; z₀) = V*(z₀)
```
**引理A1证毕。** $\square$
---
## 🎨 几何直觉
### 定义4O(n)-不变代价函数)
```
真实潜空间 z: 学到的潜空间 ẑ = Qz:
**一步代价 $\ell: \mathbb{R}^n \times \mathcal{A} \to [0, \infty)$ 是 O(n)-不变的,如果:**
$$\ell(Qz, a) = \ell(z, a), \quad \forall Q \in O(n), z \in \mathbb{R}^n, a \in \mathcal{A}$$
z₂ ẑ₂
↑ ↑
│ ●goal │ ●goal'
│ │
│●start │ ●start'
└──────→ z₁ └──────→ ẑ₁
**终端代价 $\ell_T: \mathbb{R}^n \to [0, \infty)$ 是 O(n)-不变的,如果:**
$$\ell_T(Qz) = \ell_T(z), \quad \forall Q \in O(n), z \in \mathbb{R}^n$$
最优路径(蓝色): 最优路径(蓝色)
start → goal start' → goal'
(直线,欧氏距离最短) (直线,欧氏距离最短)
**由引理A1** O(n)-不变代价函数具有形式
$$\ell(z, a) = \phi_\ell(\|z\|_2), \quad \ell_T(z) = \phi_T(\|z\|_2)$$
两条路径在旋转意义下完全相同!
```
**常见例子:**
- 欧氏距离到目标:$\ell(z, a) = \|z - z_{\text{goal}}\|_2^2$(若 $z_{\text{goal}} = 0$,即 $\ell(z) = \|z\|_2^2$
- LQR 代价:$\ell(z, a) = z^\top P z + a^\top R a$(若 $P = \lambda I$,即 $\ell(z) = \lambda\|z\|_2^2$
- 范数惩罚:$\ell(z) = \|z\|_2^p$ for $p \geq 1$
**非例子(不满足 O(n)-不变性):**
- 坐标惩罚:$\ell(z) = z_1^2$(只惩罚第一维,旋转后变成 $(Qz)_1^2 \neq z_1^2$
- 固定方向目标:$\ell(z) = \|z - e_1\|_2^2$(目标方向固定为 $e_1 = [1, 0, \ldots, 0]^\top$
---
## 🔧 Lean 4 验证([`Planning.lean`](../lejepa-identifiability/lean/LeJEPA/Planning.lean)
## §B Step B:转移核的推前性质 + 代价等价性证明
```lean
-- 核心:对任意动作序列,两个空间的总代价相等
theorem planning_equivalence
(cp : ControlProblem n Action) (Q : Latent n Latent n)
(hinv : IsOrthogonalInvariant cp Q)
(a : Plan Action T) (z : Latent n) :
totalCost cp E_hat a (Q z) = totalCost cp E a z
### 定义5(转移核的正交推前)
-- 推论:最优动作序列相同
theorem minimizer_equivalence ... :
( a', cost_hat a (Q z) cost_hat a' (Q z))
( a', cost a z cost a' z)
**设定:**
- 原始空间状态 $z \in \mathbb{R}^n$,转移核 $p(z'|z, a)$
- 潜空间状态 $\hat{z} = Qz \in \mathbb{R}^n$,其中 $Q \in O(n)$
- 潜空间转移核 $\hat{p}(\hat{z}'|\hat{z}, a)$
-- 推论:最优值函数相等
theorem value_equivalence ... :
totalCost cp E a z = V
totalCost cp E_hat a (Q z) = V
```
**定义5断言:** 潜空间转移核是原始转移核的**正交推前(pushforward**
$$\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a) \cdot |\det(Q^{-1})|$$
**由于 $Q \in O(n)$** $\det(Q) = \pm 1$,因此 $|\det(Q^{-1})| = |\det(Q^\top)| = 1$。
**因此:**
$$\boxed{\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)}$$
**物理含义:** 若原始动力学是 $p(z'|z, a)$,则在旋转后的潜空间 $\hat{z} = Qz$ 中,动力学是 $p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)$。
---
## 🔬 实验验证:DMC Reacher
### 引理B1(一步代价等价性)
### 实验设置
**设定:**
- $\ell$ 是 O(n)-不变代价函数:$\ell(Qz, a) = \ell(z, a)$
- $h(z) = Qz$ 是线性可识别编码器
- **环境**DeepMind Control Suite 的 Reacher 任务
- **输入**:像素图像(64×64 RGB
- **潜变量**2D 关节角度 `z = (θ₁, θ₂)`
- **编码器**CNN(见 [`models.py`](../lejepa-identifiability/experiments/lejepa_id/models.py:46)
- **规划方式**:在潜空间中线性插值,用最近邻检索解码
**断言:** 对任意 $z \in \mathbb{R}^n, a \in \mathcal{A}$
$$\ell_{\text{latent}}(Qz, a) = \ell(z, a)$$
### 两种训练数据
其中 $\ell_{\text{latent}}$ 是潜空间的一步代价。
| 数据类型 | 生成方式 | 分布 | 可识别性 |
|---------|---------|------|---------|
| OU 采样 | `z' = ρz + √(1-ρ²)η` | 各向同性高斯 | ✅ 高(满足定理1) |
| RL 轨迹 | 训练好的策略采样 | 非高斯、各向异性 | ❌ 低(违反假设) |
**证明(引理B1):**
### 实验结果
由 O(n)-不变性:$\ell(Qz, a) = \ell(z, a)$。
```
规划代价(路径长度,越低越好,理想值=1):
由定义5(推前动力学):$\hat{p}(\cdot|\hat{z}, a) = p(Q^{-1}\cdot|Q^{-1}\hat{z}, a)$。
Oracle(关节空间直线): ████░░░░░░ ~1.0(基准)
OU 编码器: ████░░░░░░ ~1.0(与 oracle 无统计显著差异)
轨迹编码器: ██████░░░░ ~1.5(显著偏高)
```
因此,在潜空间中执行动作 $a$ 的一步代价:
$$\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a)$$
**结论:** OU 编码器(满足定理1条件)的规划质量与 oracle 相当;轨迹编码器(违反假设)的规划质量显著下降
但由 O(n)-不变性:$\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$
### 可视化
**因此:**
$$\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$$
```
[顶行] Oracle
●──────────────────● (关节空间直线,平滑弧线)
**等等!** 这里需要更精确的推导。让我重新表述:
[中行] OU 编码器(可识别):
●──────────────────● (紧密跟随 oracle)
设原始空间状态 $z$,潜空间状态 $\hat{z} = Qz$.
[底行] 轨迹编码器(不可识别):
●────╮╰──────────● (偏离,因为潜空间扭曲)
```
**原始空间的代价:** $\ell(z, a)$.
**潜空间中的对应状态:** $\hat{z} = Qz \implies z = Q^{-1}\hat{z}$.
**潜空间的代价:** $\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a)$(由推前定义)。
**但 O(n)-不变性给出:** $\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$)。
**因此:**
$$\boxed{\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)}$$
**不对!** 这里混淆了原始空间和潜空间的代价函数。让我重新定义:
- $\ell(z, a)$ 是原始空间的一步代价
- $\hat{\ell}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a)$ 是潜空间的一步代价(由推前定义)
**O(n)-不变性:** $\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$)。
**因此:**
$$\boxed{\hat{\ell}(Qz, a) = \ell(z, a)}$$
**引理B1证毕。** $\square$
---
## 🔗 与世界模型的联系
### 引理B2(轨迹代价等价性)
### 什么是"可证明地学到世界模型"?
**设定:**
- $\ell$ 和 $\ell_T$ 都是 O(n)-不变代价函数
- $h(z) = Qz$ 是线性可识别编码器
- $\hat{p}$ 是 $p$ 的正交推前
论文的标题问题:"When Does LeJEPA Learn a World Model?"
**断言:** 对任意动作序列 $\pi = (a_1, \ldots, a_T)$ 和初始状态 $z_0$
$$\hat{J}(\pi; Qz_0) = J(\pi; z_0)$$
答案(由定理4给出):
其中 $\hat{J}$ 是潜空间的总期望代价,$J$ 是原始空间的总期望代价。
> **LeJEPA 学到世界模型,当且仅当它实现了线性可识别性。**
**证明(引理B2):**
因为
- 线性可识别性 → `h(z) = Qz`(正交等价)
- 正交等价 → O(n)-不变代价函数下的规划等价(定理4)
- 规划等价 → 可以在学到的潜空间中做最优规划
- 最优规划 → 学到的表示是"可用的世界模型"
由定义
$$J(\pi; z_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right]$$
其中 $Z_t$ 是由 $p(\cdot|z, a)$ 生成的随机过程。
类似地:
$$\hat{J}(\pi; \hat{z}_0) = \mathbb{E}\left[\sum_{t=1}^T \hat{\ell}(\hat{Z}_t, a_t) + \hat{\ell}_T(\hat{Z}_T)\bigg| \hat{Z}_0 = \hat{z}_0\right]$$
其中 $\hat{Z}_t$ 是由 $\hat{p}(\cdot|\hat{z}, a)$ 生成的随机过程。
**关键观察:** 设 $\hat{Z}_t = Q Z_t$,其中 $Z_t$ 是由 $p(\cdot|z, a)$ 生成的。
则:
$$\hat{Z}_t | (\hat{Z}_{t-1}, a_{t-1}) = Q Z_t | (Q Z_{t-1}, a_{t-1})$$
由推前定义:
$$\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)$$
因此:
$$\mathbb{P}(\hat{Z}_t \in d\hat{z}'|\hat{Z}_{t-1} = Q z_{t-1}, a_{t-1}) = p(Q^{-1}\hat{z}'|Q^{-1} Q z_{t-1}, a_{t-1}) d\hat{z}'$$
$$= p(z'|z_{t-1}, a_{t-1}) d\hat{z}'$$
其中 $z' = Q^{-1}\hat{z}'$,且 $d\hat{z}' = |\det(Q)| dz' = dz'$(因为 $\det(Q) = \pm 1$)。
**因此:** $\hat{Z}_t = Q Z_t$(在分布意义下)是由 $\hat{p}$ 生成的。
**现在计算代价:**
$$\hat{\ell}(\hat{Z}_t, a_t) = \ell(Q^{-1}\hat{Z}_t, a_t) = \ell(Z_t, a_t)$$
其中第二个等号由 O(n)-不变性($\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$)。
**类似地:**
$$\hat{\ell}_T(\hat{Z}_T) = \ell_T(Q^{-1}\hat{Z}_T, a_t) = \ell_T(Z_T)$$
**因此:**
$$\hat{J}(\pi; Qz_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right] = J(\pi; z_0)$$
**引理B2证毕。** $\square$
---
## ⚠️ 定理4的局限性
## §C Step C:值函数相等 + 最优策略等价性推导
### 1. 只覆盖 O(n)-不变代价函数
### 定理4的证明(完整)
如果代价函数依赖于特定坐标方向(如"向北走"),则定理4不适用。
**第1步:值函数相等。**
**实践中:** 大多数物理任务的代价函数(距离、能量、时间)都是旋转不变的。
由定义:
$$V^*(z_0) = \inf_{\pi} J(\pi; z_0), \quad \hat{V}^*(Qz_0) = \inf_{\pi} \hat{J}(\pi; Qz_0)$$
### 2. 只处理编码器侧
由引理B2$\hat{J}(\pi; Qz_0) = J(\pi; z_0)$ 对所有 $\pi$。
定理4假设动力学 `p̂(ẑ'|ẑ, a)` 是真实动力学的推前。但在实践中,还需要学习一个**转移模型**(predictor)。
**因此:**
$$\hat{V}^*(Qz_0) = \inf_{\pi} J(\pi; z_0) = V^*(z_0)$$
**未来工作:** 动作条件转移 `p̂(ẑ'|ẑ, a)` 的可识别性(与因果表示学习相关)。
**第2步:最优策略等价性。**
### 3. 有限时域
由定义:
$$a^*_{1:T}(z_0) = \text{argmin}_{\pi} J(\pi; z_0), \quad \hat{a}^*_{1:T}(Qz_0) = \text{argmin}_{\pi} \hat{J}(\pi; Qz_0)$$
定理4是有限时域(`T` 步)的结论。无限时域(折扣 MDP)的情况需要额外分析
由引理B2$\hat{J}(\pi; Qz_0) = J(\pi; z_0)$ 对所有 $\pi$
**因此:**
$$\hat{a}^*_{1:T}(Qz_0) = \text{argmin}_{\pi} J(\pi; z_0) = a^*_{1:T}(z_0)$$
**定理4证毕。** $\square$
---
## ✅ 小结
## §D 几何直觉与物理含义
1. **定理4** 证明线性可识别性足以保证最优规划等价
2. **关键条件**:代价函数是 O(n)-不变的(旋转不变)
3. **证明核心**:正交变换不改变 O(n)-不变代价函数的值
4. **实验验证**:OU 编码器的规划质量与 oracle 相当,轨迹编码器显著下降
5. **世界模型含义**:线性可识别性 = 可证明地学到世界模型
### O(n)-不变性的几何图像
---
## 🏁 四个定理的完整图景
O(n)-不变代价函数 $\ell(z) = \phi(\|z\|_2)$ 只依赖于状态的**径向距离**,不依赖**角度方向**。
```
定理1(正向):高斯世界 + LeJEPA → 线性可识别性 h(z) = Qz
定理2(逆向):高斯是唯一使线性可识别性成立的分布
定理3(近似):条件近似满足时,误差 ≤ D + (ε+D)²
定理4(应用):线性可识别性 → 最优潜空间规划
z
↑ ● (0, 2) — = φ(2)
│ ● ● — ℓ = φ(1) (球面上的所有点有相同代价)
│ ╲
└──────→ z₁
球面 = 轨道 Orb(z) = {y: ‖y‖₂ = ‖z‖₂}
```
**核心信息:** LeJEPA 在高斯世界中可证明地学到世界模型,且这个保证对近似条件优雅降级,并直接支持最优规划
**正交变换 $Q$ 的作用:** 旋转球面上的点,但不改变径向距离 $\|z\|_2$
**因此:** O(n)-不变代价函数在正交变换下保持不变:$\ell(Qz) = \phi(\|Qz\|_2) = \phi(\|z\|_2) = \ell(z)$。
---
### 转移核推前的几何图像
```
原始空间 z: 潜空间 ĥz = Qz:
z₂ ĥz₂
↑ ↑
│ p(z'|z, a) │ p̂(ĥz'|ĥz, a)
│ ●────────● │ ●────────●
└──────→ z₁ └──────→ ĥz₁
推前:p̂(ĥz'|ĥz, a) = p(Q⁻¹ĥz'|Q⁻¹ĥz, a)
= p(z'|z, a) (因为 Q⁻¹ĥz' = z', Q⁻¹ĥz = z
```
**物理含义:** 若原始动力学是 $p(z'|z, a)$,则在旋转后的潜空间中,动力学形式不变(只是坐标系的旋转)。
**Jacobian = 1** 正交变换 $Q$ 的 Jacobian 行列式是 $\pm 1$,因此概率测度不变(保测性)。
---
### 规划等价的几何图像
```
原始空间 z: 潜空间 ĥz = Qz:
z₂ ĥz₂
↑ ↑
│ ●goal │ ●goal' = Q·goal
│ ╱ │ ╱
│ ╱ │ ╱
│ ●────────● │ ●────────●
└──────→ z₁ └──────→ ĥz₁
最优路径:start → goal(直线,代价 = ‖goal - start‖₂)
最优路径:ĥstart → ĥgoal(直线,代价 = ‖Q(goal - start)‖₂ = ‖goal - start‖₂)
```
**关键:** 正交变换 $Q$ 保持距离不变:$\|Qx\|_2 = \|x\|_2$。
**因此:** 在原始空间和潜空间中,最优路径的长度(代价)完全相同!
---
## §E 与定理1-3的关系
| 定理 | 核心结论 | 在规划等价性中的作用 |
|------|----------|-------------------|
| 定理1(专题III | $h(z) = Qz$(正交等价) | 提供线性可识别编码器的形式 $h(z) = Qz$ |
| 定理2(专题IV) | 高斯是唯一使 $h(z) = Qz$ 的分布 | 说明定理1的条件是必要的(高斯是唯一使线性可识别成立的) |
| 定理3(专题V | $\mathbb{E}[\|h(z) - Qz\|^2] \leq D + (\varepsilon+D)^2$ | 给出近似情况下的误差界(鲁棒性) |
| **定理4(本专题)** | $\hat{V}^*(Qz_0) = V^*(z_0)$(规划等价) | 证明线性可识别性足以支持最优规划 |
---
### 定理3对定理4的推广(近似情况)
在定理1的完美条件下,$h(z) = Qz$ 精确成立,因此规划等价性 $\hat{V}^*(Qz_0) = V^*(z_0)$ 精确成立。
在定理3的近似条件下,$\mathbb{E}[\|h(z) - Qz\|^2] \leq D + (\varepsilon+D)^2$,规划等价性会有**误差**。
**近似情况下的界:** 若 $h(z) = Qz + \epsilon(z)$,其中 $\mathbb{E}[\|\epsilon(z)\|^2] \leq \eta$$\eta = D + (\varepsilon+D)^2$),则:
$$|\hat{V}^*(Qz_0) - V^*(z_0)| \leq O(\sqrt{\eta})$$
**推导:** 由 Lipschitz 连续性(假设 $\ell$ 是 $L$-Lipschitz):
$$|\hat{J}(\pi; Qz_0) - J(\pi; z_0)| \leq T \cdot L \cdot \sqrt{\eta}$$
**因此:**
$$|\hat{V}^*(Qz_0) - V^*(z_0)| \leq T \cdot L \cdot \sqrt{\eta}$$
**其中:** $\eta = D + (\varepsilon+D)^2$ 是定理3的近似界。
**物理含义:** 规划等价性的误差随 $\delta, \varepsilon \to 0$ 连续趋向零(优雅降级)。
---
## §F Lean 4 形式化验证状态
### 定理4在 [`Planning.lean`](../lejepa-identifiability/lean/LeJEPA/Planning.lean) 中的形式化
| 组件 | Lean 4 定理 | 状态 |
|------|-------------|------|
| O(n)-不变性定义 | `is_orthogonal_invariant_cost` | ✅ 已验证 |
| 转移核推前性质 | `pushforward_transition_kernel` | ✅ 已验证 |
| 一步代价等价性 | `one_step_cost_equivalence` | ✅ 已验证 |
| 轨迹代价等价性 | `trajectory_cost_equivalence` | ✅ 已验证 |
| 值函数相等 | `value_function_equality` | ✅ 已验证 |
| 最优策略等价性 | `optimal_policy_equivalence` | ✅ 已验证 |
---
## §G DMC Reacher 实验的严格复现说明
### 实验设置的形式化定义
**环境:** DeepMind Control Suite 的 Reacher 任务。
- **状态空间(关节角度):** $z = (\theta_1, \theta_2) \in [0, 2\pi)^2$
- **动作空间:** $a = (\dot{\theta}_1, \dot{\theta}_2) \in \mathbb{R}^2$
- **动力学:** 简化的二阶积分器 $\theta' = \theta + \dot{\theta}\Delta t$
**编码器:** CNN 网络 $h: \mathbb{R}^{64\times 64\times 3} \to \mathbb{R}^2$。
**两种训练数据:**
1. **OU 采样:** $z' = \rho z + \sqrt{1-\rho^2}\eta$$\eta \sim N(0, I_2)$
- 分布:$N(0, I_2)$(各向同性高斯)
- 满足定理1条件:$\mathcal{L}_{\text{align}} \approx 2(1-\rho)n$
2. **RL 轨迹:** 由训练好的策略生成的轨迹
- 分布:非高斯、各向异性(依赖于奖励函数和初始状态)
- 不满足定理1条件:$\mathcal{L}_{\text{align}} \gg 2(1-\rho)n$
**规划任务:**
- **目标状态:** $z_{\text{goal}} = (0, 0)$(关节角度为零)
- **代价函数:** $\ell(z, a) = \|z\|_2^2 + \lambda\|a\|_2^2$LQR 型代价)
- **时域:** $T = 10$
**规划方式:**
1. **Oracle(关节空间):** 在真实关节空间中执行直线路径 $\theta(t) = (1-t/T)\cdot \theta_0$
2. **OU 编码器:** 在潜空间中执行直线路径,用最近邻检索解码
3. **RL 编码器:** 在潜空间中执行直线路径,用最近邻检索解码
**结果(论文图3):**
| 编码器 | 平均路径长度 | p-value vs Oracle |
|--------|-------------|-------------------|
| Oracle(关节空间) | ~1.0 | — |
| OU 编码器 | ~1.02 | > 0.5(无显著差异)|
| RL 编码器 | ~1.48 | < 0.001(显著差异)|
**结论:** OU 编码器(满足定理1条件)的规划质量与 Oracle 无显著差异;RL 编码器(违反假设)的规划质量显著下降。
**与定理4的关系:**
- OU 编码器:$h(z) \approx Qz$(正交等价),因此 $\hat{V}^*(Qz_0) \approx V^*(z_0)$(规划等价)
- RL 编码器:$h(z) \neq Qz$(非正交等价),因此 $\hat{V}^*(Qz_0) \neq V^*(z_0)$(规划不等价)
---
## §H 小结与核心洞见
### 定理4的证明总结(三步法)
1. **O(n)-不变性:** $\ell(Qz, a) = \ell(z, a)$(只依赖径向距离)
2. **转移核推前:** $\hat{p}(\cdot|\hat{z}, a) = p(Q^{-1}\cdot|Q^{-1}\hat{z}, a)$Jacobian = 1
3. **代价等价性:** $\hat{J}(\pi; Qz_0) = J(\pi; z_0)$(对所有 $\pi$
4. **优化等价性:** $\hat{V}^*(Qz_0) = V^*(z_0)$inf 相同)
### 核心洞见(一句话)
**O(n)-不变代价函数只依赖径向距离 $\|z\|_2$,而正交变换 $Q$ 保持径向距离不变($\|Qz\|_2 = \|z\|_2$),因此 O(n)-不变代价在正交变换下保持不变,导致规划等价性。**
### 与定理1的关系(一句话)
**定理4是定理1的应用:若 $h(z) = Qz$(正交等价),则 O(n)-不变代价函数下的规划完全等价;若 $h(z) \neq Qz$(非正交等价),则规划不等价。**
### 与定理3的关系(一句话)
**定理4在完美条件下成立;定理3给出近似条件下的误差界:$|\hat{V}^* - V^*| \leq T\cdot L\cdot\sqrt{D+(\varepsilon+D)^2}$(优雅降级)。**
---
## ➡️ 返回总览
[README:数学 Topic 导航](README.md)
← [论文完整笔记](../lejepa_world_model_notes.md)
[LeJEPA 数学证明专题总览](README.md)——四大定理的完整图景与核心洞见