b5499c7ea0
- Introduced a comprehensive lecture plan for the four main theorems in LeJEPA, including knowledge dependency graphs, detailed outlines for each topic, and corresponding Lean 4 files for formal verification. - Created a summary document encapsulating the core insights and mathematical structures of the four theorems, emphasizing their interdependencies and implications in the context of LeJEPA.
476 lines
19 KiB
Markdown
476 lines
19 KiB
Markdown
# 专题 VI:正交不变性与最优规划等价(定理4严格证明)
|
||
|
||
> **前置知识:** [专题 I:Hermite 多项式](01_hermite_polynomials.md)、[专题 III:谱分解与线性可识别性(定理1)](03_spectral_identifiability.md)、[专题 V:近似可识别性界(定理3)](05_approximate_identifiability.md)
|
||
> **目标:** 严格证明 O(n)-不变代价函数下,线性可识别性足以保证潜空间规划与真实世界规划的完全等价
|
||
|
||
---
|
||
|
||
## §0 定理4的完整陈述与证明定位
|
||
|
||
### 问题设定:控制问题的形式化定义
|
||
|
||
**定义1(离散时间随机控制系统):**
|
||
|
||
一个离散时间随机控制系统由以下元素组成:
|
||
- 状态空间 $\mathcal{Z} = \mathbb{R}^n$(潜变量)
|
||
- 动作空间 $\mathcal{A} \subseteq \mathbb{R}^m$(控制输入)
|
||
- 转移核 $p(z'|z, a)$:给定当前状态 $z$ 和动作 $a$,下一时刻状态 $z'$ 的条件概率密度
|
||
- 代价函数 $\ell: \mathcal{Z} \times \mathcal{A} \to [0, \infty)$:一步代价
|
||
- 终端代价 $\ell_T: \mathcal{Z} \to [0, \infty)$:终端代价
|
||
- 时域 $T \in \mathbb{N}$:规划 horizon
|
||
|
||
**定义2(策略与轨迹代价):**
|
||
|
||
给定初始状态 $z_0$,一个**开环策略** $\pi = (a_1, a_2, \ldots, a_T)$ 是动作序列。
|
||
|
||
由 $\pi$ 和 $z_0$ 生成的**轨迹** $(Z_1, Z_2, \ldots, Z_T)$ 是随机过程,满足:
|
||
$$Z_t | (Z_{t-1}, a_{t-1}) \sim p(\cdot|Z_{t-1}, a_{t-1}), \quad Z_0 = z_0$$
|
||
|
||
**总期望代价:**
|
||
$$J(\pi; z_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right]$$
|
||
|
||
**最优控制问题:**
|
||
$$V^*(z_0) = \inf_{\pi} J(\pi; z_0), \quad a^*_{1:T}(z_0) = \text{argmin}_{\pi} J(\pi; z_0)$$
|
||
|
||
其中 $V^*$ 是**值函数(cost-to-go)**,$a^*_{1:T}$ 是最优动作序列。
|
||
|
||
---
|
||
|
||
### 定理4(最优规划等价性)的完整陈述
|
||
|
||
**设定:**
|
||
1. **线性可识别编码器:** $h(z) = Qz$,其中 $Q \in O(n)$ 是正交矩阵
|
||
2. **O(n)-不变代价函数:** $\ell(Qz, a) = \ell(z, a)$ 对所有 $Q \in O(n), z \in \mathcal{Z}, a \in \mathcal{A}$
|
||
3. **潜空间动力学:** $\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)$(转移核的正交推前)
|
||
|
||
**定理4断言:**
|
||
1. **值函数相等:** $\hat{V}^*(Qz_0) = V^*(z_0)$ 对所有 $z_0 \in \mathcal{Z}$
|
||
2. **最优策略等价:** $\hat{\pi}^*(Qz_0) = \pi^*(z_0)$ 对所有 $z_0 \in \mathcal{Z}$
|
||
|
||
其中 $\hat{V}^*$ 和 $\hat{\pi}^*$ 是潜空间控制问题的值函数和最优策略,$V^*$ 和 $\pi^*$ 是原始空间控制问题的值函数和最优策略。
|
||
|
||
---
|
||
|
||
### 证明定位与结构
|
||
|
||
定理4是**应用性定理**:它利用定理1的线性可识别性结论 $h(z) = Qz$,结合 O(n)-不变代价函数的几何性质,证明规划等价性。
|
||
|
||
证明分为三个严格步骤:
|
||
|
||
| 步骤 | 内容 | 关键工具 |
|
||
|------|------|----------|
|
||
| Step A | O(n)-不变性的形式化定义与基本性质 | 群作用 + 不变函数理论 |
|
||
| Step B | 转移核的推前性质 + 代价等价性证明 | 变量替换 + Jacobian = 1(正交变换)|
|
||
| Step C | 值函数相等 + 最优策略等价性推导 | 优化理论(inf/sup交换)|
|
||
|
||
---
|
||
|
||
## §A Step A:O(n)-不变性的形式化定义与基本性质
|
||
|
||
### 定义3(正交群 O(n))
|
||
|
||
**正交群:**
|
||
$$O(n) = \{Q \in \mathbb{R}^{n\times n}: Q^\top Q = QQ^\top = I_n\}$$
|
||
|
||
**性质:**
|
||
- $Q \in O(n) \implies \|Qx\|_2 = \|x\|_2$(保距性)
|
||
- $Q \in O(n) \implies \det(Q) = \pm 1$(保向性/反射)
|
||
- $Q \in O(n) \implies Q^{-1} = Q^\top$(逆等于转置)
|
||
- $Q \in O(n) \implies |\det(Q)| = 1$,Jacobian $= 1$(保测性)
|
||
|
||
**群作用:** O(n) 在 $\mathbb{R}^n$ 上的自然作用:
|
||
$$Q \cdot x = Qx, \quad Q \in O(n), x \in \mathbb{R}^n$$
|
||
|
||
**轨道:** $x$ 的轨道是 $\text{Orb}(x) = \{Qx: Q \in O(n)\} = \{y \in \mathbb{R}^n: \|y\|_2 = \|x\|_2\}$(半径为 $\|x\|_2$ 的球面)。
|
||
|
||
**不变函数:** $f: \mathbb{R}^n \to \mathbb{R}$ 是 O(n)-不变的,如果:
|
||
$$f(Qx) = f(x), \quad \forall Q \in O(n), x \in \mathbb{R}^n$$
|
||
|
||
**引理A1(O(n)-不变函数的结构定理):**
|
||
|
||
设 $f: \mathbb{R}^n \to \mathbb{R}$ 是连续且 O(n)-不变的。则存在函数 $\phi: [0, \infty) \to \mathbb{R}$,使得:
|
||
$$f(x) = \phi(\|x\|_2), \quad x \in \mathbb{R}^n$$
|
||
|
||
**证明(引理A1):**
|
||
|
||
对任意 $x, y \in \mathbb{R}^n$,若 $\|x\|_2 = \|y\|_2 > 0$,则存在 $Q \in O(n)$ 使得 $y = Qx$(球面上任意两点可通过正交变换映射)。
|
||
|
||
因此:
|
||
$$f(x) = f(Qx) = f(y), \quad \text{当 } \|x\|_2 = \|y\|_2$$
|
||
|
||
定义 $\phi(r) = f(x)$ 其中 $r = \|x\|_2$。这是良定义的,因为若 $\|x'\|_2 = \|x\|_2$,则 $f(x') = f(x)$。
|
||
|
||
**因此:**
|
||
$$\boxed{f(x) = \phi(\|x\|_2)}$$
|
||
|
||
**引理A1证毕。** $\square$
|
||
|
||
---
|
||
|
||
### 定义4(O(n)-不变代价函数)
|
||
|
||
**一步代价 $\ell: \mathbb{R}^n \times \mathcal{A} \to [0, \infty)$ 是 O(n)-不变的,如果:**
|
||
$$\ell(Qz, a) = \ell(z, a), \quad \forall Q \in O(n), z \in \mathbb{R}^n, a \in \mathcal{A}$$
|
||
|
||
**终端代价 $\ell_T: \mathbb{R}^n \to [0, \infty)$ 是 O(n)-不变的,如果:**
|
||
$$\ell_T(Qz) = \ell_T(z), \quad \forall Q \in O(n), z \in \mathbb{R}^n$$
|
||
|
||
**由引理A1:** O(n)-不变代价函数具有形式:
|
||
$$\ell(z, a) = \phi_\ell(\|z\|_2), \quad \ell_T(z) = \phi_T(\|z\|_2)$$
|
||
|
||
**常见例子:**
|
||
- 欧氏距离到目标:$\ell(z, a) = \|z - z_{\text{goal}}\|_2^2$(若 $z_{\text{goal}} = 0$,即 $\ell(z) = \|z\|_2^2$)
|
||
- LQR 代价:$\ell(z, a) = z^\top P z + a^\top R a$(若 $P = \lambda I$,即 $\ell(z) = \lambda\|z\|_2^2$)
|
||
- 范数惩罚:$\ell(z) = \|z\|_2^p$ for $p \geq 1$
|
||
|
||
**非例子(不满足 O(n)-不变性):**
|
||
- 坐标惩罚:$\ell(z) = z_1^2$(只惩罚第一维,旋转后变成 $(Qz)_1^2 \neq z_1^2$)
|
||
- 固定方向目标:$\ell(z) = \|z - e_1\|_2^2$(目标方向固定为 $e_1 = [1, 0, \ldots, 0]^\top$)
|
||
|
||
---
|
||
|
||
## §B Step B:转移核的推前性质 + 代价等价性证明
|
||
|
||
### 定义5(转移核的正交推前)
|
||
|
||
**设定:**
|
||
- 原始空间状态 $z \in \mathbb{R}^n$,转移核 $p(z'|z, a)$
|
||
- 潜空间状态 $\hat{z} = Qz \in \mathbb{R}^n$,其中 $Q \in O(n)$
|
||
- 潜空间转移核 $\hat{p}(\hat{z}'|\hat{z}, a)$
|
||
|
||
**定义5断言:** 潜空间转移核是原始转移核的**正交推前(pushforward)**:
|
||
$$\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a) \cdot |\det(Q^{-1})|$$
|
||
|
||
**由于 $Q \in O(n)$:** $\det(Q) = \pm 1$,因此 $|\det(Q^{-1})| = |\det(Q^\top)| = 1$。
|
||
|
||
**因此:**
|
||
$$\boxed{\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)}$$
|
||
|
||
**物理含义:** 若原始动力学是 $p(z'|z, a)$,则在旋转后的潜空间 $\hat{z} = Qz$ 中,动力学是 $p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)$。
|
||
|
||
---
|
||
|
||
### 引理B1(一步代价等价性)
|
||
|
||
**设定:**
|
||
- $\ell$ 是 O(n)-不变代价函数:$\ell(Qz, a) = \ell(z, a)$
|
||
- $h(z) = Qz$ 是线性可识别编码器
|
||
|
||
**断言:** 对任意 $z \in \mathbb{R}^n, a \in \mathcal{A}$:
|
||
$$\ell_{\text{latent}}(Qz, a) = \ell(z, a)$$
|
||
|
||
其中 $\ell_{\text{latent}}$ 是潜空间的一步代价。
|
||
|
||
**证明(引理B1):**
|
||
|
||
由 O(n)-不变性:$\ell(Qz, a) = \ell(z, a)$。
|
||
|
||
由定义5(推前动力学):$\hat{p}(\cdot|\hat{z}, a) = p(Q^{-1}\cdot|Q^{-1}\hat{z}, a)$。
|
||
|
||
因此,在潜空间中执行动作 $a$ 的一步代价:
|
||
$$\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a)$$
|
||
|
||
但由 O(n)-不变性:$\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$)。
|
||
|
||
**因此:**
|
||
$$\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$$
|
||
|
||
**等等!** 这里需要更精确的推导。让我重新表述:
|
||
|
||
设原始空间状态 $z$,潜空间状态 $\hat{z} = Qz$.
|
||
|
||
**原始空间的代价:** $\ell(z, a)$.
|
||
|
||
**潜空间中的对应状态:** $\hat{z} = Qz \implies z = Q^{-1}\hat{z}$.
|
||
|
||
**潜空间的代价:** $\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a)$(由推前定义)。
|
||
|
||
**但 O(n)-不变性给出:** $\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$)。
|
||
|
||
**因此:**
|
||
$$\boxed{\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)}$$
|
||
|
||
**不对!** 这里混淆了原始空间和潜空间的代价函数。让我重新定义:
|
||
|
||
- $\ell(z, a)$ 是原始空间的一步代价
|
||
- $\hat{\ell}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a)$ 是潜空间的一步代价(由推前定义)
|
||
|
||
**O(n)-不变性:** $\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$)。
|
||
|
||
**因此:**
|
||
$$\boxed{\hat{\ell}(Qz, a) = \ell(z, a)}$$
|
||
|
||
**引理B1证毕。** $\square$
|
||
|
||
---
|
||
|
||
### 引理B2(轨迹代价等价性)
|
||
|
||
**设定:**
|
||
- $\ell$ 和 $\ell_T$ 都是 O(n)-不变代价函数
|
||
- $h(z) = Qz$ 是线性可识别编码器
|
||
- $\hat{p}$ 是 $p$ 的正交推前
|
||
|
||
**断言:** 对任意动作序列 $\pi = (a_1, \ldots, a_T)$ 和初始状态 $z_0$:
|
||
$$\hat{J}(\pi; Qz_0) = J(\pi; z_0)$$
|
||
|
||
其中 $\hat{J}$ 是潜空间的总期望代价,$J$ 是原始空间的总期望代价。
|
||
|
||
**证明(引理B2):**
|
||
|
||
由定义:
|
||
$$J(\pi; z_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right]$$
|
||
|
||
其中 $Z_t$ 是由 $p(\cdot|z, a)$ 生成的随机过程。
|
||
|
||
类似地:
|
||
$$\hat{J}(\pi; \hat{z}_0) = \mathbb{E}\left[\sum_{t=1}^T \hat{\ell}(\hat{Z}_t, a_t) + \hat{\ell}_T(\hat{Z}_T)\bigg| \hat{Z}_0 = \hat{z}_0\right]$$
|
||
|
||
其中 $\hat{Z}_t$ 是由 $\hat{p}(\cdot|\hat{z}, a)$ 生成的随机过程。
|
||
|
||
**关键观察:** 设 $\hat{Z}_t = Q Z_t$,其中 $Z_t$ 是由 $p(\cdot|z, a)$ 生成的。
|
||
|
||
则:
|
||
$$\hat{Z}_t | (\hat{Z}_{t-1}, a_{t-1}) = Q Z_t | (Q Z_{t-1}, a_{t-1})$$
|
||
|
||
由推前定义:
|
||
$$\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)$$
|
||
|
||
因此:
|
||
$$\mathbb{P}(\hat{Z}_t \in d\hat{z}'|\hat{Z}_{t-1} = Q z_{t-1}, a_{t-1}) = p(Q^{-1}\hat{z}'|Q^{-1} Q z_{t-1}, a_{t-1}) d\hat{z}'$$
|
||
$$= p(z'|z_{t-1}, a_{t-1}) d\hat{z}'$$
|
||
|
||
其中 $z' = Q^{-1}\hat{z}'$,且 $d\hat{z}' = |\det(Q)| dz' = dz'$(因为 $\det(Q) = \pm 1$)。
|
||
|
||
**因此:** $\hat{Z}_t = Q Z_t$(在分布意义下)是由 $\hat{p}$ 生成的。
|
||
|
||
**现在计算代价:**
|
||
$$\hat{\ell}(\hat{Z}_t, a_t) = \ell(Q^{-1}\hat{Z}_t, a_t) = \ell(Z_t, a_t)$$
|
||
|
||
其中第二个等号由 O(n)-不变性($\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$)。
|
||
|
||
**类似地:**
|
||
$$\hat{\ell}_T(\hat{Z}_T) = \ell_T(Q^{-1}\hat{Z}_T, a_t) = \ell_T(Z_T)$$
|
||
|
||
**因此:**
|
||
$$\hat{J}(\pi; Qz_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right] = J(\pi; z_0)$$
|
||
|
||
**引理B2证毕。** $\square$
|
||
|
||
---
|
||
|
||
## §C Step C:值函数相等 + 最优策略等价性推导
|
||
|
||
### 定理4的证明(完整)
|
||
|
||
**第1步:值函数相等。**
|
||
|
||
由定义:
|
||
$$V^*(z_0) = \inf_{\pi} J(\pi; z_0), \quad \hat{V}^*(Qz_0) = \inf_{\pi} \hat{J}(\pi; Qz_0)$$
|
||
|
||
由引理B2:$\hat{J}(\pi; Qz_0) = J(\pi; z_0)$ 对所有 $\pi$。
|
||
|
||
**因此:**
|
||
$$\hat{V}^*(Qz_0) = \inf_{\pi} J(\pi; z_0) = V^*(z_0)$$
|
||
|
||
**第2步:最优策略等价性。**
|
||
|
||
由定义:
|
||
$$a^*_{1:T}(z_0) = \text{argmin}_{\pi} J(\pi; z_0), \quad \hat{a}^*_{1:T}(Qz_0) = \text{argmin}_{\pi} \hat{J}(\pi; Qz_0)$$
|
||
|
||
由引理B2:$\hat{J}(\pi; Qz_0) = J(\pi; z_0)$ 对所有 $\pi$。
|
||
|
||
**因此:**
|
||
$$\hat{a}^*_{1:T}(Qz_0) = \text{argmin}_{\pi} J(\pi; z_0) = a^*_{1:T}(z_0)$$
|
||
|
||
**定理4证毕。** $\square$
|
||
|
||
---
|
||
|
||
## §D 几何直觉与物理含义
|
||
|
||
### O(n)-不变性的几何图像
|
||
|
||
O(n)-不变代价函数 $\ell(z) = \phi(\|z\|_2)$ 只依赖于状态的**径向距离**,不依赖**角度方向**。
|
||
|
||
```
|
||
z₂
|
||
↑ ● (0, 2) — ℓ = φ(2)
|
||
│ ╱ ╲
|
||
│ ● ● — ℓ = φ(1) (球面上的所有点有相同代价)
|
||
│ ╲ ╱
|
||
└──────→ z₁
|
||
|
||
球面 = 轨道 Orb(z) = {y: ‖y‖₂ = ‖z‖₂}
|
||
```
|
||
|
||
**正交变换 $Q$ 的作用:** 旋转球面上的点,但不改变径向距离 $\|z\|_2$。
|
||
|
||
**因此:** O(n)-不变代价函数在正交变换下保持不变:$\ell(Qz) = \phi(\|Qz\|_2) = \phi(\|z\|_2) = \ell(z)$。
|
||
|
||
---
|
||
|
||
### 转移核推前的几何图像
|
||
|
||
```
|
||
原始空间 z: 潜空间 ĥz = Qz:
|
||
|
||
z₂ ĥz₂
|
||
↑ ↑
|
||
│ p(z'|z, a) │ p̂(ĥz'|ĥz, a)
|
||
│ ●────────● │ ●────────●
|
||
└──────→ z₁ └──────→ ĥz₁
|
||
|
||
推前:p̂(ĥz'|ĥz, a) = p(Q⁻¹ĥz'|Q⁻¹ĥz, a)
|
||
= p(z'|z, a) (因为 Q⁻¹ĥz' = z', Q⁻¹ĥz = z)
|
||
```
|
||
|
||
**物理含义:** 若原始动力学是 $p(z'|z, a)$,则在旋转后的潜空间中,动力学形式不变(只是坐标系的旋转)。
|
||
|
||
**Jacobian = 1:** 正交变换 $Q$ 的 Jacobian 行列式是 $\pm 1$,因此概率测度不变(保测性)。
|
||
|
||
---
|
||
|
||
### 规划等价的几何图像
|
||
|
||
```
|
||
原始空间 z: 潜空间 ĥz = Qz:
|
||
|
||
z₂ ĥz₂
|
||
↑ ↑
|
||
│ ●goal │ ●goal' = Q·goal
|
||
│ ╱ │ ╱
|
||
│ ╱ │ ╱
|
||
│ ●────────● │ ●────────●
|
||
└──────→ z₁ └──────→ ĥz₁
|
||
|
||
最优路径:start → goal(直线,代价 = ‖goal - start‖₂)
|
||
最优路径:ĥstart → ĥgoal(直线,代价 = ‖Q(goal - start)‖₂ = ‖goal - start‖₂)
|
||
```
|
||
|
||
**关键:** 正交变换 $Q$ 保持距离不变:$\|Qx\|_2 = \|x\|_2$。
|
||
|
||
**因此:** 在原始空间和潜空间中,最优路径的长度(代价)完全相同!
|
||
|
||
---
|
||
|
||
## §E 与定理1-3的关系
|
||
|
||
| 定理 | 核心结论 | 在规划等价性中的作用 |
|
||
|------|----------|-------------------|
|
||
| 定理1(专题III) | $h(z) = Qz$(正交等价) | 提供线性可识别编码器的形式 $h(z) = Qz$ |
|
||
| 定理2(专题IV) | 高斯是唯一使 $h(z) = Qz$ 的分布 | 说明定理1的条件是必要的(高斯是唯一使线性可识别成立的) |
|
||
| 定理3(专题V) | $\mathbb{E}[\|h(z) - Qz\|^2] \leq D + (\varepsilon+D)^2$ | 给出近似情况下的误差界(鲁棒性) |
|
||
| **定理4(本专题)** | $\hat{V}^*(Qz_0) = V^*(z_0)$(规划等价) | 证明线性可识别性足以支持最优规划 |
|
||
|
||
---
|
||
|
||
### 定理3对定理4的推广(近似情况)
|
||
|
||
在定理1的完美条件下,$h(z) = Qz$ 精确成立,因此规划等价性 $\hat{V}^*(Qz_0) = V^*(z_0)$ 精确成立。
|
||
|
||
在定理3的近似条件下,$\mathbb{E}[\|h(z) - Qz\|^2] \leq D + (\varepsilon+D)^2$,规划等价性会有**误差**。
|
||
|
||
**近似情况下的界:** 若 $h(z) = Qz + \epsilon(z)$,其中 $\mathbb{E}[\|\epsilon(z)\|^2] \leq \eta$($\eta = D + (\varepsilon+D)^2$),则:
|
||
|
||
$$|\hat{V}^*(Qz_0) - V^*(z_0)| \leq O(\sqrt{\eta})$$
|
||
|
||
**推导:** 由 Lipschitz 连续性(假设 $\ell$ 是 $L$-Lipschitz):
|
||
$$|\hat{J}(\pi; Qz_0) - J(\pi; z_0)| \leq T \cdot L \cdot \sqrt{\eta}$$
|
||
|
||
**因此:**
|
||
$$|\hat{V}^*(Qz_0) - V^*(z_0)| \leq T \cdot L \cdot \sqrt{\eta}$$
|
||
|
||
**其中:** $\eta = D + (\varepsilon+D)^2$ 是定理3的近似界。
|
||
|
||
**物理含义:** 规划等价性的误差随 $\delta, \varepsilon \to 0$ 连续趋向零(优雅降级)。
|
||
|
||
---
|
||
|
||
## §F Lean 4 形式化验证状态
|
||
|
||
### 定理4在 [`Planning.lean`](../lejepa-identifiability/lean/LeJEPA/Planning.lean) 中的形式化
|
||
|
||
| 组件 | Lean 4 定理 | 状态 |
|
||
|------|-------------|------|
|
||
| O(n)-不变性定义 | `is_orthogonal_invariant_cost` | ✅ 已验证 |
|
||
| 转移核推前性质 | `pushforward_transition_kernel` | ✅ 已验证 |
|
||
| 一步代价等价性 | `one_step_cost_equivalence` | ✅ 已验证 |
|
||
| 轨迹代价等价性 | `trajectory_cost_equivalence` | ✅ 已验证 |
|
||
| 值函数相等 | `value_function_equality` | ✅ 已验证 |
|
||
| 最优策略等价性 | `optimal_policy_equivalence` | ✅ 已验证 |
|
||
|
||
---
|
||
|
||
## §G DMC Reacher 实验的严格复现说明
|
||
|
||
### 实验设置的形式化定义
|
||
|
||
**环境:** DeepMind Control Suite 的 Reacher 任务。
|
||
- **状态空间(关节角度):** $z = (\theta_1, \theta_2) \in [0, 2\pi)^2$
|
||
- **动作空间:** $a = (\dot{\theta}_1, \dot{\theta}_2) \in \mathbb{R}^2$
|
||
- **动力学:** 简化的二阶积分器 $\theta' = \theta + \dot{\theta}\Delta t$
|
||
|
||
**编码器:** CNN 网络 $h: \mathbb{R}^{64\times 64\times 3} \to \mathbb{R}^2$。
|
||
|
||
**两种训练数据:**
|
||
1. **OU 采样:** $z' = \rho z + \sqrt{1-\rho^2}\eta$,$\eta \sim N(0, I_2)$
|
||
- 分布:$N(0, I_2)$(各向同性高斯)
|
||
- 满足定理1条件:$\mathcal{L}_{\text{align}} \approx 2(1-\rho)n$
|
||
|
||
2. **RL 轨迹:** 由训练好的策略生成的轨迹
|
||
- 分布:非高斯、各向异性(依赖于奖励函数和初始状态)
|
||
- 不满足定理1条件:$\mathcal{L}_{\text{align}} \gg 2(1-\rho)n$
|
||
|
||
**规划任务:**
|
||
- **目标状态:** $z_{\text{goal}} = (0, 0)$(关节角度为零)
|
||
- **代价函数:** $\ell(z, a) = \|z\|_2^2 + \lambda\|a\|_2^2$(LQR 型代价)
|
||
- **时域:** $T = 10$
|
||
|
||
**规划方式:**
|
||
1. **Oracle(关节空间):** 在真实关节空间中执行直线路径 $\theta(t) = (1-t/T)\cdot \theta_0$
|
||
2. **OU 编码器:** 在潜空间中执行直线路径,用最近邻检索解码
|
||
3. **RL 编码器:** 在潜空间中执行直线路径,用最近邻检索解码
|
||
|
||
**结果(论文图3):**
|
||
| 编码器 | 平均路径长度 | p-value vs Oracle |
|
||
|--------|-------------|-------------------|
|
||
| Oracle(关节空间) | ~1.0 | — |
|
||
| OU 编码器 | ~1.02 | > 0.5(无显著差异)|
|
||
| RL 编码器 | ~1.48 | < 0.001(显著差异)|
|
||
|
||
**结论:** OU 编码器(满足定理1条件)的规划质量与 Oracle 无显著差异;RL 编码器(违反假设)的规划质量显著下降。
|
||
|
||
**与定理4的关系:**
|
||
- OU 编码器:$h(z) \approx Qz$(正交等价),因此 $\hat{V}^*(Qz_0) \approx V^*(z_0)$(规划等价)
|
||
- RL 编码器:$h(z) \neq Qz$(非正交等价),因此 $\hat{V}^*(Qz_0) \neq V^*(z_0)$(规划不等价)
|
||
|
||
---
|
||
|
||
## §H 小结与核心洞见
|
||
|
||
### 定理4的证明总结(三步法)
|
||
|
||
1. **O(n)-不变性:** $\ell(Qz, a) = \ell(z, a)$(只依赖径向距离)
|
||
2. **转移核推前:** $\hat{p}(\cdot|\hat{z}, a) = p(Q^{-1}\cdot|Q^{-1}\hat{z}, a)$(Jacobian = 1)
|
||
3. **代价等价性:** $\hat{J}(\pi; Qz_0) = J(\pi; z_0)$(对所有 $\pi$)
|
||
4. **优化等价性:** $\hat{V}^*(Qz_0) = V^*(z_0)$(inf 相同)
|
||
|
||
### 核心洞见(一句话)
|
||
|
||
**O(n)-不变代价函数只依赖径向距离 $\|z\|_2$,而正交变换 $Q$ 保持径向距离不变($\|Qz\|_2 = \|z\|_2$),因此 O(n)-不变代价在正交变换下保持不变,导致规划等价性。**
|
||
|
||
### 与定理1的关系(一句话)
|
||
|
||
**定理4是定理1的应用:若 $h(z) = Qz$(正交等价),则 O(n)-不变代价函数下的规划完全等价;若 $h(z) \neq Qz$(非正交等价),则规划不等价。**
|
||
|
||
### 与定理3的关系(一句话)
|
||
|
||
**定理4在完美条件下成立;定理3给出近似条件下的误差界:$|\hat{V}^* - V^*| \leq T\cdot L\cdot\sqrt{D+(\varepsilon+D)^2}$(优雅降级)。**
|
||
|
||
---
|
||
|
||
## ➡️ 返回总览
|
||
|
||
→ [LeJEPA 数学证明专题总览](README.md)——四大定理的完整图景与核心洞见
|