- Introduced a comprehensive lecture plan for the four main theorems in LeJEPA, including knowledge dependency graphs, detailed outlines for each topic, and corresponding Lean 4 files for formal verification. - Created a summary document encapsulating the core insights and mathematical structures of the four theorems, emphasizing their interdependencies and implications in the context of LeJEPA.
19 KiB
专题 VI:正交不变性与最优规划等价(定理4严格证明)
前置知识: 专题 I:Hermite 多项式、专题 III:谱分解与线性可识别性(定理1)、专题 V:近似可识别性界(定理3) 目标: 严格证明 O(n)-不变代价函数下,线性可识别性足以保证潜空间规划与真实世界规划的完全等价
§0 定理4的完整陈述与证明定位
问题设定:控制问题的形式化定义
定义1(离散时间随机控制系统):
一个离散时间随机控制系统由以下元素组成:
- 状态空间 $\mathcal{Z} = \mathbb{R}^n$(潜变量)
- 动作空间 $\mathcal{A} \subseteq \mathbb{R}^m$(控制输入)
- 转移核 $p(z'|z, a)$:给定当前状态
z和动作 $a$,下一时刻状态z'的条件概率密度 - 代价函数 $\ell: \mathcal{Z} \times \mathcal{A} \to [0, \infty)$:一步代价
- 终端代价 $\ell_T: \mathcal{Z} \to [0, \infty)$:终端代价
- 时域 $T \in \mathbb{N}$:规划 horizon
定义2(策略与轨迹代价):
给定初始状态 $z_0$,一个开环策略 \pi = (a_1, a_2, \ldots, a_T) 是动作序列。
由 \pi 和 z_0 生成的轨迹 (Z_1, Z_2, \ldots, Z_T) 是随机过程,满足:
Z_t | (Z_{t-1}, a_{t-1}) \sim p(\cdot|Z_{t-1}, a_{t-1}), \quad Z_0 = z_0
总期望代价:
J(\pi; z_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right]
最优控制问题:
V^*(z_0) = \inf_{\pi} J(\pi; z_0), \quad a^*_{1:T}(z_0) = \text{argmin}_{\pi} J(\pi; z_0)
其中 V^* 是值函数(cost-to-go),a^*_{1:T} 是最优动作序列。
定理4(最优规划等价性)的完整陈述
设定:
- 线性可识别编码器: $h(z) = Qz$,其中
Q \in O(n)是正交矩阵 - O(n)-不变代价函数:
\ell(Qz, a) = \ell(z, a)对所有Q \in O(n), z \in \mathcal{Z}, a \in \mathcal{A} - 潜空间动力学: $\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)$(转移核的正交推前)
定理4断言:
- 值函数相等:
\hat{V}^*(Qz_0) = V^*(z_0)对所有z_0 \in \mathcal{Z} - 最优策略等价:
\hat{\pi}^*(Qz_0) = \pi^*(z_0)对所有z_0 \in \mathcal{Z}
其中 \hat{V}^* 和 \hat{\pi}^* 是潜空间控制问题的值函数和最优策略,V^* 和 \pi^* 是原始空间控制问题的值函数和最优策略。
证明定位与结构
定理4是应用性定理:它利用定理1的线性可识别性结论 $h(z) = Qz$,结合 O(n)-不变代价函数的几何性质,证明规划等价性。
证明分为三个严格步骤:
| 步骤 | 内容 | 关键工具 |
|---|---|---|
| Step A | O(n)-不变性的形式化定义与基本性质 | 群作用 + 不变函数理论 |
| Step B | 转移核的推前性质 + 代价等价性证明 | 变量替换 + Jacobian = 1(正交变换) |
| Step C | 值函数相等 + 最优策略等价性推导 | 优化理论(inf/sup交换) |
§A Step A:O(n)-不变性的形式化定义与基本性质
定义3(正交群 O(n))
正交群:
O(n) = \{Q \in \mathbb{R}^{n\times n}: Q^\top Q = QQ^\top = I_n\}
性质:
- $Q \in O(n) \implies |Qx|_2 = |x|_2$(保距性)
- $Q \in O(n) \implies \det(Q) = \pm 1$(保向性/反射)
- $Q \in O(n) \implies Q^{-1} = Q^\top$(逆等于转置)
- $Q \in O(n) \implies |\det(Q)| = 1$,Jacobian $= 1$(保测性)
群作用: O(n) 在 \mathbb{R}^n 上的自然作用:
Q \cdot x = Qx, \quad Q \in O(n), x \in \mathbb{R}^n
轨道: x 的轨道是 $\text{Orb}(x) = {Qx: Q \in O(n)} = {y \in \mathbb{R}^n: |y|_2 = |x|_2}$(半径为 \|x\|_2 的球面)。
不变函数: f: \mathbb{R}^n \to \mathbb{R} 是 O(n)-不变的,如果:
f(Qx) = f(x), \quad \forall Q \in O(n), x \in \mathbb{R}^n
引理A1(O(n)-不变函数的结构定理):
设 f: \mathbb{R}^n \to \mathbb{R} 是连续且 O(n)-不变的。则存在函数 $\phi: [0, \infty) \to \mathbb{R}$,使得:
f(x) = \phi(\|x\|_2), \quad x \in \mathbb{R}^n
证明(引理A1):
对任意 $x, y \in \mathbb{R}^n$,若 $|x|_2 = |y|_2 > 0$,则存在 Q \in O(n) 使得 $y = Qx$(球面上任意两点可通过正交变换映射)。
因此:
f(x) = f(Qx) = f(y), \quad \text{当 } \|x\|_2 = \|y\|_2
定义 \phi(r) = f(x) 其中 $r = |x|_2$。这是良定义的,因为若 $|x'|_2 = |x|_2$,则 $f(x') = f(x)$。
因此:
\boxed{f(x) = \phi(\|x\|_2)}
引理A1证毕。 \square
定义4(O(n)-不变代价函数)
一步代价 \ell: \mathbb{R}^n \times \mathcal{A} \to [0, \infty) 是 O(n)-不变的,如果:
\ell(Qz, a) = \ell(z, a), \quad \forall Q \in O(n), z \in \mathbb{R}^n, a \in \mathcal{A}
终端代价 \ell_T: \mathbb{R}^n \to [0, \infty) 是 O(n)-不变的,如果:
\ell_T(Qz) = \ell_T(z), \quad \forall Q \in O(n), z \in \mathbb{R}^n
由引理A1: O(n)-不变代价函数具有形式:
\ell(z, a) = \phi_\ell(\|z\|_2), \quad \ell_T(z) = \phi_T(\|z\|_2)
常见例子:
- 欧氏距离到目标:$\ell(z, a) = |z - z_{\text{goal}}|2^2$(若 $z{\text{goal}} = 0$,即 $\ell(z) = |z|_2^2$)
- LQR 代价:$\ell(z, a) = z^\top P z + a^\top R a$(若 $P = \lambda I$,即 $\ell(z) = \lambda|z|_2^2$)
- 范数惩罚:
\ell(z) = \|z\|_2^pforp \geq 1
非例子(不满足 O(n)-不变性):
- 坐标惩罚:$\ell(z) = z_1^2$(只惩罚第一维,旋转后变成 $(Qz)_1^2 \neq z_1^2$)
- 固定方向目标:$\ell(z) = |z - e_1|_2^2$(目标方向固定为 $e_1 = [1, 0, \ldots, 0]^\top$)
§B Step B:转移核的推前性质 + 代价等价性证明
定义5(转移核的正交推前)
设定:
- 原始空间状态 $z \in \mathbb{R}^n$,转移核
p(z'|z, a) - 潜空间状态 $\hat{z} = Qz \in \mathbb{R}^n$,其中
Q \in O(n) - 潜空间转移核
\hat{p}(\hat{z}'|\hat{z}, a)
定义5断言: 潜空间转移核是原始转移核的正交推前(pushforward):
\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a) \cdot |\det(Q^{-1})|
由于 $Q \in O(n)$: $\det(Q) = \pm 1$,因此 $|\det(Q^{-1})| = |\det(Q^\top)| = 1$。
因此:
\boxed{\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)}
物理含义: 若原始动力学是 $p(z'|z, a)$,则在旋转后的潜空间 \hat{z} = Qz 中,动力学是 $p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)$。
引理B1(一步代价等价性)
设定:
\ell是 O(n)-不变代价函数:\ell(Qz, a) = \ell(z, a)h(z) = Qz是线性可识别编码器
断言: 对任意 $z \in \mathbb{R}^n, a \in \mathcal{A}$:
\ell_{\text{latent}}(Qz, a) = \ell(z, a)
其中 \ell_{\text{latent}} 是潜空间的一步代价。
证明(引理B1):
由 O(n)-不变性:$\ell(Qz, a) = \ell(z, a)$。
由定义5(推前动力学):$\hat{p}(\cdot|\hat{z}, a) = p(Q^{-1}\cdot|Q^{-1}\hat{z}, a)$。
因此,在潜空间中执行动作 a 的一步代价:
\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a)
但由 O(n)-不变性:$\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$)。
因此:
\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)
等等! 这里需要更精确的推导。让我重新表述:
设原始空间状态 $z$,潜空间状态 \hat{z} = Qz.
原始空间的代价: \ell(z, a).
潜空间中的对应状态: \hat{z} = Qz \implies z = Q^{-1}\hat{z}.
潜空间的代价: $\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a)$(由推前定义)。
但 O(n)-不变性给出: $\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$)。
因此:
\boxed{\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)}
不对! 这里混淆了原始空间和潜空间的代价函数。让我重新定义:
\ell(z, a)是原始空间的一步代价\hat{\ell}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a)是潜空间的一步代价(由推前定义)
O(n)-不变性: $\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$)。
因此:
\boxed{\hat{\ell}(Qz, a) = \ell(z, a)}
引理B1证毕。 \square
引理B2(轨迹代价等价性)
设定:
\ell和\ell_T都是 O(n)-不变代价函数h(z) = Qz是线性可识别编码器\hat{p}是p的正交推前
断言: 对任意动作序列 \pi = (a_1, \ldots, a_T) 和初始状态 $z_0$:
\hat{J}(\pi; Qz_0) = J(\pi; z_0)
其中 \hat{J} 是潜空间的总期望代价,J 是原始空间的总期望代价。
证明(引理B2):
由定义:
J(\pi; z_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right]
其中 Z_t 是由 p(\cdot|z, a) 生成的随机过程。
类似地:
\hat{J}(\pi; \hat{z}_0) = \mathbb{E}\left[\sum_{t=1}^T \hat{\ell}(\hat{Z}_t, a_t) + \hat{\ell}_T(\hat{Z}_T)\bigg| \hat{Z}_0 = \hat{z}_0\right]
其中 \hat{Z}_t 是由 \hat{p}(\cdot|\hat{z}, a) 生成的随机过程。
关键观察: 设 $\hat{Z}_t = Q Z_t$,其中 Z_t 是由 p(\cdot|z, a) 生成的。
则:
\hat{Z}_t | (\hat{Z}_{t-1}, a_{t-1}) = Q Z_t | (Q Z_{t-1}, a_{t-1})
由推前定义:
\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)
因此:
\mathbb{P}(\hat{Z}_t \in d\hat{z}'|\hat{Z}_{t-1} = Q z_{t-1}, a_{t-1}) = p(Q^{-1}\hat{z}'|Q^{-1} Q z_{t-1}, a_{t-1}) d\hat{z}'
= p(z'|z_{t-1}, a_{t-1}) d\hat{z}'
其中 $z' = Q^{-1}\hat{z}'$,且 $d\hat{z}' = |\det(Q)| dz' = dz'$(因为 $\det(Q) = \pm 1$)。
因此: $\hat{Z}_t = Q Z_t$(在分布意义下)是由 \hat{p} 生成的。
现在计算代价:
\hat{\ell}(\hat{Z}_t, a_t) = \ell(Q^{-1}\hat{Z}_t, a_t) = \ell(Z_t, a_t)
其中第二个等号由 O(n)-不变性($\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$)。
类似地:
\hat{\ell}_T(\hat{Z}_T) = \ell_T(Q^{-1}\hat{Z}_T, a_t) = \ell_T(Z_T)
因此:
\hat{J}(\pi; Qz_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right] = J(\pi; z_0)
引理B2证毕。 \square
§C Step C:值函数相等 + 最优策略等价性推导
定理4的证明(完整)
第1步:值函数相等。
由定义:
V^*(z_0) = \inf_{\pi} J(\pi; z_0), \quad \hat{V}^*(Qz_0) = \inf_{\pi} \hat{J}(\pi; Qz_0)
由引理B2:\hat{J}(\pi; Qz_0) = J(\pi; z_0) 对所有 $\pi$。
因此:
\hat{V}^*(Qz_0) = \inf_{\pi} J(\pi; z_0) = V^*(z_0)
第2步:最优策略等价性。
由定义:
a^*_{1:T}(z_0) = \text{argmin}_{\pi} J(\pi; z_0), \quad \hat{a}^*_{1:T}(Qz_0) = \text{argmin}_{\pi} \hat{J}(\pi; Qz_0)
由引理B2:\hat{J}(\pi; Qz_0) = J(\pi; z_0) 对所有 $\pi$。
因此:
\hat{a}^*_{1:T}(Qz_0) = \text{argmin}_{\pi} J(\pi; z_0) = a^*_{1:T}(z_0)
定理4证毕。 \square
§D 几何直觉与物理含义
O(n)-不变性的几何图像
O(n)-不变代价函数 \ell(z) = \phi(\|z\|_2) 只依赖于状态的径向距离,不依赖角度方向。
z₂
↑ ● (0, 2) — ℓ = φ(2)
│ ╱ ╲
│ ● ● — ℓ = φ(1) (球面上的所有点有相同代价)
│ ╲ ╱
└──────→ z₁
球面 = 轨道 Orb(z) = {y: ‖y‖₂ = ‖z‖₂}
正交变换 Q 的作用: 旋转球面上的点,但不改变径向距离 $|z|_2$。
因此: O(n)-不变代价函数在正交变换下保持不变:$\ell(Qz) = \phi(|Qz|_2) = \phi(|z|_2) = \ell(z)$。
转移核推前的几何图像
原始空间 z: 潜空间 ĥz = Qz:
z₂ ĥz₂
↑ ↑
│ p(z'|z, a) │ p̂(ĥz'|ĥz, a)
│ ●────────● │ ●────────●
└──────→ z₁ └──────→ ĥz₁
推前:p̂(ĥz'|ĥz, a) = p(Q⁻¹ĥz'|Q⁻¹ĥz, a)
= p(z'|z, a) (因为 Q⁻¹ĥz' = z', Q⁻¹ĥz = z)
物理含义: 若原始动力学是 $p(z'|z, a)$,则在旋转后的潜空间中,动力学形式不变(只是坐标系的旋转)。
Jacobian = 1: 正交变换 Q 的 Jacobian 行列式是 $\pm 1$,因此概率测度不变(保测性)。
规划等价的几何图像
原始空间 z: 潜空间 ĥz = Qz:
z₂ ĥz₂
↑ ↑
│ ●goal │ ●goal' = Q·goal
│ ╱ │ ╱
│ ╱ │ ╱
│ ●────────● │ ●────────●
└──────→ z₁ └──────→ ĥz₁
最优路径:start → goal(直线,代价 = ‖goal - start‖₂)
最优路径:ĥstart → ĥgoal(直线,代价 = ‖Q(goal - start)‖₂ = ‖goal - start‖₂)
关键: 正交变换 Q 保持距离不变:$|Qx|_2 = |x|_2$。
因此: 在原始空间和潜空间中,最优路径的长度(代价)完全相同!
§E 与定理1-3的关系
| 定理 | 核心结论 | 在规划等价性中的作用 |
|---|---|---|
| 定理1(专题III) | $h(z) = Qz$(正交等价) | 提供线性可识别编码器的形式 h(z) = Qz |
| 定理2(专题IV) | 高斯是唯一使 h(z) = Qz 的分布 |
说明定理1的条件是必要的(高斯是唯一使线性可识别成立的) |
| 定理3(专题V) | \mathbb{E}[\|h(z) - Qz\|^2] \leq D + (\varepsilon+D)^2 |
给出近似情况下的误差界(鲁棒性) |
| 定理4(本专题) | $\hat{V}^(Qz_0) = V^(z_0)$(规划等价) | 证明线性可识别性足以支持最优规划 |
定理3对定理4的推广(近似情况)
在定理1的完美条件下,h(z) = Qz 精确成立,因此规划等价性 \hat{V}^*(Qz_0) = V^*(z_0) 精确成立。
在定理3的近似条件下,$\mathbb{E}[|h(z) - Qz|^2] \leq D + (\varepsilon+D)^2$,规划等价性会有误差。
近似情况下的界: 若 $h(z) = Qz + \epsilon(z)$,其中 $\mathbb{E}[|\epsilon(z)|^2] \leq \eta$($\eta = D + (\varepsilon+D)^2$),则:
|\hat{V}^*(Qz_0) - V^*(z_0)| \leq O(\sqrt{\eta})
推导: 由 Lipschitz 连续性(假设 \ell 是 $L$-Lipschitz):
|\hat{J}(\pi; Qz_0) - J(\pi; z_0)| \leq T \cdot L \cdot \sqrt{\eta}
因此:
|\hat{V}^*(Qz_0) - V^*(z_0)| \leq T \cdot L \cdot \sqrt{\eta}
其中: \eta = D + (\varepsilon+D)^2 是定理3的近似界。
物理含义: 规划等价性的误差随 \delta, \varepsilon \to 0 连续趋向零(优雅降级)。
§F Lean 4 形式化验证状态
定理4在 Planning.lean 中的形式化
| 组件 | Lean 4 定理 | 状态 |
|---|---|---|
| O(n)-不变性定义 | is_orthogonal_invariant_cost |
✅ 已验证 |
| 转移核推前性质 | pushforward_transition_kernel |
✅ 已验证 |
| 一步代价等价性 | one_step_cost_equivalence |
✅ 已验证 |
| 轨迹代价等价性 | trajectory_cost_equivalence |
✅ 已验证 |
| 值函数相等 | value_function_equality |
✅ 已验证 |
| 最优策略等价性 | optimal_policy_equivalence |
✅ 已验证 |
§G DMC Reacher 实验的严格复现说明
实验设置的形式化定义
环境: DeepMind Control Suite 的 Reacher 任务。
- 状态空间(关节角度):
z = (\theta_1, \theta_2) \in [0, 2\pi)^2 - 动作空间:
a = (\dot{\theta}_1, \dot{\theta}_2) \in \mathbb{R}^2 - 动力学: 简化的二阶积分器
\theta' = \theta + \dot{\theta}\Delta t
编码器: CNN 网络 $h: \mathbb{R}^{64\times 64\times 3} \to \mathbb{R}^2$。
两种训练数据:
-
OU 采样: $z' = \rho z + \sqrt{1-\rho^2}\eta$,
\eta \sim N(0, I_2)- 分布:$N(0, I_2)$(各向同性高斯)
- 满足定理1条件:
\mathcal{L}_{\text{align}} \approx 2(1-\rho)n
-
RL 轨迹: 由训练好的策略生成的轨迹
- 分布:非高斯、各向异性(依赖于奖励函数和初始状态)
- 不满足定理1条件:
\mathcal{L}_{\text{align}} \gg 2(1-\rho)n
规划任务:
- 目标状态: $z_{\text{goal}} = (0, 0)$(关节角度为零)
- 代价函数: $\ell(z, a) = |z|_2^2 + \lambda|a|_2^2$(LQR 型代价)
- 时域:
T = 10
规划方式:
- Oracle(关节空间): 在真实关节空间中执行直线路径
\theta(t) = (1-t/T)\cdot \theta_0 - OU 编码器: 在潜空间中执行直线路径,用最近邻检索解码
- RL 编码器: 在潜空间中执行直线路径,用最近邻检索解码
结果(论文图3):
| 编码器 | 平均路径长度 | p-value vs Oracle |
|---|---|---|
| Oracle(关节空间) | ~1.0 | — |
| OU 编码器 | ~1.02 | > 0.5(无显著差异) |
| RL 编码器 | ~1.48 | < 0.001(显著差异) |
结论: OU 编码器(满足定理1条件)的规划质量与 Oracle 无显著差异;RL 编码器(违反假设)的规划质量显著下降。
与定理4的关系:
- OU 编码器:$h(z) \approx Qz$(正交等价),因此 $\hat{V}^(Qz_0) \approx V^(z_0)$(规划等价)
- RL 编码器:$h(z) \neq Qz$(非正交等价),因此 $\hat{V}^(Qz_0) \neq V^(z_0)$(规划不等价)
§H 小结与核心洞见
定理4的证明总结(三步法)
- O(n)-不变性: $\ell(Qz, a) = \ell(z, a)$(只依赖径向距离)
- 转移核推前: $\hat{p}(\cdot|\hat{z}, a) = p(Q^{-1}\cdot|Q^{-1}\hat{z}, a)$(Jacobian = 1)
- 代价等价性: $\hat{J}(\pi; Qz_0) = J(\pi; z_0)$(对所有 $\pi$)
- 优化等价性: $\hat{V}^(Qz_0) = V^(z_0)$(inf 相同)
核心洞见(一句话)
O(n)-不变代价函数只依赖径向距离 $|z|_2$,而正交变换 Q 保持径向距离不变($|Qz|_2 = |z|_2$),因此 O(n)-不变代价在正交变换下保持不变,导致规划等价性。
与定理1的关系(一句话)
定理4是定理1的应用:若 $h(z) = Qz$(正交等价),则 O(n)-不变代价函数下的规划完全等价;若 $h(z) \neq Qz$(非正交等价),则规划不等价。
与定理3的关系(一句话)
定理4在完美条件下成立;定理3给出近似条件下的误差界:$|\hat{V}^ - V^*| \leq T\cdot L\cdot\sqrt{D+(\varepsilon+D)^2}$(优雅降级)。*
➡️ 返回总览
→ LeJEPA 数学证明专题总览——四大定理的完整图景与核心洞见