Files
worldmodel/JEPA/math/06_planning_equivalence.md
T
gaojie b5499c7ea0 Add detailed lecture plan and summary for LeJEPA four theorems
- Introduced a comprehensive lecture plan for the four main theorems in LeJEPA, including knowledge dependency graphs, detailed outlines for each topic, and corresponding Lean 4 files for formal verification.
- Created a summary document encapsulating the core insights and mathematical structures of the four theorems, emphasizing their interdependencies and implications in the context of LeJEPA.
2026-06-05 16:30:24 +08:00

19 KiB
Raw Blame History

专题 VI:正交不变性与最优规划等价(定理4严格证明)

前置知识: 专题 IHermite 多项式专题 III:谱分解与线性可识别性(定理1)专题 V:近似可识别性界(定理3 目标: 严格证明 O(n)-不变代价函数下,线性可识别性足以保证潜空间规划与真实世界规划的完全等价


§0 定理4的完整陈述与证明定位

问题设定:控制问题的形式化定义

定义1(离散时间随机控制系统):

一个离散时间随机控制系统由以下元素组成:

  • 状态空间 $\mathcal{Z} = \mathbb{R}^n$(潜变量)
  • 动作空间 $\mathcal{A} \subseteq \mathbb{R}^m$(控制输入)
  • 转移核 $p(z'|z, a)$:给定当前状态 z 和动作 $a$,下一时刻状态 z' 的条件概率密度
  • 代价函数 $\ell: \mathcal{Z} \times \mathcal{A} \to [0, \infty)$:一步代价
  • 终端代价 $\ell_T: \mathcal{Z} \to [0, \infty)$:终端代价
  • 时域 $T \in \mathbb{N}$:规划 horizon

定义2(策略与轨迹代价):

给定初始状态 $z_0$,一个开环策略 \pi = (a_1, a_2, \ldots, a_T) 是动作序列。

\piz_0 生成的轨迹 (Z_1, Z_2, \ldots, Z_T) 是随机过程,满足:

Z_t | (Z_{t-1}, a_{t-1}) \sim p(\cdot|Z_{t-1}, a_{t-1}), \quad Z_0 = z_0

总期望代价:

J(\pi; z_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right]

最优控制问题:

V^*(z_0) = \inf_{\pi} J(\pi; z_0), \quad a^*_{1:T}(z_0) = \text{argmin}_{\pi} J(\pi; z_0)

其中 V^*值函数(cost-to-goa^*_{1:T} 是最优动作序列。


定理4(最优规划等价性)的完整陈述

设定:

  1. 线性可识别编码器: $h(z) = Qz$,其中 Q \in O(n) 是正交矩阵
  2. O(n)-不变代价函数: \ell(Qz, a) = \ell(z, a) 对所有 Q \in O(n), z \in \mathcal{Z}, a \in \mathcal{A}
  3. 潜空间动力学: $\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)$(转移核的正交推前)

定理4断言:

  1. 值函数相等: \hat{V}^*(Qz_0) = V^*(z_0) 对所有 z_0 \in \mathcal{Z}
  2. 最优策略等价: \hat{\pi}^*(Qz_0) = \pi^*(z_0) 对所有 z_0 \in \mathcal{Z}

其中 \hat{V}^*\hat{\pi}^* 是潜空间控制问题的值函数和最优策略,V^*\pi^* 是原始空间控制问题的值函数和最优策略。


证明定位与结构

定理4是应用性定理:它利用定理1的线性可识别性结论 $h(z) = Qz$,结合 O(n)-不变代价函数的几何性质,证明规划等价性。

证明分为三个严格步骤:

步骤 内容 关键工具
Step A O(n)-不变性的形式化定义与基本性质 群作用 + 不变函数理论
Step B 转移核的推前性质 + 代价等价性证明 变量替换 + Jacobian = 1(正交变换)
Step C 值函数相等 + 最优策略等价性推导 优化理论(inf/sup交换)

§A Step A:O(n)-不变性的形式化定义与基本性质

定义3(正交群 O(n)

正交群:

O(n) = \{Q \in \mathbb{R}^{n\times n}: Q^\top Q = QQ^\top = I_n\}

性质:

  • $Q \in O(n) \implies |Qx|_2 = |x|_2$(保距性)
  • $Q \in O(n) \implies \det(Q) = \pm 1$(保向性/反射)
  • $Q \in O(n) \implies Q^{-1} = Q^\top$(逆等于转置)
  • $Q \in O(n) \implies |\det(Q)| = 1$Jacobian $= 1$(保测性)

群作用: O(n) 在 \mathbb{R}^n 上的自然作用:

Q \cdot x = Qx, \quad Q \in O(n), x \in \mathbb{R}^n

轨道: x 的轨道是 $\text{Orb}(x) = {Qx: Q \in O(n)} = {y \in \mathbb{R}^n: |y|_2 = |x|_2}$(半径为 \|x\|_2 的球面)。

不变函数: f: \mathbb{R}^n \to \mathbb{R} 是 O(n)-不变的,如果:

f(Qx) = f(x), \quad \forall Q \in O(n), x \in \mathbb{R}^n

引理A1(O(n)-不变函数的结构定理):

f: \mathbb{R}^n \to \mathbb{R} 是连续且 O(n)-不变的。则存在函数 $\phi: [0, \infty) \to \mathbb{R}$,使得:

f(x) = \phi(\|x\|_2), \quad x \in \mathbb{R}^n

证明(引理A1):

对任意 $x, y \in \mathbb{R}^n$,若 $|x|_2 = |y|_2 > 0$,则存在 Q \in O(n) 使得 $y = Qx$(球面上任意两点可通过正交变换映射)。

因此:

f(x) = f(Qx) = f(y), \quad \text{当 } \|x\|_2 = \|y\|_2

定义 \phi(r) = f(x) 其中 $r = |x|_2$。这是良定义的,因为若 $|x'|_2 = |x|_2$,则 $f(x') = f(x)$。

因此:

\boxed{f(x) = \phi(\|x\|_2)}

引理A1证毕。 \square


定义4O(n)-不变代价函数)

一步代价 \ell: \mathbb{R}^n \times \mathcal{A} \to [0, \infty) 是 O(n)-不变的,如果:

\ell(Qz, a) = \ell(z, a), \quad \forall Q \in O(n), z \in \mathbb{R}^n, a \in \mathcal{A}

终端代价 \ell_T: \mathbb{R}^n \to [0, \infty) 是 O(n)-不变的,如果:

\ell_T(Qz) = \ell_T(z), \quad \forall Q \in O(n), z \in \mathbb{R}^n

由引理A1 O(n)-不变代价函数具有形式:

\ell(z, a) = \phi_\ell(\|z\|_2), \quad \ell_T(z) = \phi_T(\|z\|_2)

常见例子:

  • 欧氏距离到目标:$\ell(z, a) = |z - z_{\text{goal}}|2^2$(若 $z{\text{goal}} = 0$,即 $\ell(z) = |z|_2^2$
  • LQR 代价:$\ell(z, a) = z^\top P z + a^\top R a$(若 $P = \lambda I$,即 $\ell(z) = \lambda|z|_2^2$
  • 范数惩罚:\ell(z) = \|z\|_2^p for p \geq 1

非例子(不满足 O(n)-不变性):

  • 坐标惩罚:$\ell(z) = z_1^2$(只惩罚第一维,旋转后变成 $(Qz)_1^2 \neq z_1^2$
  • 固定方向目标:$\ell(z) = |z - e_1|_2^2$(目标方向固定为 $e_1 = [1, 0, \ldots, 0]^\top$

§B Step B:转移核的推前性质 + 代价等价性证明

定义5(转移核的正交推前)

设定:

  • 原始空间状态 $z \in \mathbb{R}^n$,转移核 p(z'|z, a)
  • 潜空间状态 $\hat{z} = Qz \in \mathbb{R}^n$,其中 Q \in O(n)
  • 潜空间转移核 \hat{p}(\hat{z}'|\hat{z}, a)

定义5断言: 潜空间转移核是原始转移核的正交推前(pushforward

\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a) \cdot |\det(Q^{-1})|

由于 $Q \in O(n)$ $\det(Q) = \pm 1$,因此 $|\det(Q^{-1})| = |\det(Q^\top)| = 1$。

因此:

\boxed{\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)}

物理含义: 若原始动力学是 $p(z'|z, a)$,则在旋转后的潜空间 \hat{z} = Qz 中,动力学是 $p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)$。


引理B1(一步代价等价性)

设定:

  • \ell 是 O(n)-不变代价函数:\ell(Qz, a) = \ell(z, a)
  • h(z) = Qz 是线性可识别编码器

断言: 对任意 $z \in \mathbb{R}^n, a \in \mathcal{A}$

\ell_{\text{latent}}(Qz, a) = \ell(z, a)

其中 \ell_{\text{latent}} 是潜空间的一步代价。

证明(引理B1):

由 O(n)-不变性:$\ell(Qz, a) = \ell(z, a)$。

由定义5(推前动力学):$\hat{p}(\cdot|\hat{z}, a) = p(Q^{-1}\cdot|Q^{-1}\hat{z}, a)$。

因此,在潜空间中执行动作 a 的一步代价:

\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a)

但由 O(n)-不变性:$\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$)。

因此:

\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)

等等! 这里需要更精确的推导。让我重新表述:

设原始空间状态 $z$,潜空间状态 \hat{z} = Qz.

原始空间的代价: \ell(z, a).

潜空间中的对应状态: \hat{z} = Qz \implies z = Q^{-1}\hat{z}.

潜空间的代价: $\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a)$(由推前定义)。

但 O(n)-不变性给出: $\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$)。

因此:

\boxed{\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)}

不对! 这里混淆了原始空间和潜空间的代价函数。让我重新定义:

  • \ell(z, a) 是原始空间的一步代价
  • \hat{\ell}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a) 是潜空间的一步代价(由推前定义)

O(n)-不变性: $\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$)。

因此:

\boxed{\hat{\ell}(Qz, a) = \ell(z, a)}

引理B1证毕。 \square


引理B2(轨迹代价等价性)

设定:

  • \ell\ell_T 都是 O(n)-不变代价函数
  • h(z) = Qz 是线性可识别编码器
  • \hat{p}p 的正交推前

断言: 对任意动作序列 \pi = (a_1, \ldots, a_T) 和初始状态 $z_0$

\hat{J}(\pi; Qz_0) = J(\pi; z_0)

其中 \hat{J} 是潜空间的总期望代价,J 是原始空间的总期望代价。

证明(引理B2):

由定义:

J(\pi; z_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right]

其中 Z_t 是由 p(\cdot|z, a) 生成的随机过程。

类似地:

\hat{J}(\pi; \hat{z}_0) = \mathbb{E}\left[\sum_{t=1}^T \hat{\ell}(\hat{Z}_t, a_t) + \hat{\ell}_T(\hat{Z}_T)\bigg| \hat{Z}_0 = \hat{z}_0\right]

其中 \hat{Z}_t 是由 \hat{p}(\cdot|\hat{z}, a) 生成的随机过程。

关键观察: 设 $\hat{Z}_t = Q Z_t$,其中 Z_t 是由 p(\cdot|z, a) 生成的。

则:

\hat{Z}_t | (\hat{Z}_{t-1}, a_{t-1}) = Q Z_t | (Q Z_{t-1}, a_{t-1})

由推前定义:

\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)

因此:

\mathbb{P}(\hat{Z}_t \in d\hat{z}'|\hat{Z}_{t-1} = Q z_{t-1}, a_{t-1}) = p(Q^{-1}\hat{z}'|Q^{-1} Q z_{t-1}, a_{t-1}) d\hat{z}' = p(z'|z_{t-1}, a_{t-1}) d\hat{z}'

其中 $z' = Q^{-1}\hat{z}'$,且 $d\hat{z}' = |\det(Q)| dz' = dz'$(因为 $\det(Q) = \pm 1$)。

因此: $\hat{Z}_t = Q Z_t$(在分布意义下)是由 \hat{p} 生成的。

现在计算代价:

\hat{\ell}(\hat{Z}_t, a_t) = \ell(Q^{-1}\hat{Z}_t, a_t) = \ell(Z_t, a_t)

其中第二个等号由 O(n)-不变性($\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$)。

类似地:

\hat{\ell}_T(\hat{Z}_T) = \ell_T(Q^{-1}\hat{Z}_T, a_t) = \ell_T(Z_T)

因此:

\hat{J}(\pi; Qz_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right] = J(\pi; z_0)

引理B2证毕。 \square


§C Step C:值函数相等 + 最优策略等价性推导

定理4的证明(完整)

第1步:值函数相等。

由定义:

V^*(z_0) = \inf_{\pi} J(\pi; z_0), \quad \hat{V}^*(Qz_0) = \inf_{\pi} \hat{J}(\pi; Qz_0)

由引理B2\hat{J}(\pi; Qz_0) = J(\pi; z_0) 对所有 $\pi$。

因此:

\hat{V}^*(Qz_0) = \inf_{\pi} J(\pi; z_0) = V^*(z_0)

第2步:最优策略等价性。

由定义:

a^*_{1:T}(z_0) = \text{argmin}_{\pi} J(\pi; z_0), \quad \hat{a}^*_{1:T}(Qz_0) = \text{argmin}_{\pi} \hat{J}(\pi; Qz_0)

由引理B2\hat{J}(\pi; Qz_0) = J(\pi; z_0) 对所有 $\pi$。

因此:

\hat{a}^*_{1:T}(Qz_0) = \text{argmin}_{\pi} J(\pi; z_0) = a^*_{1:T}(z_0)

定理4证毕。 \square


§D 几何直觉与物理含义

O(n)-不变性的几何图像

O(n)-不变代价函数 \ell(z) = \phi(\|z\|_2) 只依赖于状态的径向距离,不依赖角度方向

z₂
↑     ● (0, 2) —  = φ(2)
│    ╱   ╲
│   ●     ● — ℓ = φ(1)  (球面上的所有点有相同代价)
│    ╲   ╱
└──────→ z₁

球面 = 轨道 Orb(z) = {y: ‖y‖₂ = ‖z‖₂}

正交变换 Q 的作用: 旋转球面上的点,但不改变径向距离 $|z|_2$。

因此: O(n)-不变代价函数在正交变换下保持不变:$\ell(Qz) = \phi(|Qz|_2) = \phi(|z|_2) = \ell(z)$。


转移核推前的几何图像

原始空间 z:              潜空间 ĥz = Qz:

    z₂                    ĥz₂
    ↑                      ↑
    │  p(z'|z, a)          │   p̂(ĥz'|ĥz, a)
    │  ●────────●          │   ●────────●
    └──────→ z₁             └──────→ ĥz₁

推前:p̂(ĥz'|ĥz, a) = p(Q⁻¹ĥz'|Q⁻¹ĥz, a)
     = p(z'|z, a)  (因为 Q⁻¹ĥz' = z', Q⁻¹ĥz = z

物理含义: 若原始动力学是 $p(z'|z, a)$,则在旋转后的潜空间中,动力学形式不变(只是坐标系的旋转)。

Jacobian = 1 正交变换 Q 的 Jacobian 行列式是 $\pm 1$,因此概率测度不变(保测性)。


规划等价的几何图像

原始空间 z:              潜空间 ĥz = Qz:

    z₂                    ĥz₂
    ↑                      ↑
    │  ●goal               │      ●goal' = Q·goal
    │                     │         ╱
    │    ╱                 │        ╱
    │   ●────────●         │       ●────────●
    └──────→ z₁             └──────→ ĥz₁

最优路径:start → goal(直线,代价 = ‖goal - start‖₂)
最优路径:ĥstart → ĥgoal(直线,代价 = ‖Q(goal - start)‖₂ = ‖goal - start‖₂)

关键: 正交变换 Q 保持距离不变:$|Qx|_2 = |x|_2$。

因此: 在原始空间和潜空间中,最优路径的长度(代价)完全相同!


§E 与定理1-3的关系

定理 核心结论 在规划等价性中的作用
定理1(专题III $h(z) = Qz$(正交等价) 提供线性可识别编码器的形式 h(z) = Qz
定理2(专题IV 高斯是唯一使 h(z) = Qz 的分布 说明定理1的条件是必要的(高斯是唯一使线性可识别成立的)
定理3(专题V \mathbb{E}[\|h(z) - Qz\|^2] \leq D + (\varepsilon+D)^2 给出近似情况下的误差界(鲁棒性)
定理4(本专题) $\hat{V}^(Qz_0) = V^(z_0)$(规划等价) 证明线性可识别性足以支持最优规划

定理3对定理4的推广(近似情况)

在定理1的完美条件下,h(z) = Qz 精确成立,因此规划等价性 \hat{V}^*(Qz_0) = V^*(z_0) 精确成立。

在定理3的近似条件下,$\mathbb{E}[|h(z) - Qz|^2] \leq D + (\varepsilon+D)^2$,规划等价性会有误差

近似情况下的界: 若 $h(z) = Qz + \epsilon(z)$,其中 $\mathbb{E}[|\epsilon(z)|^2] \leq \eta$$\eta = D + (\varepsilon+D)^2$),则:

|\hat{V}^*(Qz_0) - V^*(z_0)| \leq O(\sqrt{\eta})

推导: 由 Lipschitz 连续性(假设 \ell 是 $L$-Lipschitz):

|\hat{J}(\pi; Qz_0) - J(\pi; z_0)| \leq T \cdot L \cdot \sqrt{\eta}

因此:

|\hat{V}^*(Qz_0) - V^*(z_0)| \leq T \cdot L \cdot \sqrt{\eta}

其中: \eta = D + (\varepsilon+D)^2 是定理3的近似界。

物理含义: 规划等价性的误差随 \delta, \varepsilon \to 0 连续趋向零(优雅降级)。


§F Lean 4 形式化验证状态

定理4在 Planning.lean 中的形式化

组件 Lean 4 定理 状态
O(n)-不变性定义 is_orthogonal_invariant_cost 已验证
转移核推前性质 pushforward_transition_kernel 已验证
一步代价等价性 one_step_cost_equivalence 已验证
轨迹代价等价性 trajectory_cost_equivalence 已验证
值函数相等 value_function_equality 已验证
最优策略等价性 optimal_policy_equivalence 已验证

§G DMC Reacher 实验的严格复现说明

实验设置的形式化定义

环境: DeepMind Control Suite 的 Reacher 任务。

  • 状态空间(关节角度): z = (\theta_1, \theta_2) \in [0, 2\pi)^2
  • 动作空间: a = (\dot{\theta}_1, \dot{\theta}_2) \in \mathbb{R}^2
  • 动力学: 简化的二阶积分器 \theta' = \theta + \dot{\theta}\Delta t

编码器: CNN 网络 $h: \mathbb{R}^{64\times 64\times 3} \to \mathbb{R}^2$。

两种训练数据:

  1. OU 采样: $z' = \rho z + \sqrt{1-\rho^2}\eta$\eta \sim N(0, I_2)

    • 分布:$N(0, I_2)$(各向同性高斯)
    • 满足定理1条件:\mathcal{L}_{\text{align}} \approx 2(1-\rho)n
  2. RL 轨迹: 由训练好的策略生成的轨迹

    • 分布:非高斯、各向异性(依赖于奖励函数和初始状态)
    • 不满足定理1条件:\mathcal{L}_{\text{align}} \gg 2(1-\rho)n

规划任务:

  • 目标状态: $z_{\text{goal}} = (0, 0)$(关节角度为零)
  • 代价函数: $\ell(z, a) = |z|_2^2 + \lambda|a|_2^2$LQR 型代价)
  • 时域: T = 10

规划方式:

  1. Oracle(关节空间): 在真实关节空间中执行直线路径 \theta(t) = (1-t/T)\cdot \theta_0
  2. OU 编码器: 在潜空间中执行直线路径,用最近邻检索解码
  3. RL 编码器: 在潜空间中执行直线路径,用最近邻检索解码

结果(论文图3):

编码器 平均路径长度 p-value vs Oracle
Oracle(关节空间) ~1.0
OU 编码器 ~1.02 > 0.5(无显著差异)
RL 编码器 ~1.48 < 0.001(显著差异)

结论: OU 编码器(满足定理1条件)的规划质量与 Oracle 无显著差异;RL 编码器(违反假设)的规划质量显著下降。

与定理4的关系:

  • OU 编码器:$h(z) \approx Qz$(正交等价),因此 $\hat{V}^(Qz_0) \approx V^(z_0)$(规划等价)
  • RL 编码器:$h(z) \neq Qz$(非正交等价),因此 $\hat{V}^(Qz_0) \neq V^(z_0)$(规划不等价)

§H 小结与核心洞见

定理4的证明总结(三步法)

  1. O(n)-不变性: $\ell(Qz, a) = \ell(z, a)$(只依赖径向距离)
  2. 转移核推前: $\hat{p}(\cdot|\hat{z}, a) = p(Q^{-1}\cdot|Q^{-1}\hat{z}, a)$Jacobian = 1
  3. 代价等价性: $\hat{J}(\pi; Qz_0) = J(\pi; z_0)$(对所有 $\pi$
  4. 优化等价性: $\hat{V}^(Qz_0) = V^(z_0)$inf 相同)

核心洞见(一句话)

O(n)-不变代价函数只依赖径向距离 $|z|_2$,而正交变换 Q 保持径向距离不变($|Qz|_2 = |z|_2$),因此 O(n)-不变代价在正交变换下保持不变,导致规划等价性。

与定理1的关系(一句话)

定理4是定理1的应用:若 $h(z) = Qz$(正交等价),则 O(n)-不变代价函数下的规划完全等价;若 $h(z) \neq Qz$(非正交等价),则规划不等价。

与定理3的关系(一句话)

定理4在完美条件下成立;定理3给出近似条件下的误差界:$|\hat{V}^ - V^*| \leq T\cdot L\cdot\sqrt{D+(\varepsilon+D)^2}$(优雅降级)。*


➡️ 返回总览

LeJEPA 数学证明专题总览——四大定理的完整图景与核心洞见