# 专题 VI:正交不变性与最优规划等价(定理4严格证明) > **前置知识:** [专题 I:Hermite 多项式](01_hermite_polynomials.md)、[专题 III:谱分解与线性可识别性(定理1)](03_spectral_identifiability.md)、[专题 V:近似可识别性界(定理3)](05_approximate_identifiability.md) > **目标:** 严格证明 O(n)-不变代价函数下,线性可识别性足以保证潜空间规划与真实世界规划的完全等价 --- ## §0 定理4的完整陈述与证明定位 ### 问题设定:控制问题的形式化定义 **定义1(离散时间随机控制系统):** 一个离散时间随机控制系统由以下元素组成: - 状态空间 $\mathcal{Z} = \mathbb{R}^n$(潜变量) - 动作空间 $\mathcal{A} \subseteq \mathbb{R}^m$(控制输入) - 转移核 $p(z'|z, a)$:给定当前状态 $z$ 和动作 $a$,下一时刻状态 $z'$ 的条件概率密度 - 代价函数 $\ell: \mathcal{Z} \times \mathcal{A} \to [0, \infty)$:一步代价 - 终端代价 $\ell_T: \mathcal{Z} \to [0, \infty)$:终端代价 - 时域 $T \in \mathbb{N}$:规划 horizon **定义2(策略与轨迹代价):** 给定初始状态 $z_0$,一个**开环策略** $\pi = (a_1, a_2, \ldots, a_T)$ 是动作序列。 由 $\pi$ 和 $z_0$ 生成的**轨迹** $(Z_1, Z_2, \ldots, Z_T)$ 是随机过程,满足: $$Z_t | (Z_{t-1}, a_{t-1}) \sim p(\cdot|Z_{t-1}, a_{t-1}), \quad Z_0 = z_0$$ **总期望代价:** $$J(\pi; z_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right]$$ **最优控制问题:** $$V^*(z_0) = \inf_{\pi} J(\pi; z_0), \quad a^*_{1:T}(z_0) = \text{argmin}_{\pi} J(\pi; z_0)$$ 其中 $V^*$ 是**值函数(cost-to-go)**,$a^*_{1:T}$ 是最优动作序列。 --- ### 定理4(最优规划等价性)的完整陈述 **设定:** 1. **线性可识别编码器:** $h(z) = Qz$,其中 $Q \in O(n)$ 是正交矩阵 2. **O(n)-不变代价函数:** $\ell(Qz, a) = \ell(z, a)$ 对所有 $Q \in O(n), z \in \mathcal{Z}, a \in \mathcal{A}$ 3. **潜空间动力学:** $\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)$(转移核的正交推前) **定理4断言:** 1. **值函数相等:** $\hat{V}^*(Qz_0) = V^*(z_0)$ 对所有 $z_0 \in \mathcal{Z}$ 2. **最优策略等价:** $\hat{\pi}^*(Qz_0) = \pi^*(z_0)$ 对所有 $z_0 \in \mathcal{Z}$ 其中 $\hat{V}^*$ 和 $\hat{\pi}^*$ 是潜空间控制问题的值函数和最优策略,$V^*$ 和 $\pi^*$ 是原始空间控制问题的值函数和最优策略。 --- ### 证明定位与结构 定理4是**应用性定理**:它利用定理1的线性可识别性结论 $h(z) = Qz$,结合 O(n)-不变代价函数的几何性质,证明规划等价性。 证明分为三个严格步骤: | 步骤 | 内容 | 关键工具 | |------|------|----------| | Step A | O(n)-不变性的形式化定义与基本性质 | 群作用 + 不变函数理论 | | Step B | 转移核的推前性质 + 代价等价性证明 | 变量替换 + Jacobian = 1(正交变换)| | Step C | 值函数相等 + 最优策略等价性推导 | 优化理论(inf/sup交换)| --- ## §A Step A:O(n)-不变性的形式化定义与基本性质 ### 定义3(正交群 O(n)) **正交群:** $$O(n) = \{Q \in \mathbb{R}^{n\times n}: Q^\top Q = QQ^\top = I_n\}$$ **性质:** - $Q \in O(n) \implies \|Qx\|_2 = \|x\|_2$(保距性) - $Q \in O(n) \implies \det(Q) = \pm 1$(保向性/反射) - $Q \in O(n) \implies Q^{-1} = Q^\top$(逆等于转置) - $Q \in O(n) \implies |\det(Q)| = 1$,Jacobian $= 1$(保测性) **群作用:** O(n) 在 $\mathbb{R}^n$ 上的自然作用: $$Q \cdot x = Qx, \quad Q \in O(n), x \in \mathbb{R}^n$$ **轨道:** $x$ 的轨道是 $\text{Orb}(x) = \{Qx: Q \in O(n)\} = \{y \in \mathbb{R}^n: \|y\|_2 = \|x\|_2\}$(半径为 $\|x\|_2$ 的球面)。 **不变函数:** $f: \mathbb{R}^n \to \mathbb{R}$ 是 O(n)-不变的,如果: $$f(Qx) = f(x), \quad \forall Q \in O(n), x \in \mathbb{R}^n$$ **引理A1(O(n)-不变函数的结构定理):** 设 $f: \mathbb{R}^n \to \mathbb{R}$ 是连续且 O(n)-不变的。则存在函数 $\phi: [0, \infty) \to \mathbb{R}$,使得: $$f(x) = \phi(\|x\|_2), \quad x \in \mathbb{R}^n$$ **证明(引理A1):** 对任意 $x, y \in \mathbb{R}^n$,若 $\|x\|_2 = \|y\|_2 > 0$,则存在 $Q \in O(n)$ 使得 $y = Qx$(球面上任意两点可通过正交变换映射)。 因此: $$f(x) = f(Qx) = f(y), \quad \text{当 } \|x\|_2 = \|y\|_2$$ 定义 $\phi(r) = f(x)$ 其中 $r = \|x\|_2$。这是良定义的,因为若 $\|x'\|_2 = \|x\|_2$,则 $f(x') = f(x)$。 **因此:** $$\boxed{f(x) = \phi(\|x\|_2)}$$ **引理A1证毕。** $\square$ --- ### 定义4(O(n)-不变代价函数) **一步代价 $\ell: \mathbb{R}^n \times \mathcal{A} \to [0, \infty)$ 是 O(n)-不变的,如果:** $$\ell(Qz, a) = \ell(z, a), \quad \forall Q \in O(n), z \in \mathbb{R}^n, a \in \mathcal{A}$$ **终端代价 $\ell_T: \mathbb{R}^n \to [0, \infty)$ 是 O(n)-不变的,如果:** $$\ell_T(Qz) = \ell_T(z), \quad \forall Q \in O(n), z \in \mathbb{R}^n$$ **由引理A1:** O(n)-不变代价函数具有形式: $$\ell(z, a) = \phi_\ell(\|z\|_2), \quad \ell_T(z) = \phi_T(\|z\|_2)$$ **常见例子:** - 欧氏距离到目标:$\ell(z, a) = \|z - z_{\text{goal}}\|_2^2$(若 $z_{\text{goal}} = 0$,即 $\ell(z) = \|z\|_2^2$) - LQR 代价:$\ell(z, a) = z^\top P z + a^\top R a$(若 $P = \lambda I$,即 $\ell(z) = \lambda\|z\|_2^2$) - 范数惩罚:$\ell(z) = \|z\|_2^p$ for $p \geq 1$ **非例子(不满足 O(n)-不变性):** - 坐标惩罚:$\ell(z) = z_1^2$(只惩罚第一维,旋转后变成 $(Qz)_1^2 \neq z_1^2$) - 固定方向目标:$\ell(z) = \|z - e_1\|_2^2$(目标方向固定为 $e_1 = [1, 0, \ldots, 0]^\top$) --- ## §B Step B:转移核的推前性质 + 代价等价性证明 ### 定义5(转移核的正交推前) **设定:** - 原始空间状态 $z \in \mathbb{R}^n$,转移核 $p(z'|z, a)$ - 潜空间状态 $\hat{z} = Qz \in \mathbb{R}^n$,其中 $Q \in O(n)$ - 潜空间转移核 $\hat{p}(\hat{z}'|\hat{z}, a)$ **定义5断言:** 潜空间转移核是原始转移核的**正交推前(pushforward)**: $$\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a) \cdot |\det(Q^{-1})|$$ **由于 $Q \in O(n)$:** $\det(Q) = \pm 1$,因此 $|\det(Q^{-1})| = |\det(Q^\top)| = 1$。 **因此:** $$\boxed{\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)}$$ **物理含义:** 若原始动力学是 $p(z'|z, a)$,则在旋转后的潜空间 $\hat{z} = Qz$ 中,动力学是 $p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)$。 --- ### 引理B1(一步代价等价性) **设定:** - $\ell$ 是 O(n)-不变代价函数:$\ell(Qz, a) = \ell(z, a)$ - $h(z) = Qz$ 是线性可识别编码器 **断言:** 对任意 $z \in \mathbb{R}^n, a \in \mathcal{A}$: $$\ell_{\text{latent}}(Qz, a) = \ell(z, a)$$ 其中 $\ell_{\text{latent}}$ 是潜空间的一步代价。 **证明(引理B1):** 由 O(n)-不变性:$\ell(Qz, a) = \ell(z, a)$。 由定义5(推前动力学):$\hat{p}(\cdot|\hat{z}, a) = p(Q^{-1}\cdot|Q^{-1}\hat{z}, a)$。 因此,在潜空间中执行动作 $a$ 的一步代价: $$\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a)$$ 但由 O(n)-不变性:$\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$)。 **因此:** $$\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$$ **等等!** 这里需要更精确的推导。让我重新表述: 设原始空间状态 $z$,潜空间状态 $\hat{z} = Qz$. **原始空间的代价:** $\ell(z, a)$. **潜空间中的对应状态:** $\hat{z} = Qz \implies z = Q^{-1}\hat{z}$. **潜空间的代价:** $\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a)$(由推前定义)。 **但 O(n)-不变性给出:** $\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$)。 **因此:** $$\boxed{\ell_{\text{latent}}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)}$$ **不对!** 这里混淆了原始空间和潜空间的代价函数。让我重新定义: - $\ell(z, a)$ 是原始空间的一步代价 - $\hat{\ell}(\hat{z}, a) = \ell(Q^{-1}\hat{z}, a)$ 是潜空间的一步代价(由推前定义) **O(n)-不变性:** $\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$(因为 $Q^{-1} \in O(n)$)。 **因此:** $$\boxed{\hat{\ell}(Qz, a) = \ell(z, a)}$$ **引理B1证毕。** $\square$ --- ### 引理B2(轨迹代价等价性) **设定:** - $\ell$ 和 $\ell_T$ 都是 O(n)-不变代价函数 - $h(z) = Qz$ 是线性可识别编码器 - $\hat{p}$ 是 $p$ 的正交推前 **断言:** 对任意动作序列 $\pi = (a_1, \ldots, a_T)$ 和初始状态 $z_0$: $$\hat{J}(\pi; Qz_0) = J(\pi; z_0)$$ 其中 $\hat{J}$ 是潜空间的总期望代价,$J$ 是原始空间的总期望代价。 **证明(引理B2):** 由定义: $$J(\pi; z_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right]$$ 其中 $Z_t$ 是由 $p(\cdot|z, a)$ 生成的随机过程。 类似地: $$\hat{J}(\pi; \hat{z}_0) = \mathbb{E}\left[\sum_{t=1}^T \hat{\ell}(\hat{Z}_t, a_t) + \hat{\ell}_T(\hat{Z}_T)\bigg| \hat{Z}_0 = \hat{z}_0\right]$$ 其中 $\hat{Z}_t$ 是由 $\hat{p}(\cdot|\hat{z}, a)$ 生成的随机过程。 **关键观察:** 设 $\hat{Z}_t = Q Z_t$,其中 $Z_t$ 是由 $p(\cdot|z, a)$ 生成的。 则: $$\hat{Z}_t | (\hat{Z}_{t-1}, a_{t-1}) = Q Z_t | (Q Z_{t-1}, a_{t-1})$$ 由推前定义: $$\hat{p}(\hat{z}'|\hat{z}, a) = p(Q^{-1}\hat{z}'|Q^{-1}\hat{z}, a)$$ 因此: $$\mathbb{P}(\hat{Z}_t \in d\hat{z}'|\hat{Z}_{t-1} = Q z_{t-1}, a_{t-1}) = p(Q^{-1}\hat{z}'|Q^{-1} Q z_{t-1}, a_{t-1}) d\hat{z}'$$ $$= p(z'|z_{t-1}, a_{t-1}) d\hat{z}'$$ 其中 $z' = Q^{-1}\hat{z}'$,且 $d\hat{z}' = |\det(Q)| dz' = dz'$(因为 $\det(Q) = \pm 1$)。 **因此:** $\hat{Z}_t = Q Z_t$(在分布意义下)是由 $\hat{p}$ 生成的。 **现在计算代价:** $$\hat{\ell}(\hat{Z}_t, a_t) = \ell(Q^{-1}\hat{Z}_t, a_t) = \ell(Z_t, a_t)$$ 其中第二个等号由 O(n)-不变性($\ell(Q^{-1}\hat{z}, a) = \ell(\hat{z}, a)$)。 **类似地:** $$\hat{\ell}_T(\hat{Z}_T) = \ell_T(Q^{-1}\hat{Z}_T, a_t) = \ell_T(Z_T)$$ **因此:** $$\hat{J}(\pi; Qz_0) = \mathbb{E}\left[\sum_{t=1}^T \ell(Z_t, a_t) + \ell_T(Z_T)\bigg| Z_0 = z_0\right] = J(\pi; z_0)$$ **引理B2证毕。** $\square$ --- ## §C Step C:值函数相等 + 最优策略等价性推导 ### 定理4的证明(完整) **第1步:值函数相等。** 由定义: $$V^*(z_0) = \inf_{\pi} J(\pi; z_0), \quad \hat{V}^*(Qz_0) = \inf_{\pi} \hat{J}(\pi; Qz_0)$$ 由引理B2:$\hat{J}(\pi; Qz_0) = J(\pi; z_0)$ 对所有 $\pi$。 **因此:** $$\hat{V}^*(Qz_0) = \inf_{\pi} J(\pi; z_0) = V^*(z_0)$$ **第2步:最优策略等价性。** 由定义: $$a^*_{1:T}(z_0) = \text{argmin}_{\pi} J(\pi; z_0), \quad \hat{a}^*_{1:T}(Qz_0) = \text{argmin}_{\pi} \hat{J}(\pi; Qz_0)$$ 由引理B2:$\hat{J}(\pi; Qz_0) = J(\pi; z_0)$ 对所有 $\pi$。 **因此:** $$\hat{a}^*_{1:T}(Qz_0) = \text{argmin}_{\pi} J(\pi; z_0) = a^*_{1:T}(z_0)$$ **定理4证毕。** $\square$ --- ## §D 几何直觉与物理含义 ### O(n)-不变性的几何图像 O(n)-不变代价函数 $\ell(z) = \phi(\|z\|_2)$ 只依赖于状态的**径向距离**,不依赖**角度方向**。 ``` z₂ ↑ ● (0, 2) — ℓ = φ(2) │ ╱ ╲ │ ● ● — ℓ = φ(1) (球面上的所有点有相同代价) │ ╲ ╱ └──────→ z₁ 球面 = 轨道 Orb(z) = {y: ‖y‖₂ = ‖z‖₂} ``` **正交变换 $Q$ 的作用:** 旋转球面上的点,但不改变径向距离 $\|z\|_2$。 **因此:** O(n)-不变代价函数在正交变换下保持不变:$\ell(Qz) = \phi(\|Qz\|_2) = \phi(\|z\|_2) = \ell(z)$。 --- ### 转移核推前的几何图像 ``` 原始空间 z: 潜空间 ĥz = Qz: z₂ ĥz₂ ↑ ↑ │ p(z'|z, a) │ p̂(ĥz'|ĥz, a) │ ●────────● │ ●────────● └──────→ z₁ └──────→ ĥz₁ 推前:p̂(ĥz'|ĥz, a) = p(Q⁻¹ĥz'|Q⁻¹ĥz, a) = p(z'|z, a) (因为 Q⁻¹ĥz' = z', Q⁻¹ĥz = z) ``` **物理含义:** 若原始动力学是 $p(z'|z, a)$,则在旋转后的潜空间中,动力学形式不变(只是坐标系的旋转)。 **Jacobian = 1:** 正交变换 $Q$ 的 Jacobian 行列式是 $\pm 1$,因此概率测度不变(保测性)。 --- ### 规划等价的几何图像 ``` 原始空间 z: 潜空间 ĥz = Qz: z₂ ĥz₂ ↑ ↑ │ ●goal │ ●goal' = Q·goal │ ╱ │ ╱ │ ╱ │ ╱ │ ●────────● │ ●────────● └──────→ z₁ └──────→ ĥz₁ 最优路径:start → goal(直线,代价 = ‖goal - start‖₂) 最优路径:ĥstart → ĥgoal(直线,代价 = ‖Q(goal - start)‖₂ = ‖goal - start‖₂) ``` **关键:** 正交变换 $Q$ 保持距离不变:$\|Qx\|_2 = \|x\|_2$。 **因此:** 在原始空间和潜空间中,最优路径的长度(代价)完全相同! --- ## §E 与定理1-3的关系 | 定理 | 核心结论 | 在规划等价性中的作用 | |------|----------|-------------------| | 定理1(专题III) | $h(z) = Qz$(正交等价) | 提供线性可识别编码器的形式 $h(z) = Qz$ | | 定理2(专题IV) | 高斯是唯一使 $h(z) = Qz$ 的分布 | 说明定理1的条件是必要的(高斯是唯一使线性可识别成立的) | | 定理3(专题V) | $\mathbb{E}[\|h(z) - Qz\|^2] \leq D + (\varepsilon+D)^2$ | 给出近似情况下的误差界(鲁棒性) | | **定理4(本专题)** | $\hat{V}^*(Qz_0) = V^*(z_0)$(规划等价) | 证明线性可识别性足以支持最优规划 | --- ### 定理3对定理4的推广(近似情况) 在定理1的完美条件下,$h(z) = Qz$ 精确成立,因此规划等价性 $\hat{V}^*(Qz_0) = V^*(z_0)$ 精确成立。 在定理3的近似条件下,$\mathbb{E}[\|h(z) - Qz\|^2] \leq D + (\varepsilon+D)^2$,规划等价性会有**误差**。 **近似情况下的界:** 若 $h(z) = Qz + \epsilon(z)$,其中 $\mathbb{E}[\|\epsilon(z)\|^2] \leq \eta$($\eta = D + (\varepsilon+D)^2$),则: $$|\hat{V}^*(Qz_0) - V^*(z_0)| \leq O(\sqrt{\eta})$$ **推导:** 由 Lipschitz 连续性(假设 $\ell$ 是 $L$-Lipschitz): $$|\hat{J}(\pi; Qz_0) - J(\pi; z_0)| \leq T \cdot L \cdot \sqrt{\eta}$$ **因此:** $$|\hat{V}^*(Qz_0) - V^*(z_0)| \leq T \cdot L \cdot \sqrt{\eta}$$ **其中:** $\eta = D + (\varepsilon+D)^2$ 是定理3的近似界。 **物理含义:** 规划等价性的误差随 $\delta, \varepsilon \to 0$ 连续趋向零(优雅降级)。 --- ## §F Lean 4 形式化验证状态 ### 定理4在 [`Planning.lean`](../lejepa-identifiability/lean/LeJEPA/Planning.lean) 中的形式化 | 组件 | Lean 4 定理 | 状态 | |------|-------------|------| | O(n)-不变性定义 | `is_orthogonal_invariant_cost` | ✅ 已验证 | | 转移核推前性质 | `pushforward_transition_kernel` | ✅ 已验证 | | 一步代价等价性 | `one_step_cost_equivalence` | ✅ 已验证 | | 轨迹代价等价性 | `trajectory_cost_equivalence` | ✅ 已验证 | | 值函数相等 | `value_function_equality` | ✅ 已验证 | | 最优策略等价性 | `optimal_policy_equivalence` | ✅ 已验证 | --- ## §G DMC Reacher 实验的严格复现说明 ### 实验设置的形式化定义 **环境:** DeepMind Control Suite 的 Reacher 任务。 - **状态空间(关节角度):** $z = (\theta_1, \theta_2) \in [0, 2\pi)^2$ - **动作空间:** $a = (\dot{\theta}_1, \dot{\theta}_2) \in \mathbb{R}^2$ - **动力学:** 简化的二阶积分器 $\theta' = \theta + \dot{\theta}\Delta t$ **编码器:** CNN 网络 $h: \mathbb{R}^{64\times 64\times 3} \to \mathbb{R}^2$。 **两种训练数据:** 1. **OU 采样:** $z' = \rho z + \sqrt{1-\rho^2}\eta$,$\eta \sim N(0, I_2)$ - 分布:$N(0, I_2)$(各向同性高斯) - 满足定理1条件:$\mathcal{L}_{\text{align}} \approx 2(1-\rho)n$ 2. **RL 轨迹:** 由训练好的策略生成的轨迹 - 分布:非高斯、各向异性(依赖于奖励函数和初始状态) - 不满足定理1条件:$\mathcal{L}_{\text{align}} \gg 2(1-\rho)n$ **规划任务:** - **目标状态:** $z_{\text{goal}} = (0, 0)$(关节角度为零) - **代价函数:** $\ell(z, a) = \|z\|_2^2 + \lambda\|a\|_2^2$(LQR 型代价) - **时域:** $T = 10$ **规划方式:** 1. **Oracle(关节空间):** 在真实关节空间中执行直线路径 $\theta(t) = (1-t/T)\cdot \theta_0$ 2. **OU 编码器:** 在潜空间中执行直线路径,用最近邻检索解码 3. **RL 编码器:** 在潜空间中执行直线路径,用最近邻检索解码 **结果(论文图3):** | 编码器 | 平均路径长度 | p-value vs Oracle | |--------|-------------|-------------------| | Oracle(关节空间) | ~1.0 | — | | OU 编码器 | ~1.02 | > 0.5(无显著差异)| | RL 编码器 | ~1.48 | < 0.001(显著差异)| **结论:** OU 编码器(满足定理1条件)的规划质量与 Oracle 无显著差异;RL 编码器(违反假设)的规划质量显著下降。 **与定理4的关系:** - OU 编码器:$h(z) \approx Qz$(正交等价),因此 $\hat{V}^*(Qz_0) \approx V^*(z_0)$(规划等价) - RL 编码器:$h(z) \neq Qz$(非正交等价),因此 $\hat{V}^*(Qz_0) \neq V^*(z_0)$(规划不等价) --- ## §H 小结与核心洞见 ### 定理4的证明总结(三步法) 1. **O(n)-不变性:** $\ell(Qz, a) = \ell(z, a)$(只依赖径向距离) 2. **转移核推前:** $\hat{p}(\cdot|\hat{z}, a) = p(Q^{-1}\cdot|Q^{-1}\hat{z}, a)$(Jacobian = 1) 3. **代价等价性:** $\hat{J}(\pi; Qz_0) = J(\pi; z_0)$(对所有 $\pi$) 4. **优化等价性:** $\hat{V}^*(Qz_0) = V^*(z_0)$(inf 相同) ### 核心洞见(一句话) **O(n)-不变代价函数只依赖径向距离 $\|z\|_2$,而正交变换 $Q$ 保持径向距离不变($\|Qz\|_2 = \|z\|_2$),因此 O(n)-不变代价在正交变换下保持不变,导致规划等价性。** ### 与定理1的关系(一句话) **定理4是定理1的应用:若 $h(z) = Qz$(正交等价),则 O(n)-不变代价函数下的规划完全等价;若 $h(z) \neq Qz$(非正交等价),则规划不等价。** ### 与定理3的关系(一句话) **定理4在完美条件下成立;定理3给出近似条件下的误差界:$|\hat{V}^* - V^*| \leq T\cdot L\cdot\sqrt{D+(\varepsilon+D)^2}$(优雅降级)。** --- ## ➡️ 返回总览 → [LeJEPA 数学证明专题总览](README.md)——四大定理的完整图景与核心洞见