- LeJEPA 训练需要「正样本对」——同一内容的两个视角 $(z, z')$。
- 这对视角是怎么生成的?答案是 OU 过程。
- 为什么这种生成方式,会让高阶 Hermite 成分被更强地惩罚?
- 解开它的钥匙,是 Mehler 公式。
正样本对怎么造?为什么高阶非线性成分被罚得更狠?
$\rho$ 是相关系数——两个视角的相似度旋钮。
$\rho\to1$:几乎相同视角;$\rho\to0$:相互独立。实践取 $\rho\in[0.8,0.95]$。
关键:d 阶成分的系数 = ρ 的 d 次方。
等号成立 当且仅当 $w_1=1$——编码器纯线性。
只要有任何 $w_{d_0}>0\ (d_0\ge2)$,那一项就严格变小,和够不到 $\rho$。
| 编码器 | 谱权重 | 相关性 corrᵢ | 与 0.9 的差距 |
|---|---|---|---|
| 纯线性 $h=z$ | $w_1=1$ | $0.9^1=0.900$ | 0 | 最优 |
| 纯二次 $h=z^2-1$ | $w_2=1$ | $0.9^2=0.810$ | −0.090 |
| 纯三次 $h=z^3-3z$ | $w_3=1$ | $0.9^3=0.729$ | −0.171 |
| 混合 各半 | $w_1=w_2=0.5$ | $0.855$ | −0.045 |
等号成立 当且仅当每个 $h_i$ 都是线性的。
这就是定理一的心脏:最优编码器必须线性。
非线性成分的相关性随阶数指数衰减——越高阶越吃亏。
下一讲把 Hermite 展开与 OU 衰减正式拼起来,组装成定理一的完整证明。