96 lines
7.1 KiB
Markdown
96 lines
7.1 KiB
Markdown
# OU 过程与 Mehler 公式:为什么高阶成分被罚得更狠(播客文字稿)
|
|
|
|
> 来源文档:[`JEPA/math/02_ou_process_mehler.md`](../../../JEPA/math/02_ou_process_mehler.md)
|
|
> 形式:双主播(男 / 女)对话讲解,约 8 分钟
|
|
> 配套脚本:[`ou_mehler-script.json`](ou_mehler-script.json)
|
|
|
|
---
|
|
|
|
**男主播:** Hello Deer!欢迎回来。上一期我们聊了 Hermite 多项式,留了个尾巴——相关性为什么会按阶数指数衰减。今天就来把这个坑填上。
|
|
|
|
**女主播:** 对,上次最后那个悬念我一直惦记着。今天的主角是两个名字,OU 过程和 Mehler 公式。先说说,它们是用来干嘛的?
|
|
|
|
**男主播:** LeJEPA 训练时需要正样本对,也就是同一个内容的两个视角。问题是:这两个视角是怎么造出来的?为什么这种造法会让高阶的非线性成分被惩罚得更重?
|
|
|
|
**女主播:** 造正样本对的办法,就是 OU 过程,全名奥恩斯坦-乌伦贝克过程。这名字有点吓人,但物理图像其实很可爱对吧?
|
|
|
|
**男主播:** 非常可爱。你就想象一个小球,被一根弹簧拴在原点。弹簧一直想把它拉回中心,这叫均值回归;同时周围有随机的小扰动在推它,像布朗运动。
|
|
|
|
**女主播:** 所以小球既被往回拉、又被随机推。这一拉一推的拉扯,就是 OU 过程。那它在 LeJEPA 里具体长什么样?
|
|
|
|
**男主播:** 论文用的是离散版本,一步到位:新的视角 z 撇,等于 ρ 乘以原来的 z,再加上根号下一减 ρ 平方,乘一个全新的高斯噪声。
|
|
|
|
**女主播:** 这里的 ρ 是关键,介于零和一之间。它就是上一期我们叫的相关强度,对吧?
|
|
|
|
**男主播:** 正是。ρ 越接近一,新视角就越像原来的;ρ 越接近零,两个视角就越不相关。实践里一般取零点八到零点九五之间。
|
|
|
|
**女主播:** 明白。那这个造法有几个很妙的性质,我们一个个说。第一个是平稳性?
|
|
|
|
**男主播:** 对。如果原来的 z 服从标准高斯,那么造出来的 z 撇也服从同一个标准高斯。算一下就知道:均值还是零,方差还是一,因为 ρ 平方加上一减 ρ 平方正好等于一。
|
|
|
|
**女主播:** 漂亮,造完之后分布纹丝不动。这意味着两个视角是平起平坐的,没有谁更特殊。第二个性质呢?
|
|
|
|
**男主播:** 第二个是相关性可控。两个视角的协方差正好等于 ρ。所以 ρ 就像一个旋钮,你拧大它两个视角就更像,拧小就更不像,完全在你掌控之中。
|
|
|
|
**女主播:** 一个旋钮控制相似度,这设计真干净。第三个性质?
|
|
|
|
**男主播:** 第三个叫加性噪声。整个转移可以拆成两块:一块是线性漂移 ρ 乘 z,另一块是独立的噪声。干净的线性加噪声结构,正好满足论文要的假设。
|
|
|
|
**女主播:** 好,三个性质都很温和。那真正的硬核来了——Mehler 公式。它到底说了什么?
|
|
|
|
**男主播:** Mehler 公式是 OU 过程的谱定理。一句话说:它把 OU 过程的转移规律,在 Hermite 这套积木的基底下展开了,而且每一阶积木前面的系数,正好是 ρ 的那一阶次方。
|
|
|
|
**女主播:** 等等,让我抓住重点:d 阶的 Hermite 成分,前面挂的系数是 ρ 的 d 次方?
|
|
|
|
**男主播:** 完全正确。这就是全部魔法的来源。把它用到编码器的某个分量上,就得到一个特别干净的式子:两个视角在这个分量上的相关性,等于各阶谱权重乘以 ρ 的对应次方,再全部加起来。
|
|
|
|
**女主播:** 谱权重我们上期讲过,就是那张能量饼图里每一阶占的比例。那现在把这个和数跟 ρ 比一比,会怎样?
|
|
|
|
**男主播:** 这就是核心推论。因为每一项里 ρ 的 d 次方都小于等于 ρ 本身——d 至少是一嘛——所以整个加权和一定小于等于 ρ。而所有权重加起来是一,所以上界恰好就是 ρ。
|
|
|
|
**女主播:** 所以相关性最多就是 ρ,封顶了。那什么时候能正好取到这个上限?
|
|
|
|
**男主播:** 只有一种情况:全部权重都压在一阶上,也就是编码器是纯线性的。只要有任何一个二阶或更高阶的权重大于零,那一项就会严格变小,整个和就够不到 ρ 了。
|
|
|
|
**女主播:** 所以等号成立,当且仅当纯线性。这个当且仅当太关键了。我们来点具体数字找找感觉?
|
|
|
|
**男主播:** 好。取 ρ 等于零点九。纯线性编码器,相关性就是零点九的一次方,等于零点九,完美顶到上限。
|
|
|
|
**女主播:** 纯二次的呢?
|
|
|
|
**男主播:** 纯二次,相关性是零点九的平方,等于零点八一,已经掉了零点零九。纯三次是零点九的三次方,约零点七三,掉得更多。
|
|
|
|
**女主播:** 那要是一半线性、一半二次的混合呢?
|
|
|
|
**男主播:** 混合的就是两者加权平均,零点五乘零点九加零点五乘零点八一,约等于零点八五五。介于两者之间,但仍然够不到零点九。结论很清楚:非线性成分越多,相关性越低。
|
|
|
|
**女主播:** 数字一摆,趋势一目了然。那这跟 LeJEPA 真正要优化的目标,是怎么挂上钩的?
|
|
|
|
**男主播:** LeJEPA 的对齐损失,本质是让两个视角的表示尽量接近,写开之后就等于一个常数减去所有分量相关性的总和。所以最小化损失,就等价于最大化相关性总和。
|
|
|
|
**女主播:** 而我们刚证明了每个相关性最多是 ρ……
|
|
|
|
**男主播:** 对,所以对齐损失有一个下界,正比于一减 ρ。而这个最好的下界,当且仅当每一个编码器分量都是线性的时候才能达到。
|
|
|
|
**女主播:** 于是结论就水落石出了:最优编码器必须是线性的。这正是定理一的心脏。
|
|
|
|
**男主播:** 一点没错。我们再用一张画面感的图收一下尾:ρ 等于零点九时,一阶零点九、二阶零点八一、三阶零点七三、四阶零点六六、五阶零点五九,像一排越来越短的条。
|
|
|
|
**女主播:** 非线性成分的相关性随阶数指数往下掉,越高阶越吃亏。这画面我记住了。我们把今天五个要点串一下?
|
|
|
|
**男主播:** 第一,OU 过程用一拉一推的方式造正样本对,相似度由 ρ 这个旋钮控制。
|
|
|
|
**女主播:** 第二,平稳性保证两个视角分布相同;相关性恰好是 ρ;结构是线性漂移加独立噪声。
|
|
|
|
**男主播:** 第三,Mehler 公式说,d 阶 Hermite 成分的相关性是 ρ 的 d 次方。
|
|
|
|
**女主播:** 第四,核心不等式:相关性等于各阶权重乘 ρ 的对应次方之和,最多到 ρ,等号当且仅当纯线性。
|
|
|
|
**男主播:** 第五,因此最小化对齐损失就是最大化相关性,逼着编码器学成线性——这就是定理一。
|
|
|
|
**女主播:** 完美闭环。下一站去哪?
|
|
|
|
**男主播:** 下一讲我们把 Hermite 展开和今天的 OU 衰减正式拼起来,组装成定理一的完整证明,叫谱分解与线性可识别性。
|
|
|
|
**女主播:** 好,那我们下期见。谢谢大家收听,记得,弹簧拉小球,ρ 拧大小——我们下次接着拆。拜拜!
|