Files
worldmodel/research/multiply/连续非Token模型_空间与时间_综述.md

18 KiB
Raw Permalink Blame History

连续(非 Token)模型:面向空间与时间的模型与理论

主题:不把世界切成离散 token / 网格,而是用连续函数 / 连续动力学来建模——尤其针对空间时间。 覆盖四大家族:① 连续空间表示(神经场)② 连续时间动力学(Neural ODE 族)③ 算子学习 / 物理时空(Neural Operator)④ 非 Token 预测架构 / 世界模型(JEPA 族)。 面向研究者;与本目录 world-model / 具身 / 多感官研究相呼应。


1. 动机:为什么要"非 Token、连续"

主流大模型(Transformer/LLM)的范式是离散化:把图像切 patch、把序列切 token、把空间切体素网格,再在离散符号上做注意力。这种"tokenization"在语言上极成功,但对**连续的物理世界(空间几何、时间演化)**有几处先天不适:

  • 分辨率受限 / 网格伪影:体素/像素网格的精度被离散步长锁死,内存随分辨率立方增长。
  • 丢失连续性与导数:物理信号常以微分方程定义,token 化难以表达"在任意点的值及其空间/时间导数"。
  • 不规则采样难处理:真实传感器是异步、非均匀采样的,离散步进模型(RNN/Transformer)天然假设等间隔。
  • 重建无关细节的浪费:像素级生成式模型被迫预测大量与任务无关的高频细节。

连续模型的共同主张:用一个神经网络去参数化一个连续对象——空间上的场 f(x)、时间上的轨迹 dz/dt = f(z,t)、函数空间之间的算子 G: a(·)↦u(·)、或抽象潜在空间里的预测。由此获得分辨率无关、可微(可取导数)、能处理不规则采样、可嵌入物理先验等好处。

一句话:Token 把世界离散成符号;连续模型把世界参数化成函数与流。


2. 总览:四大家族一张图

                    "用神经网络参数化一个连续对象"
   ┌──────────────┬───────────────┬────────────────┬──────────────────┐
   │ ① 连续空间   │ ② 连续时间    │ ③ 算子学习      │ ④ 非Token预测     │
   │   神经场      │   动力学       │   /物理时空      │   /世界模型        │
   │ f(x)=值       │ dz/dt=f(z,t)  │ G:a(·)↦u(·)     │ 在潜在空间预测     │
   │ NeRF/SIREN   │ Neural ODE    │ FNO/DeepONet   │ JEPA/V-JEPA2      │
   │ DeepSDF/GS   │ CDE/SDE/LTC   │ PINN/算子      │ DINO-WM           │
   │ 空间连续      │ 时间连续       │ 函数空间连续     │ 表示空间连续        │
   └──────────────┴───────────────┴────────────────┴──────────────────┘

四者的"连续"作用在不同对象上:①空间坐标 → ②时间 → ③整个函数(输入/输出都是函数)→ ④抽象表示空间。下面逐一展开。


3. 家族一:连续空间表示 / 神经场(Neural Fields / INR

核心思想:用一个 MLP 把连续坐标映射到信号值——f_θ(x, y, z, [方向/时间]) → (颜色/密度/占据/距离…)。物体/场景不再存成网格,而是存成"网络权重",可在任意分辨率查询。

代表工作:

  • Occupancy NetworksCVPR 20191812.03828):把形状表示为连续占据概率函数 o(x)∈[0,1],无限分辨率、内存友好。
  • DeepSDFCVPR 20191901.05103):学习连续有符号距离函数(SDF,零等值面即表面;用 latent code 表示一整类形状。
  • SIRENNeurIPS 20202006.09661):用周期激活函数(sin的 MLP 表示连续可微信号,关键性质是任意阶导数仍是 SIREN(sin 的导数是 cos),因此特别适合表示信号的空间/时间导数、求解 Eikonal/Poisson/Helmholtz/波动等 PDE。
  • NeRFECCV 20202003.08934):把 3D 场景表示为连续辐射场 (x,方向)→(颜色,密度),配可微体渲染做新视角合成;引爆了"神经场"研究。
  • 3D Gaussian SplattingSIGGRAPH 20232308.04079):把场景表示为一堆各向异性 3D 高斯(显式、可栅格化),实时渲染。它保留了连续体积辐射场的优良性质,却用显式基元规避空白区计算——是"连续 vs 显式"张力的代表性折中。
  • 动态/4D 扩展:把空间场再加时间轴。如 D-NeRF2011.13961)用形变场建模动态场景;NeRFPlayer2210.15947)按静态/形变/新增区域分解 4D 时空;4D Gaussian SplattingCVPR 2024)把 3DGS 扩到动态。

与本目录研究的连接:ObjectFolder(多感官物体数据集,见《多感官…综述》)正是用隐式神经场VisionNet/AudioNet/TouchNet)表示视/听/触——它就是"神经场 + 多感官"的典范。


4. 家族二:连续时间动力学(Neural ODE 族)

核心思想:不再堆叠离散层 / 离散时间步,而是把隐状态的演化写成微分方程,用 ODE 求解器积分——深度/时间变成连续变量

代表工作:

  • Neural ODENeurIPS 20181806.07366):把隐状态导数参数化为网络 dh/dt = f_θ(h,t),用黑盒 ODE 求解器前向、**伴随法(adjoint)**反传;常数内存、可在精度与速度间权衡。是"连续深度"的奠基。
  • Latent ODE / ODE-RNNNeurIPS 20191907.03907):编码器(RNN/GRU)得初始潜状态,再用 Neural ODE 在潜空间演化——天然处理不规则采样时间序列,可在任意时刻插值/预测。
  • Neural CDENeurIPS 20202005.08926):Neural ODE 的解只由初值决定、无法吸收后续观测;CDE 用"受控微分方程"让轨迹持续响应到来的数据流,是"连续时间 RNN",擅长部分观测/不规则多元时间序列。
  • Neural SDE:加入随机项,做生成式建模与不确定性量化。
  • Liquid Time-Constant NetworksLTCAAAI 20212006.04439):连续时间、时间常数可变的 ODE-RNN,稳定有界、表达力强,时间序列预测表现好。
  • CfCClosed-form Continuous-time2106.13898):给出 LTC 的闭式解无需 ODE 求解器即可推理,大幅提速;训练好的 LTC 可"编译"为 CfC。
  • S4 / 结构化状态空间ICLR 20222111.00396):底层是连续时间状态空间模型 dx/dt=Ax+Bu, y=Cx+Du,再离散化;以低秩修正稳定对角化高效计算,擅长超长程依赖(首个攻克 Path-X 16k)。其后继 Mamba 引入选择性机制——可视为"连续时间 SSM"到现代序列模型的桥梁。

直觉:ResNet 是 Neural ODE 的离散欧拉近似;RNN 是连续时间动力学的离散采样。连续时间模型把这些"步数"还给了微积分。


5. 家族三:算子学习 / 物理时空(Neural Operators

核心思想:前两家族学的是"函数"(坐标→值)或"轨迹",而算子学习直接学函数到函数的映射(无穷维 → 无穷维),即 PDE 的解算子 G: 参数/初值/边界函数 a(·) ↦ 解函数 u(·)。关键性质是离散无关(mesh-independent:训练后可在任意网格/分辨率上评估,零样本超分辨。

代表工作:

  • PINN(物理信息神经网络)Raissi 等 20171711.10561JCP 2019):把 PDE 残差作为损失约束,让网络在满足数据的同时遵守物理定律;分连续时间与离散时间两类。局限:换参数/初值要重训(学的是"某一个解"而非"算子")。
  • DeepONet1910.03193Nature MI 2021):基于算子万能逼近定理,用 **branch 网(编码输入函数在传感点的采样)+ trunk 网(编码输出位置)**学非线性算子;可一次学一族 PDE。
  • FNO(傅里叶神经算子)ICLR 20212010.08895):把积分核直接在傅里叶空间参数化(FFT→低频模态线性变换→逆 FFT),高效捕捉非局部相关;首个零样本超分辨建模湍流,比传统求解器快达三个数量级。FNO-3D 直接在"空间×时间"上做卷积。
  • 变体生态Geo-FNO2207.05209,复杂几何)、Graph/Multipole Neural Operator、L-DeepONet(潜空间)、通用 Neural Operator 理论框架等。

与本目录的连接:算子学习是可微物理仿真 / 世界模型的"物理引擎"候选——比如把流体/接触动力学学成一个快速可微算子,正好契合具身世界模型对"快而准的动力学预测"的需求。


6. 家族四:非 Token 预测架构 / 世界模型(JEPA 族)

核心思想:不在像素/token 层面重建,而是在抽象表示(潜在)空间里做预测——预测"被遮挡/未来部分的表示",从而聚焦高层本质、忽略不可预测的无关细节。这是 LeCun 对"自主机器智能"的核心主张。

代表工作:

  • LeCun《A Path Towards Autonomous Machine Intelligence》2022,立场论文):提出以世界模型为核心的认知架构蓝图,JEPA 作为其世界模型模块;理论上可视为在表示空间上的能量模型(EBM
  • I-JEPACVPR 20232301.08243):图像版——从可见 patch 的表示预测被遮挡区域的表示(而非像素);高效且表征强(632M ViT16×A100<72hImageNet 低样本 SOTA)。
  • V-JEPA(2024):视频版,特征预测学习视频表示。
  • V-JEPA 220252506.09985):在 >100 万小时视频上自监督预训练动作无关的视频世界模型,再用极少机器人交互数据(<62h Droid)训练动作条件预测器 V-JEPA 2-AC,在 MPC 框架下做零样本机器人规划(抓取/搬运成功率显著超过 VLA 基线 Octo)。这是 JEPA 从"表示学习"走向"可规划世界模型"的关键一步。
  • DINO-WMICML 20252411.04983):在 DINOv2 预训练 patch 特征的连续潜空间里建模动态、预测未来潜表示(不重建像素),用 CEM 做零样本规划;在迷宫/推物等任务零样本求解。
  • seq-JEPA2505.03176):把 JEPA 与序列处理归纳偏置结合,同时学等变与不变表示。

注意:JEPA 的"连续"指的是在连续/稠密的表示空间里预测(非离散 token、非像素重建),与前三家族的"空间/时间连续"是不同维度上的"非 Token"。它与具身世界模型(V-JEPA 2、DINO-WM)直接相关。

相关的连续生成线Flow MatchingICLR 20232210.02747)用连续归一化流(CNF)学连续概率路径的向量场,是扩散的连续时间推广——常作为连续潜在世界模型/生成式动力学的训练工具。


7. 理论主线:四家族其实在说同一件事

把四者放在一起,能看到一条统一线索——把"离散堆叠/网格"替换为"连续数学对象 + 神经参数化"

  • 微分方程视角ResNet ≈ Neural ODE 的离散欧拉步;RNN ≈ 连续时间动力学的采样;S4/Mamba 底层是连续时间 SSM 的离散化。深度与时间都可连续化
  • 函数 / 场视角:神经场把"信号"看成坐标的连续函数;算子学习把"映射"看成函数空间之间的连续算子。SIREN 既是神经场又能解 PDE,正好是家族①与③的交汇
  • 物理先验视角PINN 把 PDE 写进损失;FNO/DeepONet 把 PDE 解算子学出来;SIREN/神经场天然可微以满足 PDE——三者都在让网络尊重连续物理
  • 预测目标视角JEPA 把"预测"从像素/token 移到连续表示空间——用连续表示而非离散符号做世界建模
  • 可微性这条暗线:连续 ⇒ 可取导数 ⇒ 可做梯度规划、可嵌物理约束、可微仿真。这是它们对世界模型 / 控制 / 科学计算特别有吸引力的根本原因。

8. 与你的研究(world model / 具身 / 多感官)的关系

  • 连续世界模型已成主流候选V-JEPA 2、DINO-WM 证明"在连续潜空间预测 + 规划"可做零样本机器人控制——这正是 MultiPLY 式具身智能体可借鉴的"非 token、可规划"路线。
  • 神经场 = 多感官物体的连续容器ObjectFolder 的隐式神经表示就是神经场;超声/触觉/声场都可用连续场建模(连续而非逐点采样)。
  • 连续时间 = 多模态异步融合的天然工具:视/触/听/超声采样率不同、异步到达,Neural CDE/Latent ODE 能在连续时间轴上对齐与融合不规则采样的多感官流。
  • 算子学习 = 具身世界模型的物理引擎:接触动力学、声波传播(超声/撞击声)都可学成可微算子,用于快速预测与规划。
  • 可微贯穿全栈:连续表示让"感知→预测→规划"可端到端求导,契合具身闭环。

9. 连续 vs Token:权衡与开放问题

连续模型的优势:分辨率无关、可微、可取导数、处理不规则采样、嵌入物理先验、表示紧凑、避免重建无关细节。

代价与开放问题

  • 训练/推理成本:ODE 求解器慢(CfC 用闭式解缓解);神经场逐场景优化慢(GS 用显式基元加速)。
  • 可扩展性与工程生态Token/Transformer 有成熟的硬件与扩展规律(scaling laws),连续模型的大规模扩展与稳定训练仍在早期(JEPA 易表示坍塌、需 EMA/复杂损失)。
  • 离散 vs 连续的回摆3D Gaussian Splatting(显式)反超 NeRF(隐式连续)、Mamba(离散选择性)源自连续 SSM——说明"纯连续"并非总最优,**混合(连续性质 + 显式/离散效率)**往往胜出。
  • 理论保证:算子学习有逼近定理,但连续世界模型的可规划性、泛化、稳定性理论仍不完善。
  • 统一框架缺失:四家族目前各自为政,缺一个把"空间连续 + 时间连续 + 函数空间 + 表示预测"统一起来的框架。

10. 论文与资源清单

① 连续空间表示 / 神经场

② 连续时间动力学

③ 算子学习 / 物理时空

④ 非 Token 预测架构 / 世界模型


来源(Sources