18 KiB
连续(非 Token)模型:面向空间与时间的模型与理论
主题:不把世界切成离散 token / 网格,而是用连续函数 / 连续动力学来建模——尤其针对空间与时间。 覆盖四大家族:① 连续空间表示(神经场)② 连续时间动力学(Neural ODE 族)③ 算子学习 / 物理时空(Neural Operator)④ 非 Token 预测架构 / 世界模型(JEPA 族)。 面向研究者;与本目录 world-model / 具身 / 多感官研究相呼应。
1. 动机:为什么要"非 Token、连续"
主流大模型(Transformer/LLM)的范式是离散化:把图像切 patch、把序列切 token、把空间切体素网格,再在离散符号上做注意力。这种"tokenization"在语言上极成功,但对**连续的物理世界(空间几何、时间演化)**有几处先天不适:
- 分辨率受限 / 网格伪影:体素/像素网格的精度被离散步长锁死,内存随分辨率立方增长。
- 丢失连续性与导数:物理信号常以微分方程定义,token 化难以表达"在任意点的值及其空间/时间导数"。
- 不规则采样难处理:真实传感器是异步、非均匀采样的,离散步进模型(RNN/Transformer)天然假设等间隔。
- 重建无关细节的浪费:像素级生成式模型被迫预测大量与任务无关的高频细节。
连续模型的共同主张:用一个神经网络去参数化一个连续对象——空间上的场 f(x)、时间上的轨迹 dz/dt = f(z,t)、函数空间之间的算子 G: a(·)↦u(·)、或抽象潜在空间里的预测。由此获得分辨率无关、可微(可取导数)、能处理不规则采样、可嵌入物理先验等好处。
一句话:Token 把世界离散成符号;连续模型把世界参数化成函数与流。
2. 总览:四大家族一张图
"用神经网络参数化一个连续对象"
┌──────────────┬───────────────┬────────────────┬──────────────────┐
│ ① 连续空间 │ ② 连续时间 │ ③ 算子学习 │ ④ 非Token预测 │
│ 神经场 │ 动力学 │ /物理时空 │ /世界模型 │
│ f(x)=值 │ dz/dt=f(z,t) │ G:a(·)↦u(·) │ 在潜在空间预测 │
│ NeRF/SIREN │ Neural ODE │ FNO/DeepONet │ JEPA/V-JEPA2 │
│ DeepSDF/GS │ CDE/SDE/LTC │ PINN/算子 │ DINO-WM │
│ 空间连续 │ 时间连续 │ 函数空间连续 │ 表示空间连续 │
└──────────────┴───────────────┴────────────────┴──────────────────┘
四者的"连续"作用在不同对象上:①空间坐标 → ②时间 → ③整个函数(输入/输出都是函数)→ ④抽象表示空间。下面逐一展开。
3. 家族一:连续空间表示 / 神经场(Neural Fields / INR)
核心思想:用一个 MLP 把连续坐标映射到信号值——f_θ(x, y, z, [方向/时间]) → (颜色/密度/占据/距离…)。物体/场景不再存成网格,而是存成"网络权重",可在任意分辨率查询。
代表工作:
- Occupancy Networks(CVPR 2019,1812.03828):把形状表示为连续占据概率函数
o(x)∈[0,1],无限分辨率、内存友好。 - DeepSDF(CVPR 2019,1901.05103):学习连续有符号距离函数(SDF),零等值面即表面;用 latent code 表示一整类形状。
- SIREN(NeurIPS 2020,2006.09661):用周期激活函数(sin)的 MLP 表示连续可微信号,关键性质是任意阶导数仍是 SIREN(sin 的导数是 cos),因此特别适合表示信号的空间/时间导数、求解 Eikonal/Poisson/Helmholtz/波动等 PDE。
- NeRF(ECCV 2020,2003.08934):把 3D 场景表示为连续辐射场
(x,方向)→(颜色,密度),配可微体渲染做新视角合成;引爆了"神经场"研究。 - 3D Gaussian Splatting(SIGGRAPH 2023,2308.04079):把场景表示为一堆各向异性 3D 高斯(显式、可栅格化),实时渲染。它保留了连续体积辐射场的优良性质,却用显式基元规避空白区计算——是"连续 vs 显式"张力的代表性折中。
- 动态/4D 扩展:把空间场再加时间轴。如 D-NeRF(2011.13961)用形变场建模动态场景;NeRFPlayer(2210.15947)按静态/形变/新增区域分解 4D 时空;4D Gaussian Splatting(CVPR 2024)把 3DGS 扩到动态。
与本目录研究的连接:ObjectFolder(多感官物体数据集,见《多感官…综述》)正是用隐式神经场(VisionNet/AudioNet/TouchNet)表示视/听/触——它就是"神经场 + 多感官"的典范。
4. 家族二:连续时间动力学(Neural ODE 族)
核心思想:不再堆叠离散层 / 离散时间步,而是把隐状态的演化写成微分方程,用 ODE 求解器积分——深度/时间变成连续变量。
代表工作:
- Neural ODE(NeurIPS 2018,1806.07366):把隐状态导数参数化为网络
dh/dt = f_θ(h,t),用黑盒 ODE 求解器前向、**伴随法(adjoint)**反传;常数内存、可在精度与速度间权衡。是"连续深度"的奠基。 - Latent ODE / ODE-RNN(NeurIPS 2019,1907.03907):编码器(RNN/GRU)得初始潜状态,再用 Neural ODE 在潜空间演化——天然处理不规则采样时间序列,可在任意时刻插值/预测。
- Neural CDE(NeurIPS 2020,2005.08926):Neural ODE 的解只由初值决定、无法吸收后续观测;CDE 用"受控微分方程"让轨迹持续响应到来的数据流,是"连续时间 RNN",擅长部分观测/不规则多元时间序列。
- Neural SDE:加入随机项,做生成式建模与不确定性量化。
- Liquid Time-Constant Networks(LTC)(AAAI 2021,2006.04439):连续时间、时间常数可变的 ODE-RNN,稳定有界、表达力强,时间序列预测表现好。
- CfC(Closed-form Continuous-time)(2106.13898):给出 LTC 的闭式解,无需 ODE 求解器即可推理,大幅提速;训练好的 LTC 可"编译"为 CfC。
- S4 / 结构化状态空间(ICLR 2022,2111.00396):底层是连续时间状态空间模型
dx/dt=Ax+Bu, y=Cx+Du,再离散化;以低秩修正稳定对角化高效计算,擅长超长程依赖(首个攻克 Path-X 16k)。其后继 Mamba 引入选择性机制——可视为"连续时间 SSM"到现代序列模型的桥梁。
直觉:ResNet 是 Neural ODE 的离散欧拉近似;RNN 是连续时间动力学的离散采样。连续时间模型把这些"步数"还给了微积分。
5. 家族三:算子学习 / 物理时空(Neural Operators)
核心思想:前两家族学的是"函数"(坐标→值)或"轨迹",而算子学习直接学函数到函数的映射(无穷维 → 无穷维),即 PDE 的解算子 G: 参数/初值/边界函数 a(·) ↦ 解函数 u(·)。关键性质是离散无关(mesh-independent):训练后可在任意网格/分辨率上评估,零样本超分辨。
代表工作:
- PINN(物理信息神经网络)(Raissi 等 2017,1711.10561;JCP 2019):把 PDE 残差作为损失约束,让网络在满足数据的同时遵守物理定律;分连续时间与离散时间两类。局限:换参数/初值要重训(学的是"某一个解"而非"算子")。
- DeepONet(1910.03193;Nature MI 2021):基于算子万能逼近定理,用 **branch 网(编码输入函数在传感点的采样)+ trunk 网(编码输出位置)**学非线性算子;可一次学一族 PDE。
- FNO(傅里叶神经算子)(ICLR 2021,2010.08895):把积分核直接在傅里叶空间参数化(FFT→低频模态线性变换→逆 FFT),高效捕捉非局部相关;首个零样本超分辨建模湍流,比传统求解器快达三个数量级。FNO-3D 直接在"空间×时间"上做卷积。
- 变体生态:Geo-FNO(2207.05209,复杂几何)、Graph/Multipole Neural Operator、L-DeepONet(潜空间)、通用 Neural Operator 理论框架等。
与本目录的连接:算子学习是可微物理仿真 / 世界模型的"物理引擎"候选——比如把流体/接触动力学学成一个快速可微算子,正好契合具身世界模型对"快而准的动力学预测"的需求。
6. 家族四:非 Token 预测架构 / 世界模型(JEPA 族)
核心思想:不在像素/token 层面重建,而是在抽象表示(潜在)空间里做预测——预测"被遮挡/未来部分的表示",从而聚焦高层本质、忽略不可预测的无关细节。这是 LeCun 对"自主机器智能"的核心主张。
代表工作:
- LeCun《A Path Towards Autonomous Machine Intelligence》(2022,立场论文):提出以世界模型为核心的认知架构蓝图,JEPA 作为其世界模型模块;理论上可视为在表示空间上的能量模型(EBM)。
- I-JEPA(CVPR 2023,2301.08243):图像版——从可见 patch 的表示预测被遮挡区域的表示(而非像素);高效且表征强(632M ViT,16×A100,<72h,ImageNet 低样本 SOTA)。
- V-JEPA(2024):视频版,特征预测学习视频表示。
- V-JEPA 2(2025,2506.09985):在 >100 万小时视频上自监督预训练动作无关的视频世界模型,再用极少机器人交互数据(<62h Droid)训练动作条件预测器 V-JEPA 2-AC,在 MPC 框架下做零样本机器人规划(抓取/搬运成功率显著超过 VLA 基线 Octo)。这是 JEPA 从"表示学习"走向"可规划世界模型"的关键一步。
- DINO-WM(ICML 2025,2411.04983):在 DINOv2 预训练 patch 特征的连续潜空间里建模动态、预测未来潜表示(不重建像素),用 CEM 做零样本规划;在迷宫/推物等任务零样本求解。
- seq-JEPA(2505.03176):把 JEPA 与序列处理归纳偏置结合,同时学等变与不变表示。
注意:JEPA 的"连续"指的是在连续/稠密的表示空间里预测(非离散 token、非像素重建),与前三家族的"空间/时间连续"是不同维度上的"非 Token"。它与具身世界模型(V-JEPA 2、DINO-WM)直接相关。
相关的连续生成线:Flow Matching(ICLR 2023,2210.02747)用连续归一化流(CNF)学连续概率路径的向量场,是扩散的连续时间推广——常作为连续潜在世界模型/生成式动力学的训练工具。
7. 理论主线:四家族其实在说同一件事
把四者放在一起,能看到一条统一线索——把"离散堆叠/网格"替换为"连续数学对象 + 神经参数化":
- 微分方程视角:ResNet ≈ Neural ODE 的离散欧拉步;RNN ≈ 连续时间动力学的采样;S4/Mamba 底层是连续时间 SSM 的离散化。深度与时间都可连续化。
- 函数 / 场视角:神经场把"信号"看成坐标的连续函数;算子学习把"映射"看成函数空间之间的连续算子。SIREN 既是神经场又能解 PDE,正好是家族①与③的交汇。
- 物理先验视角:PINN 把 PDE 写进损失;FNO/DeepONet 把 PDE 解算子学出来;SIREN/神经场天然可微以满足 PDE——三者都在让网络尊重连续物理。
- 预测目标视角:JEPA 把"预测"从像素/token 移到连续表示空间——用连续表示而非离散符号做世界建模。
- 可微性这条暗线:连续 ⇒ 可取导数 ⇒ 可做梯度规划、可嵌物理约束、可微仿真。这是它们对世界模型 / 控制 / 科学计算特别有吸引力的根本原因。
8. 与你的研究(world model / 具身 / 多感官)的关系
- 连续世界模型已成主流候选:V-JEPA 2、DINO-WM 证明"在连续潜空间预测 + 规划"可做零样本机器人控制——这正是 MultiPLY 式具身智能体可借鉴的"非 token、可规划"路线。
- 神经场 = 多感官物体的连续容器:ObjectFolder 的隐式神经表示就是神经场;超声/触觉/声场都可用连续场建模(连续而非逐点采样)。
- 连续时间 = 多模态异步融合的天然工具:视/触/听/超声采样率不同、异步到达,Neural CDE/Latent ODE 能在连续时间轴上对齐与融合不规则采样的多感官流。
- 算子学习 = 具身世界模型的物理引擎:接触动力学、声波传播(超声/撞击声)都可学成可微算子,用于快速预测与规划。
- 可微贯穿全栈:连续表示让"感知→预测→规划"可端到端求导,契合具身闭环。
9. 连续 vs Token:权衡与开放问题
连续模型的优势:分辨率无关、可微、可取导数、处理不规则采样、嵌入物理先验、表示紧凑、避免重建无关细节。
代价与开放问题:
- 训练/推理成本:ODE 求解器慢(CfC 用闭式解缓解);神经场逐场景优化慢(GS 用显式基元加速)。
- 可扩展性与工程生态:Token/Transformer 有成熟的硬件与扩展规律(scaling laws),连续模型的大规模扩展与稳定训练仍在早期(JEPA 易表示坍塌、需 EMA/复杂损失)。
- 离散 vs 连续的回摆:3D Gaussian Splatting(显式)反超 NeRF(隐式连续)、Mamba(离散选择性)源自连续 SSM——说明"纯连续"并非总最优,**混合(连续性质 + 显式/离散效率)**往往胜出。
- 理论保证:算子学习有逼近定理,但连续世界模型的可规划性、泛化、稳定性理论仍不完善。
- 统一框架缺失:四家族目前各自为政,缺一个把"空间连续 + 时间连续 + 函数空间 + 表示预测"统一起来的框架。
10. 论文与资源清单
① 连续空间表示 / 神经场
- Occupancy Networks(CVPR 2019)https://arxiv.org/abs/1812.03828
- DeepSDF(CVPR 2019)https://arxiv.org/abs/1901.05103
- SIREN(NeurIPS 2020)https://arxiv.org/abs/2006.09661
- NeRF(ECCV 2020)https://arxiv.org/abs/2003.08934
- 3D Gaussian Splatting(SIGGRAPH 2023)https://arxiv.org/abs/2308.04079
- D-NeRF(动态)https://arxiv.org/abs/2011.13961 / NeRFPlayer(4D)https://arxiv.org/abs/2210.15947
② 连续时间动力学
- Neural ODE(NeurIPS 2018)https://arxiv.org/abs/1806.07366
- Latent ODE / ODE-RNN(NeurIPS 2019)https://arxiv.org/abs/1907.03907
- Neural CDE(NeurIPS 2020)https://arxiv.org/abs/2005.08926
- Liquid Time-Constant Networks(AAAI 2021)https://arxiv.org/abs/2006.04439
- CfC 闭式连续时间网络https://arxiv.org/abs/2106.13898
- S4 结构化状态空间(ICLR 2022)https://arxiv.org/abs/2111.00396
③ 算子学习 / 物理时空
- PINN(2017)https://arxiv.org/abs/1711.10561
- DeepONet(2019)https://arxiv.org/abs/1910.03193
- FNO 傅里叶神经算子(ICLR 2021)https://arxiv.org/abs/2010.08895
- Geo-FNO(复杂几何)https://arxiv.org/abs/2207.05209
④ 非 Token 预测架构 / 世界模型
- I-JEPA(CVPR 2023)https://arxiv.org/abs/2301.08243
- V-JEPA 2(2025,机器人世界模型)https://arxiv.org/abs/2506.09985
- DINO-WM(ICML 2025)https://arxiv.org/abs/2411.04983
- seq-JEPAhttps://arxiv.org/abs/2505.03176
- Flow Matching(ICLR 2023,连续生成)https://arxiv.org/abs/2210.02747
来源(Sources)
- Occupancy Networks (1812.03828)
- DeepSDF (1901.05103)
- SIREN (2006.09661)
- NeRF (2003.08934)
- 3D Gaussian Splatting (2308.04079)
- D-NeRF (2011.13961)
- NeRFPlayer (2210.15947)
- Neural ODE (1806.07366)
- Latent ODE / ODE-RNN (1907.03907)
- Neural CDE (2005.08926)
- Liquid Time-Constant Networks (2006.04439)
- CfC (2106.13898)
- S4 (2111.00396)
- PINN (1711.10561)
- DeepONet (1910.03193)
- FNO (2010.08895)
- Geo-FNO (2207.05209)
- I-JEPA (2301.08243)
- V-JEPA 2 (2506.09985)
- DINO-WM (2411.04983)
- seq-JEPA (2505.03176)
- Flow Matching (2210.02747)