# 连续(非 Token)模型:面向空间与时间的模型与理论 > 主题:不把世界切成离散 token / 网格,而是用**连续函数 / 连续动力学**来建模——尤其针对**空间**与**时间**。 > 覆盖四大家族:① 连续空间表示(神经场)② 连续时间动力学(Neural ODE 族)③ 算子学习 / 物理时空(Neural Operator)④ 非 Token 预测架构 / 世界模型(JEPA 族)。 > 面向研究者;与本目录 world-model / 具身 / 多感官研究相呼应。 --- ## 1. 动机:为什么要"非 Token、连续" 主流大模型(Transformer/LLM)的范式是**离散化**:把图像切 patch、把序列切 token、把空间切体素网格,再在离散符号上做注意力。这种"tokenization"在语言上极成功,但对**连续的物理世界(空间几何、时间演化)**有几处先天不适: - **分辨率受限 / 网格伪影**:体素/像素网格的精度被离散步长锁死,内存随分辨率立方增长。 - **丢失连续性与导数**:物理信号常以微分方程定义,token 化难以表达"在任意点的值及其空间/时间导数"。 - **不规则采样难处理**:真实传感器是异步、非均匀采样的,离散步进模型(RNN/Transformer)天然假设等间隔。 - **重建无关细节的浪费**:像素级生成式模型被迫预测大量与任务无关的高频细节。 **连续模型**的共同主张:**用一个神经网络去参数化一个连续对象**——空间上的场 `f(x)`、时间上的轨迹 `dz/dt = f(z,t)`、函数空间之间的算子 `G: a(·)↦u(·)`、或抽象潜在空间里的预测。由此获得**分辨率无关、可微(可取导数)、能处理不规则采样、可嵌入物理先验**等好处。 > 一句话:**Token 把世界离散成符号;连续模型把世界参数化成函数与流。** --- ## 2. 总览:四大家族一张图 ``` "用神经网络参数化一个连续对象" ┌──────────────┬───────────────┬────────────────┬──────────────────┐ │ ① 连续空间 │ ② 连续时间 │ ③ 算子学习 │ ④ 非Token预测 │ │ 神经场 │ 动力学 │ /物理时空 │ /世界模型 │ │ f(x)=值 │ dz/dt=f(z,t) │ G:a(·)↦u(·) │ 在潜在空间预测 │ │ NeRF/SIREN │ Neural ODE │ FNO/DeepONet │ JEPA/V-JEPA2 │ │ DeepSDF/GS │ CDE/SDE/LTC │ PINN/算子 │ DINO-WM │ │ 空间连续 │ 时间连续 │ 函数空间连续 │ 表示空间连续 │ └──────────────┴───────────────┴────────────────┴──────────────────┘ ``` 四者的"连续"作用在不同对象上:①空间坐标 → ②时间 → ③整个函数(输入/输出都是函数)→ ④抽象表示空间。下面逐一展开。 --- ## 3. 家族一:连续空间表示 / 神经场(Neural Fields / INR) **核心思想**:用一个 MLP 把**连续坐标**映射到**信号值**——`f_θ(x, y, z, [方向/时间]) → (颜色/密度/占据/距离…)`。物体/场景不再存成网格,而是存成"网络权重",可在任意分辨率查询。 代表工作: - **Occupancy Networks**(CVPR 2019,[1812.03828](https://arxiv.org/abs/1812.03828)):把形状表示为连续**占据概率函数** `o(x)∈[0,1]`,无限分辨率、内存友好。 - **DeepSDF**(CVPR 2019,[1901.05103](https://arxiv.org/abs/1901.05103)):学习连续**有符号距离函数(SDF)**,零等值面即表面;用 latent code 表示一整类形状。 - **SIREN**(NeurIPS 2020,[2006.09661](https://arxiv.org/abs/2006.09661)):用**周期激活函数(sin)**的 MLP 表示连续可微信号,关键性质是**任意阶导数仍是 SIREN**(sin 的导数是 cos),因此特别适合表示信号的空间/时间导数、求解 Eikonal/Poisson/Helmholtz/波动等 PDE。 - **NeRF**(ECCV 2020,[2003.08934](https://arxiv.org/abs/2003.08934)):把 3D 场景表示为连续**辐射场** `(x,方向)→(颜色,密度)`,配可微体渲染做新视角合成;引爆了"神经场"研究。 - **3D Gaussian Splatting**(SIGGRAPH 2023,[2308.04079](https://arxiv.org/abs/2308.04079)):把场景表示为一堆各向异性 3D 高斯(显式、可栅格化),实时渲染。它**保留了连续体积辐射场的优良性质,却用显式基元规避空白区计算**——是"连续 vs 显式"张力的代表性折中。 - **动态/4D 扩展**:把空间场再加时间轴。如 **D-NeRF**([2011.13961](https://arxiv.org/abs/2011.13961))用形变场建模动态场景;**NeRFPlayer**([2210.15947](https://arxiv.org/abs/2210.15947))按静态/形变/新增区域分解 4D 时空;**4D Gaussian Splatting**(CVPR 2024)把 3DGS 扩到动态。 > 与本目录研究的连接:**ObjectFolder**(多感官物体数据集,见《多感官…综述》)正是用**隐式神经场**(VisionNet/AudioNet/TouchNet)表示视/听/触——它就是"神经场 + 多感官"的典范。 --- ## 4. 家族二:连续时间动力学(Neural ODE 族) **核心思想**:不再堆叠离散层 / 离散时间步,而是把隐状态的**演化**写成微分方程,用 ODE 求解器积分——**深度/时间变成连续变量**。 代表工作: - **Neural ODE**(NeurIPS 2018,[1806.07366](https://arxiv.org/abs/1806.07366)):把隐状态导数参数化为网络 `dh/dt = f_θ(h,t)`,用黑盒 ODE 求解器前向、**伴随法(adjoint)**反传;常数内存、可在精度与速度间权衡。是"连续深度"的奠基。 - **Latent ODE / ODE-RNN**(NeurIPS 2019,[1907.03907](https://arxiv.org/abs/1907.03907)):编码器(RNN/GRU)得初始潜状态,再用 Neural ODE 在潜空间演化——**天然处理不规则采样时间序列**,可在任意时刻插值/预测。 - **Neural CDE**(NeurIPS 2020,[2005.08926](https://arxiv.org/abs/2005.08926)):Neural ODE 的解只由初值决定、无法吸收后续观测;CDE 用"受控微分方程"让轨迹**持续响应到来的数据流**,是"连续时间 RNN",擅长部分观测/不规则多元时间序列。 - **Neural SDE**:加入随机项,做生成式建模与不确定性量化。 - **Liquid Time-Constant Networks(LTC)**(AAAI 2021,[2006.04439](https://arxiv.org/abs/2006.04439)):连续时间、时间常数可变的 ODE-RNN,稳定有界、表达力强,时间序列预测表现好。 - **CfC(Closed-form Continuous-time)**([2106.13898](https://arxiv.org/abs/2106.13898)):给出 LTC 的**闭式解**,**无需 ODE 求解器**即可推理,大幅提速;训练好的 LTC 可"编译"为 CfC。 - **S4 / 结构化状态空间**(ICLR 2022,[2111.00396](https://arxiv.org/abs/2111.00396)):底层是**连续时间状态空间模型** `dx/dt=Ax+Bu, y=Cx+Du`,再离散化;以低秩修正稳定对角化高效计算,擅长超长程依赖(首个攻克 Path-X 16k)。其后继 **Mamba** 引入选择性机制——可视为"连续时间 SSM"到现代序列模型的桥梁。 > 直觉:ResNet 是 Neural ODE 的离散欧拉近似;RNN 是连续时间动力学的离散采样。连续时间模型把这些"步数"还给了微积分。 --- ## 5. 家族三:算子学习 / 物理时空(Neural Operators) **核心思想**:前两家族学的是"函数"(坐标→值)或"轨迹",而算子学习直接学**函数到函数的映射**(无穷维 → 无穷维),即 PDE 的**解算子** `G: 参数/初值/边界函数 a(·) ↦ 解函数 u(·)`。关键性质是**离散无关(mesh-independent)**:训练后可在任意网格/分辨率上评估,零样本超分辨。 代表工作: - **PINN(物理信息神经网络)**(Raissi 等 2017,[1711.10561](https://arxiv.org/abs/1711.10561);JCP 2019):把 PDE 残差作为损失约束,让网络在满足数据的同时**遵守物理定律**;分连续时间与离散时间两类。局限:换参数/初值要重训(学的是"某一个解"而非"算子")。 - **DeepONet**([1910.03193](https://arxiv.org/abs/1910.03193);Nature MI 2021):基于**算子万能逼近定理**,用 **branch 网(编码输入函数在传感点的采样)+ trunk 网(编码输出位置)**学非线性算子;可一次学一族 PDE。 - **FNO(傅里叶神经算子)**(ICLR 2021,[2010.08895](https://arxiv.org/abs/2010.08895)):把积分核**直接在傅里叶空间参数化**(FFT→低频模态线性变换→逆 FFT),高效捕捉非局部相关;首个零样本超分辨建模湍流,比传统求解器快达三个数量级。FNO-3D 直接在"空间×时间"上做卷积。 - **变体生态**:Geo-FNO([2207.05209](https://arxiv.org/abs/2207.05209),复杂几何)、Graph/Multipole Neural Operator、L-DeepONet(潜空间)、通用 Neural Operator 理论框架等。 > 与本目录的连接:算子学习是**可微物理仿真 / 世界模型的"物理引擎"候选**——比如把流体/接触动力学学成一个快速可微算子,正好契合具身世界模型对"快而准的动力学预测"的需求。 --- ## 6. 家族四:非 Token 预测架构 / 世界模型(JEPA 族) **核心思想**:不在像素/token 层面重建,而是**在抽象表示(潜在)空间里做预测**——预测"被遮挡/未来部分的表示",从而聚焦高层本质、忽略不可预测的无关细节。这是 LeCun 对"自主机器智能"的核心主张。 代表工作: - **LeCun《A Path Towards Autonomous Machine Intelligence》**(2022,立场论文):提出以**世界模型**为核心的认知架构蓝图,JEPA 作为其世界模型模块;理论上可视为在**表示空间上的能量模型(EBM)**。 - **I-JEPA**(CVPR 2023,[2301.08243](https://arxiv.org/abs/2301.08243)):图像版——从可见 patch 的表示预测被遮挡区域的**表示**(而非像素);高效且表征强(632M ViT,16×A100,<72h,ImageNet 低样本 SOTA)。 - **V-JEPA**(2024):视频版,特征预测学习视频表示。 - **V-JEPA 2**(2025,[2506.09985](https://arxiv.org/abs/2506.09985)):在 >100 万小时视频上自监督预训练**动作无关**的视频世界模型,再用极少机器人交互数据(<62h Droid)训练**动作条件预测器 V-JEPA 2-AC**,在 MPC 框架下做**零样本机器人规划**(抓取/搬运成功率显著超过 VLA 基线 Octo)。这是 JEPA 从"表示学习"走向"可规划世界模型"的关键一步。 - **DINO-WM**(ICML 2025,[2411.04983](https://arxiv.org/abs/2411.04983)):在 **DINOv2 预训练 patch 特征**的连续潜空间里建模动态、预测未来潜表示(不重建像素),用 CEM 做零样本规划;在迷宫/推物等任务零样本求解。 - **seq-JEPA**([2505.03176](https://arxiv.org/abs/2505.03176)):把 JEPA 与序列处理归纳偏置结合,同时学等变与不变表示。 > 注意:JEPA 的"连续"指的是**在连续/稠密的表示空间里预测**(非离散 token、非像素重建),与前三家族的"空间/时间连续"是不同维度上的"非 Token"。它与具身世界模型(V-JEPA 2、DINO-WM)直接相关。 **相关的连续生成线**:**Flow Matching**(ICLR 2023,[2210.02747](https://arxiv.org/abs/2210.02747))用连续归一化流(CNF)学连续概率路径的向量场,是扩散的连续时间推广——常作为连续潜在世界模型/生成式动力学的训练工具。 --- ## 7. 理论主线:四家族其实在说同一件事 把四者放在一起,能看到一条统一线索——**把"离散堆叠/网格"替换为"连续数学对象 + 神经参数化"**: - **微分方程视角**:ResNet ≈ Neural ODE 的离散欧拉步;RNN ≈ 连续时间动力学的采样;S4/Mamba 底层是连续时间 SSM 的离散化。**深度与时间都可连续化**。 - **函数 / 场视角**:神经场把"信号"看成坐标的连续函数;算子学习把"映射"看成函数空间之间的连续算子。SIREN 既是神经场又能解 PDE,**正好是家族①与③的交汇**。 - **物理先验视角**:PINN 把 PDE 写进损失;FNO/DeepONet 把 PDE 解算子学出来;SIREN/神经场天然可微以满足 PDE——三者都在**让网络尊重连续物理**。 - **预测目标视角**:JEPA 把"预测"从像素/token 移到连续表示空间——**用连续表示而非离散符号做世界建模**。 - **可微性这条暗线**:连续 ⇒ 可取导数 ⇒ 可做梯度规划、可嵌物理约束、可微仿真。这是它们对**世界模型 / 控制 / 科学计算**特别有吸引力的根本原因。 --- ## 8. 与你的研究(world model / 具身 / 多感官)的关系 - **连续世界模型已成主流候选**:V-JEPA 2、DINO-WM 证明"在连续潜空间预测 + 规划"可做零样本机器人控制——这正是 MultiPLY 式具身智能体可借鉴的"非 token、可规划"路线。 - **神经场 = 多感官物体的连续容器**:ObjectFolder 的隐式神经表示就是神经场;超声/触觉/声场都可用连续场建模(连续而非逐点采样)。 - **连续时间 = 多模态异步融合的天然工具**:视/触/听/超声采样率不同、异步到达,Neural CDE/Latent ODE 能在连续时间轴上对齐与融合不规则采样的多感官流。 - **算子学习 = 具身世界模型的物理引擎**:接触动力学、声波传播(超声/撞击声)都可学成可微算子,用于快速预测与规划。 - **可微贯穿全栈**:连续表示让"感知→预测→规划"可端到端求导,契合具身闭环。 --- ## 9. 连续 vs Token:权衡与开放问题 **连续模型的优势**:分辨率无关、可微、可取导数、处理不规则采样、嵌入物理先验、表示紧凑、避免重建无关细节。 **代价与开放问题**: - **训练/推理成本**:ODE 求解器慢(CfC 用闭式解缓解);神经场逐场景优化慢(GS 用显式基元加速)。 - **可扩展性与工程生态**:Token/Transformer 有成熟的硬件与扩展规律(scaling laws),连续模型的大规模扩展与稳定训练仍在早期(JEPA 易表示坍塌、需 EMA/复杂损失)。 - **离散 vs 连续的回摆**:3D Gaussian Splatting(显式)反超 NeRF(隐式连续)、Mamba(离散选择性)源自连续 SSM——说明"纯连续"并非总最优,**混合(连续性质 + 显式/离散效率)**往往胜出。 - **理论保证**:算子学习有逼近定理,但连续世界模型的可规划性、泛化、稳定性理论仍不完善。 - **统一框架缺失**:四家族目前各自为政,缺一个把"空间连续 + 时间连续 + 函数空间 + 表示预测"统一起来的框架。 --- ## 10. 论文与资源清单 ### ① 连续空间表示 / 神经场 - Occupancy Networks(CVPR 2019) - DeepSDF(CVPR 2019) - SIREN(NeurIPS 2020) - NeRF(ECCV 2020) - 3D Gaussian Splatting(SIGGRAPH 2023) - D-NeRF(动态) / NeRFPlayer(4D) ### ② 连续时间动力学 - Neural ODE(NeurIPS 2018) - Latent ODE / ODE-RNN(NeurIPS 2019) - Neural CDE(NeurIPS 2020) - Liquid Time-Constant Networks(AAAI 2021) - CfC 闭式连续时间网络 - S4 结构化状态空间(ICLR 2022) ### ③ 算子学习 / 物理时空 - PINN(2017) - DeepONet(2019) - FNO 傅里叶神经算子(ICLR 2021) - Geo-FNO(复杂几何) ### ④ 非 Token 预测架构 / 世界模型 - I-JEPA(CVPR 2023) - V-JEPA 2(2025,机器人世界模型) - DINO-WM(ICML 2025) - seq-JEPA - Flow Matching(ICLR 2023,连续生成) --- ## 来源(Sources) - [Occupancy Networks (1812.03828)](https://arxiv.org/abs/1812.03828) - [DeepSDF (1901.05103)](https://arxiv.org/abs/1901.05103) - [SIREN (2006.09661)](https://arxiv.org/abs/2006.09661) - [NeRF (2003.08934)](https://arxiv.org/abs/2003.08934) - [3D Gaussian Splatting (2308.04079)](https://arxiv.org/abs/2308.04079) - [D-NeRF (2011.13961)](https://arxiv.org/abs/2011.13961) - [NeRFPlayer (2210.15947)](https://arxiv.org/abs/2210.15947) - [Neural ODE (1806.07366)](https://arxiv.org/abs/1806.07366) - [Latent ODE / ODE-RNN (1907.03907)](https://arxiv.org/abs/1907.03907) - [Neural CDE (2005.08926)](https://arxiv.org/abs/2005.08926) - [Liquid Time-Constant Networks (2006.04439)](https://arxiv.org/abs/2006.04439) - [CfC (2106.13898)](https://arxiv.org/abs/2106.13898) - [S4 (2111.00396)](https://arxiv.org/abs/2111.00396) - [PINN (1711.10561)](https://arxiv.org/abs/1711.10561) - [DeepONet (1910.03193)](https://arxiv.org/abs/1910.03193) - [FNO (2010.08895)](https://arxiv.org/abs/2010.08895) - [Geo-FNO (2207.05209)](https://arxiv.org/abs/2207.05209) - [I-JEPA (2301.08243)](https://arxiv.org/abs/2301.08243) - [V-JEPA 2 (2506.09985)](https://arxiv.org/abs/2506.09985) - [DINO-WM (2411.04983)](https://arxiv.org/abs/2411.04983) - [seq-JEPA (2505.03176)](https://arxiv.org/abs/2505.03176) - [Flow Matching (2210.02747)](https://arxiv.org/abs/2210.02747)