Files
gaojie 732706bb6f
Sync to site1 / sync (push) Has been cancelled
docs(research): add world-models paradigm-redesign-2026 survey
- Add literature survey on 2026.05 dual paradigm-shifting works:
  OrbiSim (differentiable physics engine) and WEM (world-ego disentanglement)
- Files: _index.md, orbisim_review.md, wem_review.md, joint_synthesis.md
- Update research/world-models/_index.md to register new sub-section
2026-05-21 09:15:25 +08:00

386 lines
26 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
---
title: "世界模型的范式重塑:从单流视频预测到结构化解耦——OrbiSim 与 WEM 综合评析"
date: 2026-05-20
lastmod: 2026-05-20
draft: false
summary: "2026 年 5 月几乎同期发布的 OrbiSim 与 WEM 共同向『单流视频世界模型』发起范式挑战:前者把世界模型重写为可微物理引擎(状态-视觉解耦),后者把它重写为世界-自我解耦的视频生成器。本文给出形式化、分类法、对比表、批判分析与合流前景。"
tags: ["world-models", "embodied-ai", "differentiable-physics", "world-ego-disentanglement", "diffusion", "robotics", "taxonomy", "2026"]
categories: ["research", "world-models"]
weight: 10
math: true
toc: true
---
## 1. 引言
世界模型(World Model)从 2018 年 Ha & Schmidhuber 的 latent-RNN 雏形出发,在 20222024 年间被 DreamerV3、Sora、GAIA、Cosmos、JEPA 等一系列工作推向高潮。但从 2025 年开始,研究社区逐渐意识到一个尴尬事实:**虽然视频质量、分辨率、时长都在指数级增长,世界模型在真正具身任务上的表现却进入了瓶颈**。生成模型能"画出"一段看起来合理的未来视频,却不能在那段视频里完成稀疏奖励的强化学习、也不能在长视野的混合导航-操作任务中保持场景一致——更不用说为控制策略提供可用的解析梯度。这种"看上去越来越像、用起来越来越难"的撕裂感,是 2026 年开年的核心张力。
问题根源逐渐收敛到一个共识:当代主流的"视频预测器式"世界模型把太多东西揉在了一条流里。**物理状态和像素观测被纠缠在 latent 中**——所以梯度不能干净地流回策略;**持久的场景规律和瞬时的机器人本体动力学也被塞进同一个生成头**——所以长视野自回归会同时被场景漂移和指令噪声放大。两个问题都不是参数量能解决的:Cosmos-Predict 2.5 从 2B 扩到 14B,在长视野基准上只多了 0.58 分;DreamerV3 与各类 video predictor 在稀疏奖励控制任务上始终被卡在 ~25% 成功率。
2026 年 5 月,几乎在同一周里,两篇风格迥异但底层主张惊人一致的论文先后登陆 arXiv,构成了我们所谓的"**范式重塑双子星**":上海交通大学的 **OrbiSim**arXiv:2605.16395[^1]2026-05-12)把世界模型重新定义为**端到端可微的物理引擎**,主张"状态 vs 视觉"分流;CASIA 与北大、上交联合提出的 **WEM**arXiv:2605.19957[^2]2026-05-19)把世界模型重新定义为**世界-自我双分支的视频生成器**,主张"world vs ego"分流。一个把单流模型向下打回到"可微仿真器",一个把它向上抬高为"双分支生成器"——两条路从两端夹击同一个旧范式。
本综述把范围严格收敛到这两篇 2026 年 5 月同期工作上,目的是:(i) 用统一的形式化语言抽出两者的范式骨架;(ii) 建立一个用于解析后续工作的分类法;(iii) 用对比表把它们与 2024–2026 的代表性基线放在同一张坐标系下;(iv) 给出批判性评价与合流可能性的具体建议。文章组织如下:第 2 节给出符号系统与三类世界模型的数学定义;第 3 节建立分类法(解耦轴 / 可微性 / 评测载体);第 4–5 节分别深入剖析 OrbiSim 与 WEM 的核心机制;第 6 节用三张表给出 metadata / 架构 / 评测的横向对比;第 7 节是关键结果汇总与批判分析;第 8 节讨论合流前景;第 9 节展望挑战;第 10 节给出读者下一步的阅读建议。两篇论文的单篇详细解读分别在 [`orbisim_review.md`](orbisim_review.md) 与 [`wem_review.md`](wem_review.md)。
## 2. 问题定义与符号表
### 2.1 经典世界模型
最一般的世界模型可形式化为一个由动力学 $f$ 与观测函数 $g$ 组成的可控动力系统:
$$
s_{t+1} = f_\theta(s_t, a_t) + \epsilon_t, \qquad o_t = g_\phi(s_t) + \nu_t
$$
其中 $s_t$ 是隐状态,$a_t$ 是动作,$o_t$ 是观测,$\epsilon_t, \nu_t$ 是噪声。Ha & Schmidhuber、PlaNet、Dreamer 系列都属于这一框架,区别只在 $f, g$ 的具体实例化与训练目标。
这一通用框架下,2024–2025 年的主流路线——Sora / Cosmos / WoW / Wan2.2 / AdaWorld / Vid2World——本质上是把 $f$ 和 $g$ 融合为**单一的视频自回归 / 扩散生成器** $\mathcal{V}_\theta$
$$
o_{t+1:t+H} = \mathcal{V}_\theta(o_{t-K:t}, a_{t:t+H-1}, \text{instr})
$$
显式状态 $s_t$ 在这一范式中**消失了**——所有信息都流入像素隐空间。这正是 OrbiSim 与 WEM 共同攻击的目标。
### 2.2 OrbiSim 的可微链
OrbiSim 把世界模型**重新分裂回 $f$ 和 $g$**,但二者都用神经网络实例化并保持端到端可微:
$$
\underbrace{x_{t+1} = \mathrm{Dynamics}_\theta(x_t, a_t, c)}_{\text{显式物理状态转移}}, \qquad
\underbrace{o_t = \mathrm{Vision}_\phi(x_t, \bar{x}, \xi_t)}_{\text{state-guided latent diffusion}}
$$
其中 $x_t$ 是显式物理状态(位姿、速度、关节角、点云特征),$\bar{x}$ 是一组参考状态-观测对,$\xi_t$ 是扩散噪声。关键性质是:策略梯度只需要 $\partial x_{t+1} / \partial x_t$ 与 $\partial r_t / \partial x_t$,可以**完全绕开 Vision 这条扩散链**:
$$
\nabla_\pi J = \sum_t \frac{\partial r_t}{\partial x_t} \cdot \prod_{k < t} \frac{\partial x_{k+1}}{\partial x_k} \cdot \frac{\partial \pi(a_k|x_k)}{\partial \pi}
$$
这就是 OrbiSim 的"解析策略梯度(Analytic Policy Gradient, APG"——它在数学上等价于经典可微物理引擎(如 DiffTaichi)上的梯度,但把可微部分从手写的解析雅可比换成了神经网络的自动微分。
### 2.3 WEM 的世界-自我解耦
WEM 选择不动 $g$(依然是扩散视频生成),但把隐空间 $S_k$ 显式切成两支:
$$
S_k = S^{w}_k \oplus S^{e}_k
$$
其中 $S^{w}_k$ 承载指令无关的场景持久信息(world state),$S^{e}_k$ 承载指令条件化的机器人本体动力学(ego state)。生成目标是 flow-matching 损失加上一个掩码一致性正则:
$$
\mathcal{L} = \mathcal{L}_{\text{FM}}\bigl(\hat{v}_\theta(S_k, \text{instr}, t), v^{*}_k\bigr) + \lambda\, \mathcal{L}_{\text{mask}}(S^{w}_k, S^{e}_k)
$$
WEM 对这一分解给出了三种**边界定义**motion / semantic / intention)和三种**解耦策略**pre / post / full)的笛卡尔积研究,最终 *(semantic, full)* 组合最优。
### 2.4 三者并置
| 路线 | 隐变量 | 可微范围 | 控制接口 |
|---|---|---|---|
| 单流视频预测 (Cosmos/WoW) | 单一 latent $z_t$ | 生成器内部 | 仅可作 rollout buffer |
| OrbiSim | 显式物理状态 $x_t$ + 视觉 latent | 全链 ($x$ 与 $o$) | 解析策略梯度 (APG) |
| WEM | 双隐变量 $S^w_k, S^e_k$ | 生成器内部 | 视频质量 / 长视野指令跟随 |
## 3. 分类法(Taxonomy
为把 OrbiSim、WEM 与既有工作放进同一张坐标系,本节建立一棵围绕"范式重塑"的分类树。
```mermaid
graph TD
A[世界模型 范式] --> B[1. 解耦轴]
A --> C[2. 可微性]
A --> D[3. 评测载体]
B --> B1[无解耦<br/>Cosmos · WoW · Sora]
B --> B2[状态/视觉解耦<br/><b>OrbiSim</b>]
B --> B3[世界/自我解耦<br/><b>WEM</b>]
B --> B4[latent/pixel 解耦<br/>JEPA 系]
C --> C1[不可微<br/>MuJoCo · PhysX · Isaac Sim]
C --> C2[仅生成可微<br/>Cosmos · WoW · Wan2.2 · <b>WEM</b>]
C --> C3[完全可微<br/><b>OrbiSim</b> · DiffTaichi · NVIDIA Newton]
D --> D1[物理控制<br/>RL 成功率 · TrajErr · APG<br/><b>OrbiSim</b> · DreamerV3]
D --> D2[视频质量<br/>FVD · PSNR · LPIPS<br/>Sora · Cosmos · <b>WEM</b>]
D --> D3[长视野指令跟随<br/>EWMScore · WorldArena<br/><b>WEM</b> · IRASim · Ctrl-World]
```
### 3.1 按解耦轴
- **无解耦(单流)**Cosmos-Predict、WoW、Sora、Wan2.2 等,所有信息共享一个 latent。
- **状态/视觉解耦**OrbiSim 是 2026 年代表,物理状态与像素观测分别由 Dynamics 与 Vision 子网络处理。
- **世界/自我解耦**:WEM 是 2026 年代表,场景信息与机器人本体在 token 级、注意力级、专家级三层全部分流。
- **latent/pixel 解耦**JEPA 系(I-JEPA、V-JEPA、V-JEPA 2)抛弃像素重建,只在 latent 中做掩码预测。
### 3.2 按可微性
- **不可微**MuJoCo、PhysX、Isaac Sim、Bullet——经典物理引擎,雅可比通常不导出或受限于刚体接触。
- **仅生成可微**:扩散视频模型与 WEM 在像素层面是可微的,但策略梯度需要穿过整条 denoising 链,方差大、显存高。
- **完全可微**OrbiSim、DiffTaichi、NVIDIA Newton(解析)、Brax/JAX-MD(解析)——可直接将梯度回传给策略 / 形状 / 物理参数。
### 3.3 按评测载体
- **物理控制**:以 robosuite、Isaac Lab、AdaManip、Physion 为主,关注 RL 成功率、轨迹误差、可微反演——OrbiSim 的主场。
- **视频质量**:以 UCF-101、Kinetics、内部数据为主,关注 FVD、PSNR、LPIPS——Cosmos、Sora、WoW 的主场。
- **长视野指令跟随**:以 HTEWorld、WorldArena、CALVIN-long 为主,关注 EWMScore、多轮指令一致性——WEM 与 IRASim、Ctrl-World 的主场。
## 4. 方法详解 IOrbiSim
### 4.1 架构原理
OrbiSim 把世界模型拆为两个互不依赖的子模块:
- **OrbiSim-Dynamics**object-centric Transformer + AdaLN,把每个物体作为 token,预测其在下一时刻的位姿、速度、关节角;
- **OrbiSim-Vision**state-guided latent diffusion,把当前状态 $x_t$ 与一组参考状态-观测对 $\bar{x}$ 作为条件,扩散出 RGB 观测 $o_t$。
资产层用三类原语统一表示:刚体(6-DoF 位姿 + 速度,Embedding 编码)、关节体(URDF + Point Transformer V3 / Sonata)、可变形体(稀疏点云)。这意味着同一份 Dynamics 网络可以承接 robosuite 推/堆、AdaManip 铰接、Physion 布料模拟,无需为每类对象单独训练 head。
### 4.2 训练策略
为了让自回归滚动稳定,OrbiSim 采用两阶段课程:
1. **Teacher Forcing**:以 ground-truth $x_t$ 喂入;
2. **Cosine-Annealed AR Rollout**:用余弦曲线将 ground-truth 概率从 1.0 退火到 0.0,逐步切换到自回归。
视觉端引入 **Context Frame Sparsification**——训练时随机稀疏参考帧数量,使推理时 1–8 帧条件下均稳定。
Real-to-Sim 通路有两条:**StaInf**(单帧 RGB → 可见状态)与 **PhyInf**(64 帧视频 → 隐藏物理参数)。后者把 Dynamics 当作可微前向,**用梯度反演 mass、friction 等隐藏参数**——这是经典仿真器只能"前向 + 网格搜索"完成的事情。
### 4.3 关键 Ablation
- **去掉状态-视觉解耦**(让策略梯度穿过扩散链):APG 训练发散,成功率跌回 BC 水平(~20%);
- **去掉 cosine AR**(纯 teacher forcing):PSNR100 下降约 2 dB,长视野 FVD 翻倍;
- **去掉 Object-Centric Transformer**(换 token-mixed Transformer):多物体接触建模失效,TrajErr 翻 1.8×。
三个 ablation 共同指出:**OrbiSim 的性能并非源于参数堆叠,而是源于显式物理状态 + 可微通路 + 物体中心化表示的协同**。
## 5. 方法详解 IIWEM
### 5.1 架构原理
WEM 由两段构成:
- **冻结的 Qwen3-VL-2B 规划器** + **Role-Conditioned Attention (RCA)** + **不对称 query 预算(192 world / 64 ego**——输出 256 个 condition token,自带 world / ego 角色标签。
- **CP-MoE DiT 生成器**(基于 Wan2.2-TI2V-5B):24 个共享 block → semantic head 路由 → world 专家 6 block / ego 专家 6 block 并行 → unrouting → flow-matching head。
其中 **Asymmetric Query Budget** 的设计直觉是:场景信息丰富但变化慢,分配 192 token;机器人本体信息少但密集,分配 64 token。**Neighbor-Expanded Routing** 把 hard top-1 路由改为带空间邻居的软路由,避免边界处的语义切割伪影。
### 5.2 训练策略
16× A100 80GBlr = 1e-5EMA 0.994 epochs480×480 @ 16 FPS35 diffusion steps37 frames / chunk。数据基于 BEHAVIOR-1K 构建:125K 训练片段(>4.5M 帧)。HTEWorld 评测集另含 300 条多轮轨迹(>2K 指令)。
### 5.3 关键 Ablation
| 移除组件 | EWMScore |
|---|---|
| 完整 WEM | 61.48 |
| Asymmetric Query Budget | 60.50 |
| Role-Conditioned Attention | 60.64 |
| Neighbor-Expanded Routing | 59.57 |
| 无解耦(PAN-style baseline | 58.40 |
三个组件分别贡献 ~1 分,叠加恰好恢复至 baseline。**Design Study I**(边界选择)显示 Semantic 61.48 > Motion 59.36 > Intention 58.69**Design Study II**(解耦时机)显示 Full 61.48 > Post 61.09 > Pre 58.85 > None 58.40。
## 6. 横向对比表
### 6.1 表 1:两篇论文 Metadata 对比
| 维度 | OrbiSim[^1] | WEM[^2] |
|---|---|---|
| arXiv | 2605.16395v1 | 2605.19957v1 |
| 上线日期 | 2026-05-12 | 2026-05-19 |
| 主题分类 | cs.RO | cs.CV |
| 主要机构 | 上海交大 MoE Key Lab / NeoWorld | CASIA / 国科大 / 中关村学院 / 上交 / 北大 |
| 通讯作者 | Yunbo Wang | Xingyu Chen |
| 模型规模 | 未明示(Dynamics 小,Vision 中等) | ~5BWan2.2-TI2V-5B 主干 + CP-MoE |
| 开源现状 | 论文未提供 HF / 项目页 | [`Zoorao/WEM`](https://huggingface.co/Zoorao/WEM) · [`Zoorao/HTEWorld`](https://huggingface.co/datasets/Zoorao/HTEWorld) · [项目页](https://zgca-hmi-lab.github.io/WEM) |
| 是否新基准 | 否(沿用 robosuite / Isaac Lab / AdaManip / Physion | **是**(HTEWorld,首个混合导航-操作长视野基准) |
| 显式可微 | **是**(端到端) | 仅生成器内部 |
| 解耦轴 | 状态 vs 视觉 | 世界 vs 自我 |
### 6.2 表 2:架构对比
| 维度 | OrbiSim | WEM |
|---|---|---|
| 解耦轴 | 物理状态 $x_t$ vs 像素观测 $o_t$ | world token $S^w_k$ vs ego token $S^e_k$ |
| 状态表示 | 显式物理量(位姿/速度/关节角/点云) | 隐式 latent token192 + 64 |
| 动力学骨干 | Object-centric Transformer + AdaLN | Qwen3-VL-2B (frozen) + RCA |
| 生成骨干 | State-guided latent diffusion | CP-MoE DiT24 shared + 2×6 experton Wan2.2-TI2V-5B |
| 输出形式 | 物理状态轨迹 + RGB 观测 | RGB 视频(37 帧/chunk @ 16 FPS |
| 可微性 | 完全可微(含 APG) | 仅扩散内部可微 |
| 训练课程 | TF → cosine-annealed AR | flow-matching + mask 正则 |
| 资产支持 | 刚体 / 关节体 / 可变形体 | 取决于 BEHAVIOR-1K 资产 |
| Real-to-Sim | StaInf + PhyInf(梯度反演) | 无 |
### 6.3 表 3:评测对比
| 维度 | OrbiSim | WEM |
|---|---|---|
| 主基准 | robosuite Push、Isaac Lab Stack、AdaManip Articulated、Physion Drape | **HTEWorld**(自建)+ WorldArena |
| 关键指标 | PSNR100 / LPIPS100 / FVD / TrajErr / RL Success Rate / steps/s | EWMScoreRCBD/LPSA/CISR/PMPA/CPDM/FPHS 加权) |
| 代表数字 | RL Success **42.71%**vs DreamerV3 25.00%);TrajErr **0.4468**29.41 steps/s @ 372 MB | EWMScore **61.48**vs Cosmos-Predict 2.5-14B 55.41PAN-style 58.40 |
| OOD 表现 | FVD 597.3vs AdaWorld 1288.5 | 未单独评测 OOD 物体 |
| 跨基准能力 | 4 个仿真基准均覆盖 | HTEWorld + WorldArena 双基准 |
| 主要基线 | Vid2World、AdaWorld、SAC、PPO、PPO+RND、BC、DreamerV3、NVIDIA Newton | WoW-7B、Cosmos-Predict 2.5 (2B/14B)、PAN-style 5B、Wan2.2、CogVideoX、IRASim、Ctrl-World |
| 评测对象 | 机器人策略 + 视频生成器 | 视频生成器(长视野多指令) |
## 7. 关键结果汇总与批判分析
### 7.1 把数字摆在一起
- **OrbiSim 的"4 个 4 字"**TrajErr 0.4468、RL Success 42.71%、29.41 steps/s、OOD FVD 597.3——前两个把可微物理引擎的"控制可用性"立住,第三个把工程效率立住,第四个把 OOD 立住。
- **WEM 的"61 分故事"**EWMScore 61.485B)压过 Cosmos-Predict 2.5-14B 的 55.4114B)近 6 分,是 2026 年最干净的"结构胜过规模"案例。
### 7.2 各自的核心 Trade-off
| 维度 | OrbiSim 的取舍 | WEM 的取舍 |
|---|---|---|
| 可微性 ↑ | 通过显式物理状态 + 解耦 vision,**获得 APG** | 不显式追求;策略闭环留给下游 |
| 视频质量 | 服务于状态一致性,PSNR100 19.98 / FVD 533.9 已够用 | **优先目标**,长视野 EWMScore 61.48 |
| 长视野能力 | 100 步 rollout TrajErr 0.4468,但只测单任务 | 跨多轮指令 + 跨阶段,但 chunk 间漂移仍存 |
| 模型规模 | 小(Dynamics + 中等 Vision | 5B 全量 |
| 数据成本 | 仿真采样可控,无人工分割标注 | 依赖 BEHAVIOR-1K **实例分割掩码** |
| 资产泛化 | 三类原语统一刚体/关节/可变形 | 受限于训练资产覆盖 |
| 工程吞吐 | 29.41 steps/s @ 372 MB | 16× A100 + 35 diffusion steps,实时不可用 |
一句话:**OrbiSim 选择了"控制可用性 + 工程效率"WEM 选择了"视频质量 + 长视野指令跟随"**——它们在 Pareto 前沿的不同象限。
### 7.3 共同盲点
| 盲点 | OrbiSim | WEM |
|---|---|---|
| Sim-to-Real | 未验证 | 未验证 |
| 跨形态泛化(双足/灵巧手/移动操作) | 仅机械臂 | 部分覆盖(BEHAVIOR-1K 含移动机器人) |
| 真实视频训练 | 未涉及 | 未涉及 |
| 长视野自回归漂移 | cosine AR 缓解但未根治 | chunk 间漂移仍存(LPSA 指标可见) |
| 通用基准缺位 | 无 sim-to-real 评测协议 | HTEWorld 自家发布,待外部验证 |
| 物理参数反演 | PhyInf 仅在受控背景 | 未提供 |
两个最关键的共同盲点:
1. **都不出仿真**:所有评测都在仿真器内进行。这意味着 2026.05 的范式重塑虽然完成了"理论上更对"的结构升级,但在真实机器人侧的可用性还需要至少一个时间窗的验证;
2. **都没有公开统一基准**:OrbiSim 在四个分散基准上自评,WEM 自建 HTEWorld,两者结果**不可直接对照**。Section 9 会展开建议。
### 7.4 范式合流的可能性
把表 2 并排看,会发现 OrbiSim 与 WEM 的解耦轴**几乎是正交的**:
```
状态维度
显式 x_t
|
OrbiSim ─────┼───── 合流目标
|
latent z
|─────────→ 解耦轴
world / ego
WEM
```
一个直观的合流方案是把 OrbiSim 的 Vision 模块替换为 WEM 的 CP-MoE DiT
- **Dynamics 端继承 OrbiSim**:显式物理状态 $x_t$ + APG 支持下游 RL
- **Vision 端继承 WEM**:把 $x_t$ 同时解耦为 $x_t^w$(场景物体状态)与 $x_t^e$(机器人本体状态),分别条件化 world / ego 专家,让长视野多轮指令生成不再退化;
- **统一损失**$\mathcal{L} = \mathcal{L}_{\text{dyn}} + \mathcal{L}_{\text{FM}} + \lambda_1 \mathcal{L}_{\text{mask}} + \lambda_2 \mathcal{L}_{\text{APG}}$。
这种"OrbiSim-Dynamics × WEM-Vision"组合在理论上能同时拿到:可微策略梯度、长视野场景一致性、跨多轮指令鲁棒性。工程上,它的最大障碍是数据——既要有物理状态级标签(OrbiSim 训练范式),又要有 world/ego 分割掩码(WEM 训练范式)。BEHAVIOR-1K 是少数同时满足两者的数据源,故合流的最快路径很可能也起于 BEHAVIOR-1K。
## 8. 挑战与未来方向
### 8.1 Sim-to-Real
两篇论文的最大空缺。可行路径:
- **OrbiSim 路径**:复用 PhyInf 的梯度反演思路,在真实 RGB-D 视频上反推物理参数,把仿真器逐步"贴近"真实;同时用域随机化训练 Vision 模块,缓解光照-纹理 gap。
- **WEM 路径**:在真实示教视频上做无监督的 world/ego 分割(如用 SAM 系列 + 时序一致性),把对显式分割掩码的依赖剥离。
### 8.2 跨形态与跨场景泛化
OrbiSim 的 object-centric Transformer 已经天然支持任意物体数量,但**机器人本体形态泛化**(机械臂 → 双足 → 灵巧手)尚未验证;WEM 的 ego 分支默认指机器人本体,但单一 ego latent 难以承载灵巧手 21-DoF 这种高维状态。未来可考虑:
- 对 ego latent 做**分层**base / arm / hand);
- 在训练数据里**混合多形态机器人**,看 ego 专家是否能自发分化。
### 8.3 长视野自回归漂移
OrbiSim 的 cosine AR 与 WEM 的 chunk 化生成都缓解但未根治漂移。可探索方向:
- 引入**显式 keyframe 锚定**(类似视频压缩里的 I-frame),定期用 ground-truth 状态/帧重置;
- 借鉴 Hierarchical World Model 思路,在更高时间粒度建立"事件级"动力学。
### 8.4 统一基准
OrbiSim 与 WEM 之所以难以直接比较,是因为前者优化"控制可用性"指标、后者优化"视频质量 + 多轮指令"指标。建议社区构建一个**双视角混合基准**:
- 任务集来自 BEHAVIOR-1K / HTEWorld,保证多轮长视野;
- 指标同时包含 EWMScore(视频质量侧)与 RL Success / TrajErr(控制侧);
- 提供统一的 sim-to-real 验证桥(如真实 Aloha 机器人执行同一指令)。
### 8.5 可微性的工程化
OrbiSim 的 APG 在仿真里跑得通,但要进入工业管线,仍缺少:
- **可微接触模型**与刚体引擎的对齐验证;
- 与 Isaac Sim / Newton 现有渲染、传感器栈的接口;
- 多 GPU 训练 + 模型并行下的梯度数值稳定性测试。
## 9. 结论:哪条路线更具前景
如果只能下一个赌注,本综述给出的判断如下:
- **短期(612 个月)****WEM 路线**更易出 demo——视频生成端的工具链最成熟,HTEWorld 与开源模型已经把门槛压到了"5B 模型 + 1 张分割掩码",社区会涌现一批 world/ego 解耦的变体。
- **中期(12 年)****OrbiSim 路线**的潜在天花板更高——一旦把可微物理引擎与真实机器人闭环打通,它会重新定义"机器人仿真器"这一品类的入口,比"更好看的视频"价值高一个数量级。
- **长期(2 年以上)**:**二者合流**几乎是必然——一个不可微的世界模型无法服务策略学习,一个不能解耦世界/自我的世界模型无法服务长视野任务。预计 2027 年前后会出现首批同时具备 APG 接口与 world-ego 解耦的统一架构。
### 9.1 给读者的下一步阅读建议
1. **想做物理/控制方向研究**:先把 OrbiSim 论文与本仓库的 [`orbisim_review.md`](orbisim_review.md) 一起读,然后回到 DreamerV3、DiffTaichi、NVIDIA Newton 的源码理解可微物理的工程实现;
2. **想做生成/视频方向研究**:先看 [`wem_review.md`](wem_review.md)、HTEWorld 数据集、Cosmos-Predict 2.5 与 Wan2.2-TI2V 的对比,再回到 IRASim / Ctrl-World 评估长视野生成;
3. **想做范式融合研究**:直接以本节 §7.4 描绘的"OrbiSim-Dynamics × WEM-Vision"作为出发点,关注 BEHAVIOR-1K 的同时标注可行性;
4. **关心本仓库其他世界模型综述**:参见 [`world_models_review.md`](../world_models_review.md)、[`world_models_arxiv_2025_survey.md`](../world_models_arxiv_2025_survey.md)、[`physics_world_models_review.md`](../physics_world_models_review.md)、[`lyra2_review.md`](../lyra2_review.md) 与 [`jepa/index.md`](../jepa/index.md),本节相当于它们在 2026.05 时间点的专题切片。
## 10. 参考文献
**[1] OrbiSim: World Models as Differentiable Physics Engines for Embodied Intelligence** (2026). _Jiajian Li, Jingyuan Huang, Junru Gong, Qi Wang, Xiaokang Yang, Yunbo Wang._ arXiv:2605.16395. [[PDF]](../../papers/2605.16395v1.pdf)
**[2] World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks** (2026). _Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Xingyu Chen._ arXiv:2605.19957. [[PDF]](../../papers/2605.19957v1.pdf) · [项目页](https://zgca-hmi-lab.github.io/WEM) · [HF 模型](https://huggingface.co/Zoorao/WEM) · [HF 数据集](https://huggingface.co/datasets/Zoorao/HTEWorld)
**[3] Mastering Diverse Domains through World Models (DreamerV3)** (2023). _Danijar Hafner, Jurgis Pasukonis, Jimmy Ba, Timothy Lillicrap._ arXiv:2301.04104.
**[4] World Models** (2018). _David Ha, Jürgen Schmidhuber._ arXiv:1803.10122.
**[5] Cosmos-Predict 2.5** (2025). _NVIDIA._ 大规模视频世界模型,作为 WEM 主要基线之一。
**[6] WoW: World-on-World Generative Model** (2025). 7B 视频世界模型基线。
**[7] AdaWorld: Adaptive World Models for Robotic Manipulation** (2025). OrbiSim 的主要预测保真度基线。
**[8] Vid2World: Video-to-World Generative Models** (2025). OrbiSim 的主要视频预测基线。
**[9] I-JEPA / V-JEPA / V-JEPA 2** (20232024). _Yann LeCun et al._ Latent-only 预测范式的代表,与本文 §3.1 的 latent/pixel 解耦轴对应。详见 [`jepa/index.md`](../jepa/index.md)。
**[10] IRASim** (2025). 长视野指令跟随基准 WorldArena 的代表方法。
**[11] Ctrl-World** (2025). 同上。
**[12] Wan2.2-TI2V** (2025). WEM 的视频生成主干。
**[13] Qwen3-VL** (2025). _Alibaba._ WEM 的冻结规划器。
**[14] BEHAVIOR-1K: A Benchmark for Embodied AI with 1,000 Everyday Activities** (2023). HTEWorld 数据构建的底层资产源。
**[15] robosuite: A Modular Simulation Framework and Benchmark for Robot Learning** (2020). _Yuke Zhu et al._ OrbiSim Push / Stack 任务的基础环境。
**[16] Isaac Lab / NVIDIA Newton** (20242026). 经典 / 可微物理仿真器,OrbiSim 的对照参照系。
**[17] Physion: Evaluating Physical Prediction from Vision in Humans and Machines** (2021). OrbiSim 可变形物体(Drape)任务的来源。
**[18] AdaManip** (2024). OrbiSim 关节物体(Articulated)任务的来源。
**[19] DiffTaichi: Differentiable Programming for Physical Simulation** (2020). _Yuanming Hu et al._ 经典可微物理的代表。
**[20] PAN-style baselines** (2025). WEM 的"无解耦同规模 5B"对照组。