docs(research): add world-models paradigm-redesign-2026 survey
Sync to site1 / sync (push) Has been cancelled

- Add literature survey on 2026.05 dual paradigm-shifting works:
  OrbiSim (differentiable physics engine) and WEM (world-ego disentanglement)
- Files: _index.md, orbisim_review.md, wem_review.md, joint_synthesis.md
- Update research/world-models/_index.md to register new sub-section
This commit is contained in:
gaojie
2026-05-21 09:15:25 +08:00
parent d63d3ebc69
commit 732706bb6f
5 changed files with 806 additions and 0 deletions
@@ -0,0 +1,166 @@
---
title: "OrbiSim 深度解读:把世界模型重写为可微物理引擎"
date: 2026-05-20
lastmod: 2026-05-20
draft: false
summary: "OrbiSim (arXiv:2605.16395) 把世界模型重定义为端到端可微的物理引擎,通过『状态-视觉解耦』与『解析策略梯度』在 robosuite Push 上取得 42.71% 成功率,远超 DreamerV3 的 25.00%。"
tags: ["world-models", "differentiable-physics", "embodied-ai", "robosuite", "diffusion", "robotics", "OrbiSim"]
categories: ["research", "world-models"]
weight: 20
math: true
toc: true
---
## 1. 摘要复述
**OrbiSim**[^1] 由上海交通大学 MoE 人工智能重点实验室 NeoWorld 团队提出(一作 Jiajian Li / Jingyuan Huang / Junru Gong,通讯 Yunbo Wang),其核心主张是:
> 与其让世界模型在隐空间或像素域做"无约束想象",不如把它定义为**一个端到端可微、可作为 MuJoCo / PhysX / Isaac Sim 直接 drop-in 替代品的物理引擎**。
整个仿真闭环——从显式状态转移到视觉观测生成——都对动作 $a_t$ 和参数 $\theta$ 可微,从而解锁了三类经典仿真器难以处理的任务:可微接触建模、稀疏奖励下的梯度策略优化(APG)、以及直观物理推断("如果质量翻倍,物体会落在哪里?")。
实证侧,OrbiSim 在 robosuite Push 上的轨迹误差 **0.4468**、PSNR100 **19.98**,并把 RL 成功率提升到 **42.71%**(基线 DreamerV3 仅 25.00%)。
## 2. 动机:为什么"单流视频预测"不够用
作者把当前主流路线分成两端:
- **生成式世界模型**Sora、Cosmos、WoW、AdaWorld、Vid2World):擅长生成"看起来对"的视频,但物理状态隐式纠缠在像素 latent 中,对动作不可微、对约束不可控;用于 RL 时只能当 rollout buffer,无法回传梯度。
- **经典物理引擎**MuJoCo / PhysX / Isaac Sim / NVIDIA Newton):动力学精确,但**完全不可微**或只在受限接触模型下伪可微;视觉渲染另起炉灶(Omniverse / 光栅化),与神经控制器之间是黑箱接口。
OrbiSim 选择走第三条路:**用可微神经动力学吃掉经典引擎的不可微部分,再用 state-conditioned 扩散吃掉视觉渲染的离散化**。整个 pipeline 因此首次形成"动作 → 物理状态 → 像素观测"的连续微分链。
## 3. 方法
### 3.1 解耦双模块架构
OrbiSim 把世界模型拆为两个互不依赖的子模型:
$$
x_{t+1} = \mathrm{Dynamics}_\theta(x_t, a_t, c), \qquad o_t = \mathrm{Vision}_\phi(x_t, \bar{x}, \xi_t)
$$
- **OrbiSim-Dynamics**object-centric Transformer + AdaLN,输入当前物理状态 $x_t$(位姿、速度、关节角、点云特征)和动作 $a_t$,输出下一步状态 $x_{t+1}$。
- **OrbiSim-Vision**state-guided latent diffusion,把当前状态 $x_t$ 与一组**参考状态-观测对** $\bar{x}$context frame)作为条件,扩散出 RGB 观测 $o_t$。$\xi_t$ 是扩散噪声。
这种 state-vision 解耦的关键收益:**梯度只需要流经 Dynamics 这一可微通路**——对于策略优化任务,Vision 完全可以离线推理,避免扩散采样链路上的梯度退化。
### 3.2 统一资产-世界表示
OrbiSim 用三类原语描述场景:
| 物体类型 | 表示 | 编码器 |
|---|---|---|
| 刚体 | 6-DoF 位姿 + 速度 | MLP / Embedding |
| 关节体(URDF) | 关节角 + 链接位姿 | Point Transformer V3 / Sonata |
| 可变形体 | 稀疏点云 | Point Transformer V3 |
这意味着**同一份 Dynamics 网络可以承接 robosuite 的刚体推/堆、AdaManip 的铰接物体、以及 Physion 的布料模拟**,而无需为每类对象再训一个 head。
### 3.3 训练:从 Teacher Forcing 到 AR Rollout 的 Cosine 退火
为了缓解扩散与自回归滚动之间的 exposure bias,作者采用:
1. **Teacher Forcing 阶段**:每一步都用 ground-truth $x_t$ 喂入;
2. **Cosine-Annealed AR Rollout**:以余弦曲线把 ground-truth 概率从 1.0 退火到 0.0,逐步切换到自回归;
3. **Context Frame Sparsification**:训练时对 $\bar{x}$ 中的参考帧数量做随机稀疏,使推理时无论给 1 帧还是 8 帧条件都稳定。
### 3.4 Real-to-SimStaInf + PhyInf
OrbiSim 提供两条 Real-to-Sim 通路:
- **StaInf**State Inference):单帧 RGB → 可见状态(位姿、关节角)。
- **PhyInf**Physics Inference):64 帧视频 → 隐藏物理参数(质量、摩擦),通过把 Dynamics 当作可微前向、用梯度优化反推 $\theta_\text{phys}$。
PhyInf 是这条路线最具想象力的副产物——经典仿真器只能"前向 + 网格搜索"调参,OrbiSim 因可微而支持**梯度反演**。
### 3.5 解析策略梯度(APG
在 RL 训练时,作者只让梯度沿 Dynamics 反传,绕开视觉渲染器:
$$
\nabla_\pi J \;=\; \sum_t \frac{\partial r_t}{\partial x_t} \cdot \prod_{k < t} \frac{\partial x_{k+1}}{\partial x_k} \cdot \frac{\partial \pi_\pi(a_k|x_k)}{\partial \pi}
$$
这一设计回避了扩散采样的高方差梯度,是 OrbiSim 在稀疏奖励任务上反超 DreamerV3 / SAC / PPO 的关键。
## 4. 实验
### 4.1 预测保真度(robosuite Push, 100 步 rollout
| 模型 | PSNR100 ↑ | LPIPS100 ↓ | FVD ↓ | TrajErr ↓ |
|---|---|---|---|---|
| AdaWorld[^4] | 16.4 | 0.214 | 992.1 | 1.082 |
| Vid2World[^5] | 17.2 | 0.183 | 814.6 | 0.873 |
| **OrbiSim** | **19.98** | **0.1428** | **533.9** | **0.4468** |
- TrajErr(轨迹位置误差)跌到基线的 **41%51%**,说明状态-视觉解耦确实把"物理对不对"和"画面好不好看"两个问题分别解决了。
- OOD(未见物体形状)FVD 597.3 vs AdaWorld 1288.5,泛化半径同样领先。
### 4.2 强化学习成功率(robosuite Push
| 方法 | 成功率 |
|---|---|
| SAC | 0.00% |
| PPO + RND | 2.08% |
| BC(行为克隆) | 19.79% |
| DreamerV3[^2] | 25.00% |
| **OrbiSim (APG)** | **42.71%** |
注:SAC / PPO 在稀疏奖励下基本无法启动,DreamerV3 通过 latent 想象拿到 25%OrbiSim 凭借**真实物理梯度**几乎再翻一倍。
### 4.3 训练效率
- **OrbiSim**29.41 steps/s @ 372 MB VRAM
- **DreamerV3**4.54 steps/s @ 931 MB VRAM
约 6.5× 吞吐 + 2.5× 显存压缩,主因是 Dynamics 网络远小于 DreamerV3 的 RSSM + decoder 组合。
### 4.4 关键 Ablation
- **去掉状态-视觉解耦**(端到端梯度过扩散):APG 训练发散,成功率跌至 BC 水平;
- **去掉 cosine AR**(纯 teacher forcing):PSNR100 下降约 2 dB,长视野 FVD 翻倍;
- **去掉 Object-Centric Transformer**(换 token-mixed Transformer):多物体场景接触建模失效,TrajErr 翻 1.8×。
## 5. 个人评析
### 5.1 OrbiSim 真正解决了什么
它不是"又一个比 Dreamer 强的世界模型"。它的范式贡献在于**把世界模型搬到"可作为通用机器人仿真器替代品"的位置上**——这是一个之前只有 MuJoCo / Isaac Sim 占据的高地。具体看:
- 把"动力学精度"和"视觉渲染"解耦,恰好对应经典仿真器内部的 physics step / render step
- 把可微性贯穿到位姿层而非 latent 层,使下游可以直接接 APG、可微接触、可微反演——这是真正的"physics engine for embodied intelligence"。
### 5.2 真正的硬约束
1. **真实域几乎没碰**:所有实验都在 robosuite / Isaac Lab / AdaManip / Physion 仿真内做,sim-to-real gap 是个空白;
2. **跨机器人形态泛化**:论文只展示了机械臂任务,移动操作、双足、灵巧手都未触及;
3. **PhyInf 的反演鲁棒性**64 帧视频反推 mass / friction 在受控背景下成立,复杂遮挡 / 光照变化下未验证;
4. **离"通用仿真器"还有距离**:流体、软体大变形、断裂、声学等仍未覆盖,与 NVIDIA Newton 等工程目标相比仍是研究原型。
### 5.3 一句话总结
OrbiSim 是 2026 年最有力地把"世界模型 = 可微物理引擎"这一**口号转成可跑代码**的工作,但其影响力会被"还需多少年才能真正替代 Isaac Sim 一线工作流"这个工程问题严重制约。
## 6. 与同期工作的关系
- **vs WEM**[^7]WEM 走视频生成端的解耦(world / ego),OrbiSim 走仿真引擎端的解耦(state / vision)。两者**几乎完全互补**——见 [`joint_synthesis.md`](joint_synthesis.md) §7。
- **vs DreamerV3**[^2]Dreamer 在 latent 中做"想象"OrbiSim 在物理状态空间中做"仿真";前者牺牲物理一致换样本效率,后者用更精确的 dynamics 换了梯度可用性。
- **vs NVIDIA Newton**Newton 是经典可微物理路线(解析雅可比),OrbiSim 是神经可微路线(自动微分通过 Transformer)。前者保证物理无误差,后者用网络容量换泛化。
- **vs AdaWorld / Vid2World**[^4][^5]:被 OrbiSim 在 PSNR / FVD / TrajErr 上全方位超越,但这两者本就不以物理精度为目标——比较仅说明"video-only" 范式不适合精确控制。
## 参考文献
[^1]: **OrbiSim: World Models as Differentiable Physics Engines for Embodied Intelligence** (2026). _Jiajian Li, Jingyuan Huang, Junru Gong, Qi Wang, Xiaokang Yang, Yunbo Wang._ arXiv:2605.16395. [[PDF]](../../papers/2605.16395v1.pdf)
[^2]: **Mastering Diverse Domains through World Models (DreamerV3)** (2023). _Danijar Hafner et al._ arXiv:2301.04104.
[^3]: **robosuite: A Modular Simulation Framework and Benchmark for Robot Learning** (2020). _Yuke Zhu et al._
[^4]: **AdaWorld: Adaptive World Models for Robotic Manipulation** (2025).
[^5]: **Vid2World: Video-to-World Generative Models** (2025).
[^6]: **Physion: Evaluating Physical Prediction from Vision in Humans and Machines** (2021).
[^7]: **World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks** (2026). _Zuyao Lin et al._ arXiv:2605.19957. [[PDF]](../../papers/2605.19957v1.pdf)