docs(research): add world-models paradigm-redesign-2026 survey
Sync to site1 / sync (push) Has been cancelled
Sync to site1 / sync (push) Has been cancelled
- Add literature survey on 2026.05 dual paradigm-shifting works: OrbiSim (differentiable physics engine) and WEM (world-ego disentanglement) - Files: _index.md, orbisim_review.md, wem_review.md, joint_synthesis.md - Update research/world-models/_index.md to register new sub-section
This commit is contained in:
@@ -0,0 +1,385 @@
|
||||
---
|
||||
title: "世界模型的范式重塑:从单流视频预测到结构化解耦——OrbiSim 与 WEM 综合评析"
|
||||
date: 2026-05-20
|
||||
lastmod: 2026-05-20
|
||||
draft: false
|
||||
summary: "2026 年 5 月几乎同期发布的 OrbiSim 与 WEM 共同向『单流视频世界模型』发起范式挑战:前者把世界模型重写为可微物理引擎(状态-视觉解耦),后者把它重写为世界-自我解耦的视频生成器。本文给出形式化、分类法、对比表、批判分析与合流前景。"
|
||||
tags: ["world-models", "embodied-ai", "differentiable-physics", "world-ego-disentanglement", "diffusion", "robotics", "taxonomy", "2026"]
|
||||
categories: ["research", "world-models"]
|
||||
weight: 10
|
||||
math: true
|
||||
toc: true
|
||||
---
|
||||
|
||||
## 1. 引言
|
||||
|
||||
世界模型(World Model)从 2018 年 Ha & Schmidhuber 的 latent-RNN 雏形出发,在 2022–2024 年间被 DreamerV3、Sora、GAIA、Cosmos、JEPA 等一系列工作推向高潮。但从 2025 年开始,研究社区逐渐意识到一个尴尬事实:**虽然视频质量、分辨率、时长都在指数级增长,世界模型在真正具身任务上的表现却进入了瓶颈**。生成模型能"画出"一段看起来合理的未来视频,却不能在那段视频里完成稀疏奖励的强化学习、也不能在长视野的混合导航-操作任务中保持场景一致——更不用说为控制策略提供可用的解析梯度。这种"看上去越来越像、用起来越来越难"的撕裂感,是 2026 年开年的核心张力。
|
||||
|
||||
问题根源逐渐收敛到一个共识:当代主流的"视频预测器式"世界模型把太多东西揉在了一条流里。**物理状态和像素观测被纠缠在 latent 中**——所以梯度不能干净地流回策略;**持久的场景规律和瞬时的机器人本体动力学也被塞进同一个生成头**——所以长视野自回归会同时被场景漂移和指令噪声放大。两个问题都不是参数量能解决的:Cosmos-Predict 2.5 从 2B 扩到 14B,在长视野基准上只多了 0.58 分;DreamerV3 与各类 video predictor 在稀疏奖励控制任务上始终被卡在 ~25% 成功率。
|
||||
|
||||
2026 年 5 月,几乎在同一周里,两篇风格迥异但底层主张惊人一致的论文先后登陆 arXiv,构成了我们所谓的"**范式重塑双子星**":上海交通大学的 **OrbiSim**(arXiv:2605.16395[^1],2026-05-12)把世界模型重新定义为**端到端可微的物理引擎**,主张"状态 vs 视觉"分流;CASIA 与北大、上交联合提出的 **WEM**(arXiv:2605.19957[^2],2026-05-19)把世界模型重新定义为**世界-自我双分支的视频生成器**,主张"world vs ego"分流。一个把单流模型向下打回到"可微仿真器",一个把它向上抬高为"双分支生成器"——两条路从两端夹击同一个旧范式。
|
||||
|
||||
本综述把范围严格收敛到这两篇 2026 年 5 月同期工作上,目的是:(i) 用统一的形式化语言抽出两者的范式骨架;(ii) 建立一个用于解析后续工作的分类法;(iii) 用对比表把它们与 2024–2026 的代表性基线放在同一张坐标系下;(iv) 给出批判性评价与合流可能性的具体建议。文章组织如下:第 2 节给出符号系统与三类世界模型的数学定义;第 3 节建立分类法(解耦轴 / 可微性 / 评测载体);第 4–5 节分别深入剖析 OrbiSim 与 WEM 的核心机制;第 6 节用三张表给出 metadata / 架构 / 评测的横向对比;第 7 节是关键结果汇总与批判分析;第 8 节讨论合流前景;第 9 节展望挑战;第 10 节给出读者下一步的阅读建议。两篇论文的单篇详细解读分别在 [`orbisim_review.md`](orbisim_review.md) 与 [`wem_review.md`](wem_review.md)。
|
||||
|
||||
## 2. 问题定义与符号表
|
||||
|
||||
### 2.1 经典世界模型
|
||||
|
||||
最一般的世界模型可形式化为一个由动力学 $f$ 与观测函数 $g$ 组成的可控动力系统:
|
||||
|
||||
$$
|
||||
s_{t+1} = f_\theta(s_t, a_t) + \epsilon_t, \qquad o_t = g_\phi(s_t) + \nu_t
|
||||
$$
|
||||
|
||||
其中 $s_t$ 是隐状态,$a_t$ 是动作,$o_t$ 是观测,$\epsilon_t, \nu_t$ 是噪声。Ha & Schmidhuber、PlaNet、Dreamer 系列都属于这一框架,区别只在 $f, g$ 的具体实例化与训练目标。
|
||||
|
||||
这一通用框架下,2024–2025 年的主流路线——Sora / Cosmos / WoW / Wan2.2 / AdaWorld / Vid2World——本质上是把 $f$ 和 $g$ 融合为**单一的视频自回归 / 扩散生成器** $\mathcal{V}_\theta$:
|
||||
|
||||
$$
|
||||
o_{t+1:t+H} = \mathcal{V}_\theta(o_{t-K:t}, a_{t:t+H-1}, \text{instr})
|
||||
$$
|
||||
|
||||
显式状态 $s_t$ 在这一范式中**消失了**——所有信息都流入像素隐空间。这正是 OrbiSim 与 WEM 共同攻击的目标。
|
||||
|
||||
### 2.2 OrbiSim 的可微链
|
||||
|
||||
OrbiSim 把世界模型**重新分裂回 $f$ 和 $g$**,但二者都用神经网络实例化并保持端到端可微:
|
||||
|
||||
$$
|
||||
\underbrace{x_{t+1} = \mathrm{Dynamics}_\theta(x_t, a_t, c)}_{\text{显式物理状态转移}}, \qquad
|
||||
\underbrace{o_t = \mathrm{Vision}_\phi(x_t, \bar{x}, \xi_t)}_{\text{state-guided latent diffusion}}
|
||||
$$
|
||||
|
||||
其中 $x_t$ 是显式物理状态(位姿、速度、关节角、点云特征),$\bar{x}$ 是一组参考状态-观测对,$\xi_t$ 是扩散噪声。关键性质是:策略梯度只需要 $\partial x_{t+1} / \partial x_t$ 与 $\partial r_t / \partial x_t$,可以**完全绕开 Vision 这条扩散链**:
|
||||
|
||||
$$
|
||||
\nabla_\pi J = \sum_t \frac{\partial r_t}{\partial x_t} \cdot \prod_{k < t} \frac{\partial x_{k+1}}{\partial x_k} \cdot \frac{\partial \pi(a_k|x_k)}{\partial \pi}
|
||||
$$
|
||||
|
||||
这就是 OrbiSim 的"解析策略梯度(Analytic Policy Gradient, APG)"——它在数学上等价于经典可微物理引擎(如 DiffTaichi)上的梯度,但把可微部分从手写的解析雅可比换成了神经网络的自动微分。
|
||||
|
||||
### 2.3 WEM 的世界-自我解耦
|
||||
|
||||
WEM 选择不动 $g$(依然是扩散视频生成),但把隐空间 $S_k$ 显式切成两支:
|
||||
|
||||
$$
|
||||
S_k = S^{w}_k \oplus S^{e}_k
|
||||
$$
|
||||
|
||||
其中 $S^{w}_k$ 承载指令无关的场景持久信息(world state),$S^{e}_k$ 承载指令条件化的机器人本体动力学(ego state)。生成目标是 flow-matching 损失加上一个掩码一致性正则:
|
||||
|
||||
$$
|
||||
\mathcal{L} = \mathcal{L}_{\text{FM}}\bigl(\hat{v}_\theta(S_k, \text{instr}, t), v^{*}_k\bigr) + \lambda\, \mathcal{L}_{\text{mask}}(S^{w}_k, S^{e}_k)
|
||||
$$
|
||||
|
||||
WEM 对这一分解给出了三种**边界定义**(motion / semantic / intention)和三种**解耦策略**(pre / post / full)的笛卡尔积研究,最终 *(semantic, full)* 组合最优。
|
||||
|
||||
### 2.4 三者并置
|
||||
|
||||
| 路线 | 隐变量 | 可微范围 | 控制接口 |
|
||||
|---|---|---|---|
|
||||
| 单流视频预测 (Cosmos/WoW) | 单一 latent $z_t$ | 生成器内部 | 仅可作 rollout buffer |
|
||||
| OrbiSim | 显式物理状态 $x_t$ + 视觉 latent | 全链 ($x$ 与 $o$) | 解析策略梯度 (APG) |
|
||||
| WEM | 双隐变量 $S^w_k, S^e_k$ | 生成器内部 | 视频质量 / 长视野指令跟随 |
|
||||
|
||||
## 3. 分类法(Taxonomy)
|
||||
|
||||
为把 OrbiSim、WEM 与既有工作放进同一张坐标系,本节建立一棵围绕"范式重塑"的分类树。
|
||||
|
||||
```mermaid
|
||||
graph TD
|
||||
A[世界模型 范式] --> B[1. 解耦轴]
|
||||
A --> C[2. 可微性]
|
||||
A --> D[3. 评测载体]
|
||||
|
||||
B --> B1[无解耦<br/>Cosmos · WoW · Sora]
|
||||
B --> B2[状态/视觉解耦<br/><b>OrbiSim</b>]
|
||||
B --> B3[世界/自我解耦<br/><b>WEM</b>]
|
||||
B --> B4[latent/pixel 解耦<br/>JEPA 系]
|
||||
|
||||
C --> C1[不可微<br/>MuJoCo · PhysX · Isaac Sim]
|
||||
C --> C2[仅生成可微<br/>Cosmos · WoW · Wan2.2 · <b>WEM</b>]
|
||||
C --> C3[完全可微<br/><b>OrbiSim</b> · DiffTaichi · NVIDIA Newton]
|
||||
|
||||
D --> D1[物理控制<br/>RL 成功率 · TrajErr · APG<br/><b>OrbiSim</b> · DreamerV3]
|
||||
D --> D2[视频质量<br/>FVD · PSNR · LPIPS<br/>Sora · Cosmos · <b>WEM</b>]
|
||||
D --> D3[长视野指令跟随<br/>EWMScore · WorldArena<br/><b>WEM</b> · IRASim · Ctrl-World]
|
||||
```
|
||||
|
||||
### 3.1 按解耦轴
|
||||
|
||||
- **无解耦(单流)**:Cosmos-Predict、WoW、Sora、Wan2.2 等,所有信息共享一个 latent。
|
||||
- **状态/视觉解耦**:OrbiSim 是 2026 年代表,物理状态与像素观测分别由 Dynamics 与 Vision 子网络处理。
|
||||
- **世界/自我解耦**:WEM 是 2026 年代表,场景信息与机器人本体在 token 级、注意力级、专家级三层全部分流。
|
||||
- **latent/pixel 解耦**:JEPA 系(I-JEPA、V-JEPA、V-JEPA 2)抛弃像素重建,只在 latent 中做掩码预测。
|
||||
|
||||
### 3.2 按可微性
|
||||
|
||||
- **不可微**:MuJoCo、PhysX、Isaac Sim、Bullet——经典物理引擎,雅可比通常不导出或受限于刚体接触。
|
||||
- **仅生成可微**:扩散视频模型与 WEM 在像素层面是可微的,但策略梯度需要穿过整条 denoising 链,方差大、显存高。
|
||||
- **完全可微**:OrbiSim、DiffTaichi、NVIDIA Newton(解析)、Brax/JAX-MD(解析)——可直接将梯度回传给策略 / 形状 / 物理参数。
|
||||
|
||||
### 3.3 按评测载体
|
||||
|
||||
- **物理控制**:以 robosuite、Isaac Lab、AdaManip、Physion 为主,关注 RL 成功率、轨迹误差、可微反演——OrbiSim 的主场。
|
||||
- **视频质量**:以 UCF-101、Kinetics、内部数据为主,关注 FVD、PSNR、LPIPS——Cosmos、Sora、WoW 的主场。
|
||||
- **长视野指令跟随**:以 HTEWorld、WorldArena、CALVIN-long 为主,关注 EWMScore、多轮指令一致性——WEM 与 IRASim、Ctrl-World 的主场。
|
||||
|
||||
## 4. 方法详解 I:OrbiSim
|
||||
|
||||
### 4.1 架构原理
|
||||
|
||||
OrbiSim 把世界模型拆为两个互不依赖的子模块:
|
||||
|
||||
- **OrbiSim-Dynamics**:object-centric Transformer + AdaLN,把每个物体作为 token,预测其在下一时刻的位姿、速度、关节角;
|
||||
- **OrbiSim-Vision**:state-guided latent diffusion,把当前状态 $x_t$ 与一组参考状态-观测对 $\bar{x}$ 作为条件,扩散出 RGB 观测 $o_t$。
|
||||
|
||||
资产层用三类原语统一表示:刚体(6-DoF 位姿 + 速度,Embedding 编码)、关节体(URDF + Point Transformer V3 / Sonata)、可变形体(稀疏点云)。这意味着同一份 Dynamics 网络可以承接 robosuite 推/堆、AdaManip 铰接、Physion 布料模拟,无需为每类对象单独训练 head。
|
||||
|
||||
### 4.2 训练策略
|
||||
|
||||
为了让自回归滚动稳定,OrbiSim 采用两阶段课程:
|
||||
|
||||
1. **Teacher Forcing**:以 ground-truth $x_t$ 喂入;
|
||||
2. **Cosine-Annealed AR Rollout**:用余弦曲线将 ground-truth 概率从 1.0 退火到 0.0,逐步切换到自回归。
|
||||
|
||||
视觉端引入 **Context Frame Sparsification**——训练时随机稀疏参考帧数量,使推理时 1–8 帧条件下均稳定。
|
||||
|
||||
Real-to-Sim 通路有两条:**StaInf**(单帧 RGB → 可见状态)与 **PhyInf**(64 帧视频 → 隐藏物理参数)。后者把 Dynamics 当作可微前向,**用梯度反演 mass、friction 等隐藏参数**——这是经典仿真器只能"前向 + 网格搜索"完成的事情。
|
||||
|
||||
### 4.3 关键 Ablation
|
||||
|
||||
- **去掉状态-视觉解耦**(让策略梯度穿过扩散链):APG 训练发散,成功率跌回 BC 水平(~20%);
|
||||
- **去掉 cosine AR**(纯 teacher forcing):PSNR100 下降约 2 dB,长视野 FVD 翻倍;
|
||||
- **去掉 Object-Centric Transformer**(换 token-mixed Transformer):多物体接触建模失效,TrajErr 翻 1.8×。
|
||||
|
||||
三个 ablation 共同指出:**OrbiSim 的性能并非源于参数堆叠,而是源于显式物理状态 + 可微通路 + 物体中心化表示的协同**。
|
||||
|
||||
## 5. 方法详解 II:WEM
|
||||
|
||||
### 5.1 架构原理
|
||||
|
||||
WEM 由两段构成:
|
||||
|
||||
- **冻结的 Qwen3-VL-2B 规划器** + **Role-Conditioned Attention (RCA)** + **不对称 query 预算(192 world / 64 ego)**——输出 256 个 condition token,自带 world / ego 角色标签。
|
||||
- **CP-MoE DiT 生成器**(基于 Wan2.2-TI2V-5B):24 个共享 block → semantic head 路由 → world 专家 6 block / ego 专家 6 block 并行 → unrouting → flow-matching head。
|
||||
|
||||
其中 **Asymmetric Query Budget** 的设计直觉是:场景信息丰富但变化慢,分配 192 token;机器人本体信息少但密集,分配 64 token。**Neighbor-Expanded Routing** 把 hard top-1 路由改为带空间邻居的软路由,避免边界处的语义切割伪影。
|
||||
|
||||
### 5.2 训练策略
|
||||
|
||||
16× A100 80GB;lr = 1e-5;EMA 0.99;4 epochs;480×480 @ 16 FPS;35 diffusion steps;37 frames / chunk。数据基于 BEHAVIOR-1K 构建:125K 训练片段(>4.5M 帧)。HTEWorld 评测集另含 300 条多轮轨迹(>2K 指令)。
|
||||
|
||||
### 5.3 关键 Ablation
|
||||
|
||||
| 移除组件 | EWMScore |
|
||||
|---|---|
|
||||
| 完整 WEM | 61.48 |
|
||||
| − Asymmetric Query Budget | 60.50 |
|
||||
| − Role-Conditioned Attention | 60.64 |
|
||||
| − Neighbor-Expanded Routing | 59.57 |
|
||||
| 无解耦(PAN-style baseline) | 58.40 |
|
||||
|
||||
三个组件分别贡献 ~1 分,叠加恰好恢复至 baseline。**Design Study I**(边界选择)显示 Semantic 61.48 > Motion 59.36 > Intention 58.69;**Design Study II**(解耦时机)显示 Full 61.48 > Post 61.09 > Pre 58.85 > None 58.40。
|
||||
|
||||
## 6. 横向对比表
|
||||
|
||||
### 6.1 表 1:两篇论文 Metadata 对比
|
||||
|
||||
| 维度 | OrbiSim[^1] | WEM[^2] |
|
||||
|---|---|---|
|
||||
| arXiv | 2605.16395v1 | 2605.19957v1 |
|
||||
| 上线日期 | 2026-05-12 | 2026-05-19 |
|
||||
| 主题分类 | cs.RO | cs.CV |
|
||||
| 主要机构 | 上海交大 MoE Key Lab / NeoWorld | CASIA / 国科大 / 中关村学院 / 上交 / 北大 |
|
||||
| 通讯作者 | Yunbo Wang | Xingyu Chen |
|
||||
| 模型规模 | 未明示(Dynamics 小,Vision 中等) | ~5B(Wan2.2-TI2V-5B 主干 + CP-MoE) |
|
||||
| 开源现状 | 论文未提供 HF / 项目页 | [`Zoorao/WEM`](https://huggingface.co/Zoorao/WEM) · [`Zoorao/HTEWorld`](https://huggingface.co/datasets/Zoorao/HTEWorld) · [项目页](https://zgca-hmi-lab.github.io/WEM) |
|
||||
| 是否新基准 | 否(沿用 robosuite / Isaac Lab / AdaManip / Physion) | **是**(HTEWorld,首个混合导航-操作长视野基准) |
|
||||
| 显式可微 | **是**(端到端) | 仅生成器内部 |
|
||||
| 解耦轴 | 状态 vs 视觉 | 世界 vs 自我 |
|
||||
|
||||
### 6.2 表 2:架构对比
|
||||
|
||||
| 维度 | OrbiSim | WEM |
|
||||
|---|---|---|
|
||||
| 解耦轴 | 物理状态 $x_t$ vs 像素观测 $o_t$ | world token $S^w_k$ vs ego token $S^e_k$ |
|
||||
| 状态表示 | 显式物理量(位姿/速度/关节角/点云) | 隐式 latent token(192 + 64) |
|
||||
| 动力学骨干 | Object-centric Transformer + AdaLN | Qwen3-VL-2B (frozen) + RCA |
|
||||
| 生成骨干 | State-guided latent diffusion | CP-MoE DiT(24 shared + 2×6 expert)on Wan2.2-TI2V-5B |
|
||||
| 输出形式 | 物理状态轨迹 + RGB 观测 | RGB 视频(37 帧/chunk @ 16 FPS) |
|
||||
| 可微性 | 完全可微(含 APG) | 仅扩散内部可微 |
|
||||
| 训练课程 | TF → cosine-annealed AR | flow-matching + mask 正则 |
|
||||
| 资产支持 | 刚体 / 关节体 / 可变形体 | 取决于 BEHAVIOR-1K 资产 |
|
||||
| Real-to-Sim | StaInf + PhyInf(梯度反演) | 无 |
|
||||
|
||||
### 6.3 表 3:评测对比
|
||||
|
||||
| 维度 | OrbiSim | WEM |
|
||||
|---|---|---|
|
||||
| 主基准 | robosuite Push、Isaac Lab Stack、AdaManip Articulated、Physion Drape | **HTEWorld**(自建)+ WorldArena |
|
||||
| 关键指标 | PSNR100 / LPIPS100 / FVD / TrajErr / RL Success Rate / steps/s | EWMScore(RCBD/LPSA/CISR/PMPA/CPDM/FPHS 加权) |
|
||||
| 代表数字 | RL Success **42.71%**(vs DreamerV3 25.00%);TrajErr **0.4468**;29.41 steps/s @ 372 MB | EWMScore **61.48**(vs Cosmos-Predict 2.5-14B 55.41,PAN-style 58.40) |
|
||||
| OOD 表现 | FVD 597.3(vs AdaWorld 1288.5) | 未单独评测 OOD 物体 |
|
||||
| 跨基准能力 | 4 个仿真基准均覆盖 | HTEWorld + WorldArena 双基准 |
|
||||
| 主要基线 | Vid2World、AdaWorld、SAC、PPO、PPO+RND、BC、DreamerV3、NVIDIA Newton | WoW-7B、Cosmos-Predict 2.5 (2B/14B)、PAN-style 5B、Wan2.2、CogVideoX、IRASim、Ctrl-World |
|
||||
| 评测对象 | 机器人策略 + 视频生成器 | 视频生成器(长视野多指令) |
|
||||
|
||||
## 7. 关键结果汇总与批判分析
|
||||
|
||||
### 7.1 把数字摆在一起
|
||||
|
||||
- **OrbiSim 的"4 个 4 字"**:TrajErr 0.4468、RL Success 42.71%、29.41 steps/s、OOD FVD 597.3——前两个把可微物理引擎的"控制可用性"立住,第三个把工程效率立住,第四个把 OOD 立住。
|
||||
- **WEM 的"61 分故事"**:EWMScore 61.48(5B)压过 Cosmos-Predict 2.5-14B 的 55.41(14B)近 6 分,是 2026 年最干净的"结构胜过规模"案例。
|
||||
|
||||
### 7.2 各自的核心 Trade-off
|
||||
|
||||
| 维度 | OrbiSim 的取舍 | WEM 的取舍 |
|
||||
|---|---|---|
|
||||
| 可微性 ↑ | 通过显式物理状态 + 解耦 vision,**获得 APG** | 不显式追求;策略闭环留给下游 |
|
||||
| 视频质量 | 服务于状态一致性,PSNR100 19.98 / FVD 533.9 已够用 | **优先目标**,长视野 EWMScore 61.48 |
|
||||
| 长视野能力 | 100 步 rollout TrajErr 0.4468,但只测单任务 | 跨多轮指令 + 跨阶段,但 chunk 间漂移仍存 |
|
||||
| 模型规模 | 小(Dynamics + 中等 Vision) | 5B 全量 |
|
||||
| 数据成本 | 仿真采样可控,无人工分割标注 | 依赖 BEHAVIOR-1K **实例分割掩码** |
|
||||
| 资产泛化 | 三类原语统一刚体/关节/可变形 | 受限于训练资产覆盖 |
|
||||
| 工程吞吐 | 29.41 steps/s @ 372 MB | 16× A100 + 35 diffusion steps,实时不可用 |
|
||||
|
||||
一句话:**OrbiSim 选择了"控制可用性 + 工程效率",WEM 选择了"视频质量 + 长视野指令跟随"**——它们在 Pareto 前沿的不同象限。
|
||||
|
||||
### 7.3 共同盲点
|
||||
|
||||
| 盲点 | OrbiSim | WEM |
|
||||
|---|---|---|
|
||||
| Sim-to-Real | 未验证 | 未验证 |
|
||||
| 跨形态泛化(双足/灵巧手/移动操作) | 仅机械臂 | 部分覆盖(BEHAVIOR-1K 含移动机器人) |
|
||||
| 真实视频训练 | 未涉及 | 未涉及 |
|
||||
| 长视野自回归漂移 | cosine AR 缓解但未根治 | chunk 间漂移仍存(LPSA 指标可见) |
|
||||
| 通用基准缺位 | 无 sim-to-real 评测协议 | HTEWorld 自家发布,待外部验证 |
|
||||
| 物理参数反演 | PhyInf 仅在受控背景 | 未提供 |
|
||||
|
||||
两个最关键的共同盲点:
|
||||
|
||||
1. **都不出仿真**:所有评测都在仿真器内进行。这意味着 2026.05 的范式重塑虽然完成了"理论上更对"的结构升级,但在真实机器人侧的可用性还需要至少一个时间窗的验证;
|
||||
2. **都没有公开统一基准**:OrbiSim 在四个分散基准上自评,WEM 自建 HTEWorld,两者结果**不可直接对照**。Section 9 会展开建议。
|
||||
|
||||
### 7.4 范式合流的可能性
|
||||
|
||||
把表 2 并排看,会发现 OrbiSim 与 WEM 的解耦轴**几乎是正交的**:
|
||||
|
||||
```
|
||||
状态维度
|
||||
↑
|
||||
显式 x_t
|
||||
|
|
||||
OrbiSim ─────┼───── 合流目标
|
||||
|
|
||||
latent z
|
||||
|─────────→ 解耦轴
|
||||
world / ego
|
||||
↑
|
||||
WEM
|
||||
```
|
||||
|
||||
一个直观的合流方案是把 OrbiSim 的 Vision 模块替换为 WEM 的 CP-MoE DiT:
|
||||
|
||||
- **Dynamics 端继承 OrbiSim**:显式物理状态 $x_t$ + APG 支持下游 RL;
|
||||
- **Vision 端继承 WEM**:把 $x_t$ 同时解耦为 $x_t^w$(场景物体状态)与 $x_t^e$(机器人本体状态),分别条件化 world / ego 专家,让长视野多轮指令生成不再退化;
|
||||
- **统一损失**:$\mathcal{L} = \mathcal{L}_{\text{dyn}} + \mathcal{L}_{\text{FM}} + \lambda_1 \mathcal{L}_{\text{mask}} + \lambda_2 \mathcal{L}_{\text{APG}}$。
|
||||
|
||||
这种"OrbiSim-Dynamics × WEM-Vision"组合在理论上能同时拿到:可微策略梯度、长视野场景一致性、跨多轮指令鲁棒性。工程上,它的最大障碍是数据——既要有物理状态级标签(OrbiSim 训练范式),又要有 world/ego 分割掩码(WEM 训练范式)。BEHAVIOR-1K 是少数同时满足两者的数据源,故合流的最快路径很可能也起于 BEHAVIOR-1K。
|
||||
|
||||
## 8. 挑战与未来方向
|
||||
|
||||
### 8.1 Sim-to-Real
|
||||
|
||||
两篇论文的最大空缺。可行路径:
|
||||
|
||||
- **OrbiSim 路径**:复用 PhyInf 的梯度反演思路,在真实 RGB-D 视频上反推物理参数,把仿真器逐步"贴近"真实;同时用域随机化训练 Vision 模块,缓解光照-纹理 gap。
|
||||
- **WEM 路径**:在真实示教视频上做无监督的 world/ego 分割(如用 SAM 系列 + 时序一致性),把对显式分割掩码的依赖剥离。
|
||||
|
||||
### 8.2 跨形态与跨场景泛化
|
||||
|
||||
OrbiSim 的 object-centric Transformer 已经天然支持任意物体数量,但**机器人本体形态泛化**(机械臂 → 双足 → 灵巧手)尚未验证;WEM 的 ego 分支默认指机器人本体,但单一 ego latent 难以承载灵巧手 21-DoF 这种高维状态。未来可考虑:
|
||||
|
||||
- 对 ego latent 做**分层**(base / arm / hand);
|
||||
- 在训练数据里**混合多形态机器人**,看 ego 专家是否能自发分化。
|
||||
|
||||
### 8.3 长视野自回归漂移
|
||||
|
||||
OrbiSim 的 cosine AR 与 WEM 的 chunk 化生成都缓解但未根治漂移。可探索方向:
|
||||
|
||||
- 引入**显式 keyframe 锚定**(类似视频压缩里的 I-frame),定期用 ground-truth 状态/帧重置;
|
||||
- 借鉴 Hierarchical World Model 思路,在更高时间粒度建立"事件级"动力学。
|
||||
|
||||
### 8.4 统一基准
|
||||
|
||||
OrbiSim 与 WEM 之所以难以直接比较,是因为前者优化"控制可用性"指标、后者优化"视频质量 + 多轮指令"指标。建议社区构建一个**双视角混合基准**:
|
||||
|
||||
- 任务集来自 BEHAVIOR-1K / HTEWorld,保证多轮长视野;
|
||||
- 指标同时包含 EWMScore(视频质量侧)与 RL Success / TrajErr(控制侧);
|
||||
- 提供统一的 sim-to-real 验证桥(如真实 Aloha 机器人执行同一指令)。
|
||||
|
||||
### 8.5 可微性的工程化
|
||||
|
||||
OrbiSim 的 APG 在仿真里跑得通,但要进入工业管线,仍缺少:
|
||||
|
||||
- **可微接触模型**与刚体引擎的对齐验证;
|
||||
- 与 Isaac Sim / Newton 现有渲染、传感器栈的接口;
|
||||
- 多 GPU 训练 + 模型并行下的梯度数值稳定性测试。
|
||||
|
||||
## 9. 结论:哪条路线更具前景
|
||||
|
||||
如果只能下一个赌注,本综述给出的判断如下:
|
||||
|
||||
- **短期(6–12 个月)**:**WEM 路线**更易出 demo——视频生成端的工具链最成熟,HTEWorld 与开源模型已经把门槛压到了"5B 模型 + 1 张分割掩码",社区会涌现一批 world/ego 解耦的变体。
|
||||
- **中期(1–2 年)**:**OrbiSim 路线**的潜在天花板更高——一旦把可微物理引擎与真实机器人闭环打通,它会重新定义"机器人仿真器"这一品类的入口,比"更好看的视频"价值高一个数量级。
|
||||
- **长期(2 年以上)**:**二者合流**几乎是必然——一个不可微的世界模型无法服务策略学习,一个不能解耦世界/自我的世界模型无法服务长视野任务。预计 2027 年前后会出现首批同时具备 APG 接口与 world-ego 解耦的统一架构。
|
||||
|
||||
### 9.1 给读者的下一步阅读建议
|
||||
|
||||
1. **想做物理/控制方向研究**:先把 OrbiSim 论文与本仓库的 [`orbisim_review.md`](orbisim_review.md) 一起读,然后回到 DreamerV3、DiffTaichi、NVIDIA Newton 的源码理解可微物理的工程实现;
|
||||
2. **想做生成/视频方向研究**:先看 [`wem_review.md`](wem_review.md)、HTEWorld 数据集、Cosmos-Predict 2.5 与 Wan2.2-TI2V 的对比,再回到 IRASim / Ctrl-World 评估长视野生成;
|
||||
3. **想做范式融合研究**:直接以本节 §7.4 描绘的"OrbiSim-Dynamics × WEM-Vision"作为出发点,关注 BEHAVIOR-1K 的同时标注可行性;
|
||||
4. **关心本仓库其他世界模型综述**:参见 [`world_models_review.md`](../world_models_review.md)、[`world_models_arxiv_2025_survey.md`](../world_models_arxiv_2025_survey.md)、[`physics_world_models_review.md`](../physics_world_models_review.md)、[`lyra2_review.md`](../lyra2_review.md) 与 [`jepa/index.md`](../jepa/index.md),本节相当于它们在 2026.05 时间点的专题切片。
|
||||
|
||||
## 10. 参考文献
|
||||
|
||||
**[1] OrbiSim: World Models as Differentiable Physics Engines for Embodied Intelligence** (2026). _Jiajian Li, Jingyuan Huang, Junru Gong, Qi Wang, Xiaokang Yang, Yunbo Wang._ arXiv:2605.16395. [[PDF]](../../papers/2605.16395v1.pdf)
|
||||
|
||||
**[2] World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks** (2026). _Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Xingyu Chen._ arXiv:2605.19957. [[PDF]](../../papers/2605.19957v1.pdf) · [项目页](https://zgca-hmi-lab.github.io/WEM) · [HF 模型](https://huggingface.co/Zoorao/WEM) · [HF 数据集](https://huggingface.co/datasets/Zoorao/HTEWorld)
|
||||
|
||||
**[3] Mastering Diverse Domains through World Models (DreamerV3)** (2023). _Danijar Hafner, Jurgis Pasukonis, Jimmy Ba, Timothy Lillicrap._ arXiv:2301.04104.
|
||||
|
||||
**[4] World Models** (2018). _David Ha, Jürgen Schmidhuber._ arXiv:1803.10122.
|
||||
|
||||
**[5] Cosmos-Predict 2.5** (2025). _NVIDIA._ 大规模视频世界模型,作为 WEM 主要基线之一。
|
||||
|
||||
**[6] WoW: World-on-World Generative Model** (2025). 7B 视频世界模型基线。
|
||||
|
||||
**[7] AdaWorld: Adaptive World Models for Robotic Manipulation** (2025). OrbiSim 的主要预测保真度基线。
|
||||
|
||||
**[8] Vid2World: Video-to-World Generative Models** (2025). OrbiSim 的主要视频预测基线。
|
||||
|
||||
**[9] I-JEPA / V-JEPA / V-JEPA 2** (2023–2024). _Yann LeCun et al._ Latent-only 预测范式的代表,与本文 §3.1 的 latent/pixel 解耦轴对应。详见 [`jepa/index.md`](../jepa/index.md)。
|
||||
|
||||
**[10] IRASim** (2025). 长视野指令跟随基准 WorldArena 的代表方法。
|
||||
|
||||
**[11] Ctrl-World** (2025). 同上。
|
||||
|
||||
**[12] Wan2.2-TI2V** (2025). WEM 的视频生成主干。
|
||||
|
||||
**[13] Qwen3-VL** (2025). _Alibaba._ WEM 的冻结规划器。
|
||||
|
||||
**[14] BEHAVIOR-1K: A Benchmark for Embodied AI with 1,000 Everyday Activities** (2023). HTEWorld 数据构建的底层资产源。
|
||||
|
||||
**[15] robosuite: A Modular Simulation Framework and Benchmark for Robot Learning** (2020). _Yuke Zhu et al._ OrbiSim Push / Stack 任务的基础环境。
|
||||
|
||||
**[16] Isaac Lab / NVIDIA Newton** (2024–2026). 经典 / 可微物理仿真器,OrbiSim 的对照参照系。
|
||||
|
||||
**[17] Physion: Evaluating Physical Prediction from Vision in Humans and Machines** (2021). OrbiSim 可变形物体(Drape)任务的来源。
|
||||
|
||||
**[18] AdaManip** (2024). OrbiSim 关节物体(Articulated)任务的来源。
|
||||
|
||||
**[19] DiffTaichi: Differentiable Programming for Physical Simulation** (2020). _Yuanming Hu et al._ 经典可微物理的代表。
|
||||
|
||||
**[20] PAN-style baselines** (2025). WEM 的"无解耦同规模 5B"对照组。
|
||||
Reference in New Issue
Block a user