docs(research): add world-models paradigm-redesign-2026 survey
Sync to site1 / sync (push) Has been cancelled

- Add literature survey on 2026.05 dual paradigm-shifting works:
  OrbiSim (differentiable physics engine) and WEM (world-ego disentanglement)
- Files: _index.md, orbisim_review.md, wem_review.md, joint_synthesis.md
- Update research/world-models/_index.md to register new sub-section
This commit is contained in:
gaojie
2026-05-21 09:15:25 +08:00
parent d63d3ebc69
commit 732706bb6f
5 changed files with 806 additions and 0 deletions
@@ -0,0 +1,41 @@
---
title: "世界模型范式重塑:2026.05 双子星 OrbiSim & WEM"
date: 2026-05-20
lastmod: 2026-05-20
draft: false
summary: "针对 2026 年 5 月同期发布的 OrbiSim 与 WEM 两篇论文,从『可微物理引擎』与『世界-自我解耦』两条范式重塑路线展开深度评析与综合对比。"
tags: ["world-models", "embodied-ai", "differentiable-physics", "world-ego-disentanglement", "diffusion", "robotics", "2026"]
categories: ["research", "world-models"]
weight: 5
math: true
toc: true
---
## 综述定位
2024 年以来,世界模型(World Model)研究在两个方向上同时承压:
1. **生成式视频路线**Sora / Cosmos / WoW / Wan2.2)虽视觉保真度迅猛提升,却在物理一致性、长视野指令跟随、可控梯度三方面持续掉队;
2. **经典物理引擎路线**MuJoCo / PhysX / Isaac Sim)虽动力学精确,却完全不可微、视觉栈贫瘠,难以承接深度学习时代的数据驱动闭环。
2026 年 5 月,两篇风格迥异但主张**同源**的论文几乎在同一周登陆 arXiv,构成了我们所说的"范式重塑双子星":
- **OrbiSim**arXiv:2605.163952026-05-12,上海交通大学)——把世界模型重新定义为**端到端可微物理引擎**,提出"状态/视觉解耦 + 解析策略梯度"。
- **WEM**arXiv:2605.199572026-05-19CASIA / 北大 / 上交)——把世界模型重新定义为**世界/自我(world-ego)解耦的生成器**,并发布首个混合导航-操作长视野基准 HTEWorld。
两者一上一下地包夹了"单流视频预测器"这一旧范式:OrbiSim 把它向下打回**物理引擎**,WEM 把它向上抬入**世界-自我两支**。本子节专门用于对二者的范式取舍、机制差异与未来合流可能性进行系统分析。
## 文件导航
| 文件 | 角色 | 字数估算 |
|------|------|----------|
| [`joint_synthesis.md`](joint_synthesis.md) | **综述主文件**:范式对比 / 分类法 / 公式形式化 / 关键表格 / 批判分析 | 约 5500 字 |
| [`orbisim_review.md`](orbisim_review.md) | OrbiSim 单篇深度解读 | 约 2000 字 |
| [`wem_review.md`](wem_review.md) | WEM 单篇深度解读 | 约 2100 字 |
## 阅读建议
- 想快速建立 2026.05 范式版图:直接读 [`joint_synthesis.md`](joint_synthesis.md) 的 §3 分类法与 §5 对比表格。
- 关心**物理控制 / 强化学习 / 可微梯度**:先 [`orbisim_review.md`](orbisim_review.md),再回到主文 §7 合流讨论。
- 关心**视频生成 / 多轮指令 / 长视野基准**:先 [`wem_review.md`](wem_review.md),再回主文。
- 与本仓库既有综述的关系:见上级目录 [`world_models_review.md`](../world_models_review.md) 与 [`world_models_arxiv_2025_survey.md`](../world_models_arxiv_2025_survey.md),本节可视为它们在 2026.05 时间点上的**专题切片**。
@@ -0,0 +1,385 @@
---
title: "世界模型的范式重塑:从单流视频预测到结构化解耦——OrbiSim 与 WEM 综合评析"
date: 2026-05-20
lastmod: 2026-05-20
draft: false
summary: "2026 年 5 月几乎同期发布的 OrbiSim 与 WEM 共同向『单流视频世界模型』发起范式挑战:前者把世界模型重写为可微物理引擎(状态-视觉解耦),后者把它重写为世界-自我解耦的视频生成器。本文给出形式化、分类法、对比表、批判分析与合流前景。"
tags: ["world-models", "embodied-ai", "differentiable-physics", "world-ego-disentanglement", "diffusion", "robotics", "taxonomy", "2026"]
categories: ["research", "world-models"]
weight: 10
math: true
toc: true
---
## 1. 引言
世界模型(World Model)从 2018 年 Ha & Schmidhuber 的 latent-RNN 雏形出发,在 20222024 年间被 DreamerV3、Sora、GAIA、Cosmos、JEPA 等一系列工作推向高潮。但从 2025 年开始,研究社区逐渐意识到一个尴尬事实:**虽然视频质量、分辨率、时长都在指数级增长,世界模型在真正具身任务上的表现却进入了瓶颈**。生成模型能"画出"一段看起来合理的未来视频,却不能在那段视频里完成稀疏奖励的强化学习、也不能在长视野的混合导航-操作任务中保持场景一致——更不用说为控制策略提供可用的解析梯度。这种"看上去越来越像、用起来越来越难"的撕裂感,是 2026 年开年的核心张力。
问题根源逐渐收敛到一个共识:当代主流的"视频预测器式"世界模型把太多东西揉在了一条流里。**物理状态和像素观测被纠缠在 latent 中**——所以梯度不能干净地流回策略;**持久的场景规律和瞬时的机器人本体动力学也被塞进同一个生成头**——所以长视野自回归会同时被场景漂移和指令噪声放大。两个问题都不是参数量能解决的:Cosmos-Predict 2.5 从 2B 扩到 14B,在长视野基准上只多了 0.58 分;DreamerV3 与各类 video predictor 在稀疏奖励控制任务上始终被卡在 ~25% 成功率。
2026 年 5 月,几乎在同一周里,两篇风格迥异但底层主张惊人一致的论文先后登陆 arXiv,构成了我们所谓的"**范式重塑双子星**":上海交通大学的 **OrbiSim**arXiv:2605.16395[^1]2026-05-12)把世界模型重新定义为**端到端可微的物理引擎**,主张"状态 vs 视觉"分流;CASIA 与北大、上交联合提出的 **WEM**arXiv:2605.19957[^2]2026-05-19)把世界模型重新定义为**世界-自我双分支的视频生成器**,主张"world vs ego"分流。一个把单流模型向下打回到"可微仿真器",一个把它向上抬高为"双分支生成器"——两条路从两端夹击同一个旧范式。
本综述把范围严格收敛到这两篇 2026 年 5 月同期工作上,目的是:(i) 用统一的形式化语言抽出两者的范式骨架;(ii) 建立一个用于解析后续工作的分类法;(iii) 用对比表把它们与 2024–2026 的代表性基线放在同一张坐标系下;(iv) 给出批判性评价与合流可能性的具体建议。文章组织如下:第 2 节给出符号系统与三类世界模型的数学定义;第 3 节建立分类法(解耦轴 / 可微性 / 评测载体);第 4–5 节分别深入剖析 OrbiSim 与 WEM 的核心机制;第 6 节用三张表给出 metadata / 架构 / 评测的横向对比;第 7 节是关键结果汇总与批判分析;第 8 节讨论合流前景;第 9 节展望挑战;第 10 节给出读者下一步的阅读建议。两篇论文的单篇详细解读分别在 [`orbisim_review.md`](orbisim_review.md) 与 [`wem_review.md`](wem_review.md)。
## 2. 问题定义与符号表
### 2.1 经典世界模型
最一般的世界模型可形式化为一个由动力学 $f$ 与观测函数 $g$ 组成的可控动力系统:
$$
s_{t+1} = f_\theta(s_t, a_t) + \epsilon_t, \qquad o_t = g_\phi(s_t) + \nu_t
$$
其中 $s_t$ 是隐状态,$a_t$ 是动作,$o_t$ 是观测,$\epsilon_t, \nu_t$ 是噪声。Ha & Schmidhuber、PlaNet、Dreamer 系列都属于这一框架,区别只在 $f, g$ 的具体实例化与训练目标。
这一通用框架下,2024–2025 年的主流路线——Sora / Cosmos / WoW / Wan2.2 / AdaWorld / Vid2World——本质上是把 $f$ 和 $g$ 融合为**单一的视频自回归 / 扩散生成器** $\mathcal{V}_\theta$
$$
o_{t+1:t+H} = \mathcal{V}_\theta(o_{t-K:t}, a_{t:t+H-1}, \text{instr})
$$
显式状态 $s_t$ 在这一范式中**消失了**——所有信息都流入像素隐空间。这正是 OrbiSim 与 WEM 共同攻击的目标。
### 2.2 OrbiSim 的可微链
OrbiSim 把世界模型**重新分裂回 $f$ 和 $g$**,但二者都用神经网络实例化并保持端到端可微:
$$
\underbrace{x_{t+1} = \mathrm{Dynamics}_\theta(x_t, a_t, c)}_{\text{显式物理状态转移}}, \qquad
\underbrace{o_t = \mathrm{Vision}_\phi(x_t, \bar{x}, \xi_t)}_{\text{state-guided latent diffusion}}
$$
其中 $x_t$ 是显式物理状态(位姿、速度、关节角、点云特征),$\bar{x}$ 是一组参考状态-观测对,$\xi_t$ 是扩散噪声。关键性质是:策略梯度只需要 $\partial x_{t+1} / \partial x_t$ 与 $\partial r_t / \partial x_t$,可以**完全绕开 Vision 这条扩散链**:
$$
\nabla_\pi J = \sum_t \frac{\partial r_t}{\partial x_t} \cdot \prod_{k < t} \frac{\partial x_{k+1}}{\partial x_k} \cdot \frac{\partial \pi(a_k|x_k)}{\partial \pi}
$$
这就是 OrbiSim 的"解析策略梯度(Analytic Policy Gradient, APG"——它在数学上等价于经典可微物理引擎(如 DiffTaichi)上的梯度,但把可微部分从手写的解析雅可比换成了神经网络的自动微分。
### 2.3 WEM 的世界-自我解耦
WEM 选择不动 $g$(依然是扩散视频生成),但把隐空间 $S_k$ 显式切成两支:
$$
S_k = S^{w}_k \oplus S^{e}_k
$$
其中 $S^{w}_k$ 承载指令无关的场景持久信息(world state),$S^{e}_k$ 承载指令条件化的机器人本体动力学(ego state)。生成目标是 flow-matching 损失加上一个掩码一致性正则:
$$
\mathcal{L} = \mathcal{L}_{\text{FM}}\bigl(\hat{v}_\theta(S_k, \text{instr}, t), v^{*}_k\bigr) + \lambda\, \mathcal{L}_{\text{mask}}(S^{w}_k, S^{e}_k)
$$
WEM 对这一分解给出了三种**边界定义**motion / semantic / intention)和三种**解耦策略**pre / post / full)的笛卡尔积研究,最终 *(semantic, full)* 组合最优。
### 2.4 三者并置
| 路线 | 隐变量 | 可微范围 | 控制接口 |
|---|---|---|---|
| 单流视频预测 (Cosmos/WoW) | 单一 latent $z_t$ | 生成器内部 | 仅可作 rollout buffer |
| OrbiSim | 显式物理状态 $x_t$ + 视觉 latent | 全链 ($x$ 与 $o$) | 解析策略梯度 (APG) |
| WEM | 双隐变量 $S^w_k, S^e_k$ | 生成器内部 | 视频质量 / 长视野指令跟随 |
## 3. 分类法(Taxonomy
为把 OrbiSim、WEM 与既有工作放进同一张坐标系,本节建立一棵围绕"范式重塑"的分类树。
```mermaid
graph TD
A[世界模型 范式] --> B[1. 解耦轴]
A --> C[2. 可微性]
A --> D[3. 评测载体]
B --> B1[无解耦<br/>Cosmos · WoW · Sora]
B --> B2[状态/视觉解耦<br/><b>OrbiSim</b>]
B --> B3[世界/自我解耦<br/><b>WEM</b>]
B --> B4[latent/pixel 解耦<br/>JEPA 系]
C --> C1[不可微<br/>MuJoCo · PhysX · Isaac Sim]
C --> C2[仅生成可微<br/>Cosmos · WoW · Wan2.2 · <b>WEM</b>]
C --> C3[完全可微<br/><b>OrbiSim</b> · DiffTaichi · NVIDIA Newton]
D --> D1[物理控制<br/>RL 成功率 · TrajErr · APG<br/><b>OrbiSim</b> · DreamerV3]
D --> D2[视频质量<br/>FVD · PSNR · LPIPS<br/>Sora · Cosmos · <b>WEM</b>]
D --> D3[长视野指令跟随<br/>EWMScore · WorldArena<br/><b>WEM</b> · IRASim · Ctrl-World]
```
### 3.1 按解耦轴
- **无解耦(单流)**Cosmos-Predict、WoW、Sora、Wan2.2 等,所有信息共享一个 latent。
- **状态/视觉解耦**OrbiSim 是 2026 年代表,物理状态与像素观测分别由 Dynamics 与 Vision 子网络处理。
- **世界/自我解耦**:WEM 是 2026 年代表,场景信息与机器人本体在 token 级、注意力级、专家级三层全部分流。
- **latent/pixel 解耦**JEPA 系(I-JEPA、V-JEPA、V-JEPA 2)抛弃像素重建,只在 latent 中做掩码预测。
### 3.2 按可微性
- **不可微**MuJoCo、PhysX、Isaac Sim、Bullet——经典物理引擎,雅可比通常不导出或受限于刚体接触。
- **仅生成可微**:扩散视频模型与 WEM 在像素层面是可微的,但策略梯度需要穿过整条 denoising 链,方差大、显存高。
- **完全可微**OrbiSim、DiffTaichi、NVIDIA Newton(解析)、Brax/JAX-MD(解析)——可直接将梯度回传给策略 / 形状 / 物理参数。
### 3.3 按评测载体
- **物理控制**:以 robosuite、Isaac Lab、AdaManip、Physion 为主,关注 RL 成功率、轨迹误差、可微反演——OrbiSim 的主场。
- **视频质量**:以 UCF-101、Kinetics、内部数据为主,关注 FVD、PSNR、LPIPS——Cosmos、Sora、WoW 的主场。
- **长视野指令跟随**:以 HTEWorld、WorldArena、CALVIN-long 为主,关注 EWMScore、多轮指令一致性——WEM 与 IRASim、Ctrl-World 的主场。
## 4. 方法详解 IOrbiSim
### 4.1 架构原理
OrbiSim 把世界模型拆为两个互不依赖的子模块:
- **OrbiSim-Dynamics**object-centric Transformer + AdaLN,把每个物体作为 token,预测其在下一时刻的位姿、速度、关节角;
- **OrbiSim-Vision**state-guided latent diffusion,把当前状态 $x_t$ 与一组参考状态-观测对 $\bar{x}$ 作为条件,扩散出 RGB 观测 $o_t$。
资产层用三类原语统一表示:刚体(6-DoF 位姿 + 速度,Embedding 编码)、关节体(URDF + Point Transformer V3 / Sonata)、可变形体(稀疏点云)。这意味着同一份 Dynamics 网络可以承接 robosuite 推/堆、AdaManip 铰接、Physion 布料模拟,无需为每类对象单独训练 head。
### 4.2 训练策略
为了让自回归滚动稳定,OrbiSim 采用两阶段课程:
1. **Teacher Forcing**:以 ground-truth $x_t$ 喂入;
2. **Cosine-Annealed AR Rollout**:用余弦曲线将 ground-truth 概率从 1.0 退火到 0.0,逐步切换到自回归。
视觉端引入 **Context Frame Sparsification**——训练时随机稀疏参考帧数量,使推理时 1–8 帧条件下均稳定。
Real-to-Sim 通路有两条:**StaInf**(单帧 RGB → 可见状态)与 **PhyInf**(64 帧视频 → 隐藏物理参数)。后者把 Dynamics 当作可微前向,**用梯度反演 mass、friction 等隐藏参数**——这是经典仿真器只能"前向 + 网格搜索"完成的事情。
### 4.3 关键 Ablation
- **去掉状态-视觉解耦**(让策略梯度穿过扩散链):APG 训练发散,成功率跌回 BC 水平(~20%);
- **去掉 cosine AR**(纯 teacher forcing):PSNR100 下降约 2 dB,长视野 FVD 翻倍;
- **去掉 Object-Centric Transformer**(换 token-mixed Transformer):多物体接触建模失效,TrajErr 翻 1.8×。
三个 ablation 共同指出:**OrbiSim 的性能并非源于参数堆叠,而是源于显式物理状态 + 可微通路 + 物体中心化表示的协同**。
## 5. 方法详解 IIWEM
### 5.1 架构原理
WEM 由两段构成:
- **冻结的 Qwen3-VL-2B 规划器** + **Role-Conditioned Attention (RCA)** + **不对称 query 预算(192 world / 64 ego**——输出 256 个 condition token,自带 world / ego 角色标签。
- **CP-MoE DiT 生成器**(基于 Wan2.2-TI2V-5B):24 个共享 block → semantic head 路由 → world 专家 6 block / ego 专家 6 block 并行 → unrouting → flow-matching head。
其中 **Asymmetric Query Budget** 的设计直觉是:场景信息丰富但变化慢,分配 192 token;机器人本体信息少但密集,分配 64 token。**Neighbor-Expanded Routing** 把 hard top-1 路由改为带空间邻居的软路由,避免边界处的语义切割伪影。
### 5.2 训练策略
16× A100 80GBlr = 1e-5EMA 0.994 epochs480×480 @ 16 FPS35 diffusion steps37 frames / chunk。数据基于 BEHAVIOR-1K 构建:125K 训练片段(>4.5M 帧)。HTEWorld 评测集另含 300 条多轮轨迹(>2K 指令)。
### 5.3 关键 Ablation
| 移除组件 | EWMScore |
|---|---|
| 完整 WEM | 61.48 |
| Asymmetric Query Budget | 60.50 |
| Role-Conditioned Attention | 60.64 |
| Neighbor-Expanded Routing | 59.57 |
| 无解耦(PAN-style baseline | 58.40 |
三个组件分别贡献 ~1 分,叠加恰好恢复至 baseline。**Design Study I**(边界选择)显示 Semantic 61.48 > Motion 59.36 > Intention 58.69**Design Study II**(解耦时机)显示 Full 61.48 > Post 61.09 > Pre 58.85 > None 58.40。
## 6. 横向对比表
### 6.1 表 1:两篇论文 Metadata 对比
| 维度 | OrbiSim[^1] | WEM[^2] |
|---|---|---|
| arXiv | 2605.16395v1 | 2605.19957v1 |
| 上线日期 | 2026-05-12 | 2026-05-19 |
| 主题分类 | cs.RO | cs.CV |
| 主要机构 | 上海交大 MoE Key Lab / NeoWorld | CASIA / 国科大 / 中关村学院 / 上交 / 北大 |
| 通讯作者 | Yunbo Wang | Xingyu Chen |
| 模型规模 | 未明示(Dynamics 小,Vision 中等) | ~5BWan2.2-TI2V-5B 主干 + CP-MoE |
| 开源现状 | 论文未提供 HF / 项目页 | [`Zoorao/WEM`](https://huggingface.co/Zoorao/WEM) · [`Zoorao/HTEWorld`](https://huggingface.co/datasets/Zoorao/HTEWorld) · [项目页](https://zgca-hmi-lab.github.io/WEM) |
| 是否新基准 | 否(沿用 robosuite / Isaac Lab / AdaManip / Physion | **是**(HTEWorld,首个混合导航-操作长视野基准) |
| 显式可微 | **是**(端到端) | 仅生成器内部 |
| 解耦轴 | 状态 vs 视觉 | 世界 vs 自我 |
### 6.2 表 2:架构对比
| 维度 | OrbiSim | WEM |
|---|---|---|
| 解耦轴 | 物理状态 $x_t$ vs 像素观测 $o_t$ | world token $S^w_k$ vs ego token $S^e_k$ |
| 状态表示 | 显式物理量(位姿/速度/关节角/点云) | 隐式 latent token192 + 64 |
| 动力学骨干 | Object-centric Transformer + AdaLN | Qwen3-VL-2B (frozen) + RCA |
| 生成骨干 | State-guided latent diffusion | CP-MoE DiT24 shared + 2×6 experton Wan2.2-TI2V-5B |
| 输出形式 | 物理状态轨迹 + RGB 观测 | RGB 视频(37 帧/chunk @ 16 FPS |
| 可微性 | 完全可微(含 APG) | 仅扩散内部可微 |
| 训练课程 | TF → cosine-annealed AR | flow-matching + mask 正则 |
| 资产支持 | 刚体 / 关节体 / 可变形体 | 取决于 BEHAVIOR-1K 资产 |
| Real-to-Sim | StaInf + PhyInf(梯度反演) | 无 |
### 6.3 表 3:评测对比
| 维度 | OrbiSim | WEM |
|---|---|---|
| 主基准 | robosuite Push、Isaac Lab Stack、AdaManip Articulated、Physion Drape | **HTEWorld**(自建)+ WorldArena |
| 关键指标 | PSNR100 / LPIPS100 / FVD / TrajErr / RL Success Rate / steps/s | EWMScoreRCBD/LPSA/CISR/PMPA/CPDM/FPHS 加权) |
| 代表数字 | RL Success **42.71%**vs DreamerV3 25.00%);TrajErr **0.4468**29.41 steps/s @ 372 MB | EWMScore **61.48**vs Cosmos-Predict 2.5-14B 55.41PAN-style 58.40 |
| OOD 表现 | FVD 597.3vs AdaWorld 1288.5 | 未单独评测 OOD 物体 |
| 跨基准能力 | 4 个仿真基准均覆盖 | HTEWorld + WorldArena 双基准 |
| 主要基线 | Vid2World、AdaWorld、SAC、PPO、PPO+RND、BC、DreamerV3、NVIDIA Newton | WoW-7B、Cosmos-Predict 2.5 (2B/14B)、PAN-style 5B、Wan2.2、CogVideoX、IRASim、Ctrl-World |
| 评测对象 | 机器人策略 + 视频生成器 | 视频生成器(长视野多指令) |
## 7. 关键结果汇总与批判分析
### 7.1 把数字摆在一起
- **OrbiSim 的"4 个 4 字"**TrajErr 0.4468、RL Success 42.71%、29.41 steps/s、OOD FVD 597.3——前两个把可微物理引擎的"控制可用性"立住,第三个把工程效率立住,第四个把 OOD 立住。
- **WEM 的"61 分故事"**EWMScore 61.485B)压过 Cosmos-Predict 2.5-14B 的 55.4114B)近 6 分,是 2026 年最干净的"结构胜过规模"案例。
### 7.2 各自的核心 Trade-off
| 维度 | OrbiSim 的取舍 | WEM 的取舍 |
|---|---|---|
| 可微性 ↑ | 通过显式物理状态 + 解耦 vision,**获得 APG** | 不显式追求;策略闭环留给下游 |
| 视频质量 | 服务于状态一致性,PSNR100 19.98 / FVD 533.9 已够用 | **优先目标**,长视野 EWMScore 61.48 |
| 长视野能力 | 100 步 rollout TrajErr 0.4468,但只测单任务 | 跨多轮指令 + 跨阶段,但 chunk 间漂移仍存 |
| 模型规模 | 小(Dynamics + 中等 Vision | 5B 全量 |
| 数据成本 | 仿真采样可控,无人工分割标注 | 依赖 BEHAVIOR-1K **实例分割掩码** |
| 资产泛化 | 三类原语统一刚体/关节/可变形 | 受限于训练资产覆盖 |
| 工程吞吐 | 29.41 steps/s @ 372 MB | 16× A100 + 35 diffusion steps,实时不可用 |
一句话:**OrbiSim 选择了"控制可用性 + 工程效率"WEM 选择了"视频质量 + 长视野指令跟随"**——它们在 Pareto 前沿的不同象限。
### 7.3 共同盲点
| 盲点 | OrbiSim | WEM |
|---|---|---|
| Sim-to-Real | 未验证 | 未验证 |
| 跨形态泛化(双足/灵巧手/移动操作) | 仅机械臂 | 部分覆盖(BEHAVIOR-1K 含移动机器人) |
| 真实视频训练 | 未涉及 | 未涉及 |
| 长视野自回归漂移 | cosine AR 缓解但未根治 | chunk 间漂移仍存(LPSA 指标可见) |
| 通用基准缺位 | 无 sim-to-real 评测协议 | HTEWorld 自家发布,待外部验证 |
| 物理参数反演 | PhyInf 仅在受控背景 | 未提供 |
两个最关键的共同盲点:
1. **都不出仿真**:所有评测都在仿真器内进行。这意味着 2026.05 的范式重塑虽然完成了"理论上更对"的结构升级,但在真实机器人侧的可用性还需要至少一个时间窗的验证;
2. **都没有公开统一基准**:OrbiSim 在四个分散基准上自评,WEM 自建 HTEWorld,两者结果**不可直接对照**。Section 9 会展开建议。
### 7.4 范式合流的可能性
把表 2 并排看,会发现 OrbiSim 与 WEM 的解耦轴**几乎是正交的**:
```
状态维度
显式 x_t
|
OrbiSim ─────┼───── 合流目标
|
latent z
|─────────→ 解耦轴
world / ego
WEM
```
一个直观的合流方案是把 OrbiSim 的 Vision 模块替换为 WEM 的 CP-MoE DiT
- **Dynamics 端继承 OrbiSim**:显式物理状态 $x_t$ + APG 支持下游 RL
- **Vision 端继承 WEM**:把 $x_t$ 同时解耦为 $x_t^w$(场景物体状态)与 $x_t^e$(机器人本体状态),分别条件化 world / ego 专家,让长视野多轮指令生成不再退化;
- **统一损失**$\mathcal{L} = \mathcal{L}_{\text{dyn}} + \mathcal{L}_{\text{FM}} + \lambda_1 \mathcal{L}_{\text{mask}} + \lambda_2 \mathcal{L}_{\text{APG}}$。
这种"OrbiSim-Dynamics × WEM-Vision"组合在理论上能同时拿到:可微策略梯度、长视野场景一致性、跨多轮指令鲁棒性。工程上,它的最大障碍是数据——既要有物理状态级标签(OrbiSim 训练范式),又要有 world/ego 分割掩码(WEM 训练范式)。BEHAVIOR-1K 是少数同时满足两者的数据源,故合流的最快路径很可能也起于 BEHAVIOR-1K。
## 8. 挑战与未来方向
### 8.1 Sim-to-Real
两篇论文的最大空缺。可行路径:
- **OrbiSim 路径**:复用 PhyInf 的梯度反演思路,在真实 RGB-D 视频上反推物理参数,把仿真器逐步"贴近"真实;同时用域随机化训练 Vision 模块,缓解光照-纹理 gap。
- **WEM 路径**:在真实示教视频上做无监督的 world/ego 分割(如用 SAM 系列 + 时序一致性),把对显式分割掩码的依赖剥离。
### 8.2 跨形态与跨场景泛化
OrbiSim 的 object-centric Transformer 已经天然支持任意物体数量,但**机器人本体形态泛化**(机械臂 → 双足 → 灵巧手)尚未验证;WEM 的 ego 分支默认指机器人本体,但单一 ego latent 难以承载灵巧手 21-DoF 这种高维状态。未来可考虑:
- 对 ego latent 做**分层**base / arm / hand);
- 在训练数据里**混合多形态机器人**,看 ego 专家是否能自发分化。
### 8.3 长视野自回归漂移
OrbiSim 的 cosine AR 与 WEM 的 chunk 化生成都缓解但未根治漂移。可探索方向:
- 引入**显式 keyframe 锚定**(类似视频压缩里的 I-frame),定期用 ground-truth 状态/帧重置;
- 借鉴 Hierarchical World Model 思路,在更高时间粒度建立"事件级"动力学。
### 8.4 统一基准
OrbiSim 与 WEM 之所以难以直接比较,是因为前者优化"控制可用性"指标、后者优化"视频质量 + 多轮指令"指标。建议社区构建一个**双视角混合基准**:
- 任务集来自 BEHAVIOR-1K / HTEWorld,保证多轮长视野;
- 指标同时包含 EWMScore(视频质量侧)与 RL Success / TrajErr(控制侧);
- 提供统一的 sim-to-real 验证桥(如真实 Aloha 机器人执行同一指令)。
### 8.5 可微性的工程化
OrbiSim 的 APG 在仿真里跑得通,但要进入工业管线,仍缺少:
- **可微接触模型**与刚体引擎的对齐验证;
- 与 Isaac Sim / Newton 现有渲染、传感器栈的接口;
- 多 GPU 训练 + 模型并行下的梯度数值稳定性测试。
## 9. 结论:哪条路线更具前景
如果只能下一个赌注,本综述给出的判断如下:
- **短期(612 个月)****WEM 路线**更易出 demo——视频生成端的工具链最成熟,HTEWorld 与开源模型已经把门槛压到了"5B 模型 + 1 张分割掩码",社区会涌现一批 world/ego 解耦的变体。
- **中期(12 年)****OrbiSim 路线**的潜在天花板更高——一旦把可微物理引擎与真实机器人闭环打通,它会重新定义"机器人仿真器"这一品类的入口,比"更好看的视频"价值高一个数量级。
- **长期(2 年以上)**:**二者合流**几乎是必然——一个不可微的世界模型无法服务策略学习,一个不能解耦世界/自我的世界模型无法服务长视野任务。预计 2027 年前后会出现首批同时具备 APG 接口与 world-ego 解耦的统一架构。
### 9.1 给读者的下一步阅读建议
1. **想做物理/控制方向研究**:先把 OrbiSim 论文与本仓库的 [`orbisim_review.md`](orbisim_review.md) 一起读,然后回到 DreamerV3、DiffTaichi、NVIDIA Newton 的源码理解可微物理的工程实现;
2. **想做生成/视频方向研究**:先看 [`wem_review.md`](wem_review.md)、HTEWorld 数据集、Cosmos-Predict 2.5 与 Wan2.2-TI2V 的对比,再回到 IRASim / Ctrl-World 评估长视野生成;
3. **想做范式融合研究**:直接以本节 §7.4 描绘的"OrbiSim-Dynamics × WEM-Vision"作为出发点,关注 BEHAVIOR-1K 的同时标注可行性;
4. **关心本仓库其他世界模型综述**:参见 [`world_models_review.md`](../world_models_review.md)、[`world_models_arxiv_2025_survey.md`](../world_models_arxiv_2025_survey.md)、[`physics_world_models_review.md`](../physics_world_models_review.md)、[`lyra2_review.md`](../lyra2_review.md) 与 [`jepa/index.md`](../jepa/index.md),本节相当于它们在 2026.05 时间点的专题切片。
## 10. 参考文献
**[1] OrbiSim: World Models as Differentiable Physics Engines for Embodied Intelligence** (2026). _Jiajian Li, Jingyuan Huang, Junru Gong, Qi Wang, Xiaokang Yang, Yunbo Wang._ arXiv:2605.16395. [[PDF]](../../papers/2605.16395v1.pdf)
**[2] World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks** (2026). _Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Xingyu Chen._ arXiv:2605.19957. [[PDF]](../../papers/2605.19957v1.pdf) · [项目页](https://zgca-hmi-lab.github.io/WEM) · [HF 模型](https://huggingface.co/Zoorao/WEM) · [HF 数据集](https://huggingface.co/datasets/Zoorao/HTEWorld)
**[3] Mastering Diverse Domains through World Models (DreamerV3)** (2023). _Danijar Hafner, Jurgis Pasukonis, Jimmy Ba, Timothy Lillicrap._ arXiv:2301.04104.
**[4] World Models** (2018). _David Ha, Jürgen Schmidhuber._ arXiv:1803.10122.
**[5] Cosmos-Predict 2.5** (2025). _NVIDIA._ 大规模视频世界模型,作为 WEM 主要基线之一。
**[6] WoW: World-on-World Generative Model** (2025). 7B 视频世界模型基线。
**[7] AdaWorld: Adaptive World Models for Robotic Manipulation** (2025). OrbiSim 的主要预测保真度基线。
**[8] Vid2World: Video-to-World Generative Models** (2025). OrbiSim 的主要视频预测基线。
**[9] I-JEPA / V-JEPA / V-JEPA 2** (20232024). _Yann LeCun et al._ Latent-only 预测范式的代表,与本文 §3.1 的 latent/pixel 解耦轴对应。详见 [`jepa/index.md`](../jepa/index.md)。
**[10] IRASim** (2025). 长视野指令跟随基准 WorldArena 的代表方法。
**[11] Ctrl-World** (2025). 同上。
**[12] Wan2.2-TI2V** (2025). WEM 的视频生成主干。
**[13] Qwen3-VL** (2025). _Alibaba._ WEM 的冻结规划器。
**[14] BEHAVIOR-1K: A Benchmark for Embodied AI with 1,000 Everyday Activities** (2023). HTEWorld 数据构建的底层资产源。
**[15] robosuite: A Modular Simulation Framework and Benchmark for Robot Learning** (2020). _Yuke Zhu et al._ OrbiSim Push / Stack 任务的基础环境。
**[16] Isaac Lab / NVIDIA Newton** (20242026). 经典 / 可微物理仿真器,OrbiSim 的对照参照系。
**[17] Physion: Evaluating Physical Prediction from Vision in Humans and Machines** (2021). OrbiSim 可变形物体(Drape)任务的来源。
**[18] AdaManip** (2024). OrbiSim 关节物体(Articulated)任务的来源。
**[19] DiffTaichi: Differentiable Programming for Physical Simulation** (2020). _Yuanming Hu et al._ 经典可微物理的代表。
**[20] PAN-style baselines** (2025). WEM 的"无解耦同规模 5B"对照组。
@@ -0,0 +1,166 @@
---
title: "OrbiSim 深度解读:把世界模型重写为可微物理引擎"
date: 2026-05-20
lastmod: 2026-05-20
draft: false
summary: "OrbiSim (arXiv:2605.16395) 把世界模型重定义为端到端可微的物理引擎,通过『状态-视觉解耦』与『解析策略梯度』在 robosuite Push 上取得 42.71% 成功率,远超 DreamerV3 的 25.00%。"
tags: ["world-models", "differentiable-physics", "embodied-ai", "robosuite", "diffusion", "robotics", "OrbiSim"]
categories: ["research", "world-models"]
weight: 20
math: true
toc: true
---
## 1. 摘要复述
**OrbiSim**[^1] 由上海交通大学 MoE 人工智能重点实验室 NeoWorld 团队提出(一作 Jiajian Li / Jingyuan Huang / Junru Gong,通讯 Yunbo Wang),其核心主张是:
> 与其让世界模型在隐空间或像素域做"无约束想象",不如把它定义为**一个端到端可微、可作为 MuJoCo / PhysX / Isaac Sim 直接 drop-in 替代品的物理引擎**。
整个仿真闭环——从显式状态转移到视觉观测生成——都对动作 $a_t$ 和参数 $\theta$ 可微,从而解锁了三类经典仿真器难以处理的任务:可微接触建模、稀疏奖励下的梯度策略优化(APG)、以及直观物理推断("如果质量翻倍,物体会落在哪里?")。
实证侧,OrbiSim 在 robosuite Push 上的轨迹误差 **0.4468**、PSNR100 **19.98**,并把 RL 成功率提升到 **42.71%**(基线 DreamerV3 仅 25.00%)。
## 2. 动机:为什么"单流视频预测"不够用
作者把当前主流路线分成两端:
- **生成式世界模型**Sora、Cosmos、WoW、AdaWorld、Vid2World):擅长生成"看起来对"的视频,但物理状态隐式纠缠在像素 latent 中,对动作不可微、对约束不可控;用于 RL 时只能当 rollout buffer,无法回传梯度。
- **经典物理引擎**MuJoCo / PhysX / Isaac Sim / NVIDIA Newton):动力学精确,但**完全不可微**或只在受限接触模型下伪可微;视觉渲染另起炉灶(Omniverse / 光栅化),与神经控制器之间是黑箱接口。
OrbiSim 选择走第三条路:**用可微神经动力学吃掉经典引擎的不可微部分,再用 state-conditioned 扩散吃掉视觉渲染的离散化**。整个 pipeline 因此首次形成"动作 → 物理状态 → 像素观测"的连续微分链。
## 3. 方法
### 3.1 解耦双模块架构
OrbiSim 把世界模型拆为两个互不依赖的子模型:
$$
x_{t+1} = \mathrm{Dynamics}_\theta(x_t, a_t, c), \qquad o_t = \mathrm{Vision}_\phi(x_t, \bar{x}, \xi_t)
$$
- **OrbiSim-Dynamics**object-centric Transformer + AdaLN,输入当前物理状态 $x_t$(位姿、速度、关节角、点云特征)和动作 $a_t$,输出下一步状态 $x_{t+1}$。
- **OrbiSim-Vision**state-guided latent diffusion,把当前状态 $x_t$ 与一组**参考状态-观测对** $\bar{x}$context frame)作为条件,扩散出 RGB 观测 $o_t$。$\xi_t$ 是扩散噪声。
这种 state-vision 解耦的关键收益:**梯度只需要流经 Dynamics 这一可微通路**——对于策略优化任务,Vision 完全可以离线推理,避免扩散采样链路上的梯度退化。
### 3.2 统一资产-世界表示
OrbiSim 用三类原语描述场景:
| 物体类型 | 表示 | 编码器 |
|---|---|---|
| 刚体 | 6-DoF 位姿 + 速度 | MLP / Embedding |
| 关节体(URDF) | 关节角 + 链接位姿 | Point Transformer V3 / Sonata |
| 可变形体 | 稀疏点云 | Point Transformer V3 |
这意味着**同一份 Dynamics 网络可以承接 robosuite 的刚体推/堆、AdaManip 的铰接物体、以及 Physion 的布料模拟**,而无需为每类对象再训一个 head。
### 3.3 训练:从 Teacher Forcing 到 AR Rollout 的 Cosine 退火
为了缓解扩散与自回归滚动之间的 exposure bias,作者采用:
1. **Teacher Forcing 阶段**:每一步都用 ground-truth $x_t$ 喂入;
2. **Cosine-Annealed AR Rollout**:以余弦曲线把 ground-truth 概率从 1.0 退火到 0.0,逐步切换到自回归;
3. **Context Frame Sparsification**:训练时对 $\bar{x}$ 中的参考帧数量做随机稀疏,使推理时无论给 1 帧还是 8 帧条件都稳定。
### 3.4 Real-to-SimStaInf + PhyInf
OrbiSim 提供两条 Real-to-Sim 通路:
- **StaInf**State Inference):单帧 RGB → 可见状态(位姿、关节角)。
- **PhyInf**Physics Inference):64 帧视频 → 隐藏物理参数(质量、摩擦),通过把 Dynamics 当作可微前向、用梯度优化反推 $\theta_\text{phys}$。
PhyInf 是这条路线最具想象力的副产物——经典仿真器只能"前向 + 网格搜索"调参,OrbiSim 因可微而支持**梯度反演**。
### 3.5 解析策略梯度(APG
在 RL 训练时,作者只让梯度沿 Dynamics 反传,绕开视觉渲染器:
$$
\nabla_\pi J \;=\; \sum_t \frac{\partial r_t}{\partial x_t} \cdot \prod_{k < t} \frac{\partial x_{k+1}}{\partial x_k} \cdot \frac{\partial \pi_\pi(a_k|x_k)}{\partial \pi}
$$
这一设计回避了扩散采样的高方差梯度,是 OrbiSim 在稀疏奖励任务上反超 DreamerV3 / SAC / PPO 的关键。
## 4. 实验
### 4.1 预测保真度(robosuite Push, 100 步 rollout
| 模型 | PSNR100 ↑ | LPIPS100 ↓ | FVD ↓ | TrajErr ↓ |
|---|---|---|---|---|
| AdaWorld[^4] | 16.4 | 0.214 | 992.1 | 1.082 |
| Vid2World[^5] | 17.2 | 0.183 | 814.6 | 0.873 |
| **OrbiSim** | **19.98** | **0.1428** | **533.9** | **0.4468** |
- TrajErr(轨迹位置误差)跌到基线的 **41%51%**,说明状态-视觉解耦确实把"物理对不对"和"画面好不好看"两个问题分别解决了。
- OOD(未见物体形状)FVD 597.3 vs AdaWorld 1288.5,泛化半径同样领先。
### 4.2 强化学习成功率(robosuite Push
| 方法 | 成功率 |
|---|---|
| SAC | 0.00% |
| PPO + RND | 2.08% |
| BC(行为克隆) | 19.79% |
| DreamerV3[^2] | 25.00% |
| **OrbiSim (APG)** | **42.71%** |
注:SAC / PPO 在稀疏奖励下基本无法启动,DreamerV3 通过 latent 想象拿到 25%OrbiSim 凭借**真实物理梯度**几乎再翻一倍。
### 4.3 训练效率
- **OrbiSim**29.41 steps/s @ 372 MB VRAM
- **DreamerV3**4.54 steps/s @ 931 MB VRAM
约 6.5× 吞吐 + 2.5× 显存压缩,主因是 Dynamics 网络远小于 DreamerV3 的 RSSM + decoder 组合。
### 4.4 关键 Ablation
- **去掉状态-视觉解耦**(端到端梯度过扩散):APG 训练发散,成功率跌至 BC 水平;
- **去掉 cosine AR**(纯 teacher forcing):PSNR100 下降约 2 dB,长视野 FVD 翻倍;
- **去掉 Object-Centric Transformer**(换 token-mixed Transformer):多物体场景接触建模失效,TrajErr 翻 1.8×。
## 5. 个人评析
### 5.1 OrbiSim 真正解决了什么
它不是"又一个比 Dreamer 强的世界模型"。它的范式贡献在于**把世界模型搬到"可作为通用机器人仿真器替代品"的位置上**——这是一个之前只有 MuJoCo / Isaac Sim 占据的高地。具体看:
- 把"动力学精度"和"视觉渲染"解耦,恰好对应经典仿真器内部的 physics step / render step
- 把可微性贯穿到位姿层而非 latent 层,使下游可以直接接 APG、可微接触、可微反演——这是真正的"physics engine for embodied intelligence"。
### 5.2 真正的硬约束
1. **真实域几乎没碰**:所有实验都在 robosuite / Isaac Lab / AdaManip / Physion 仿真内做,sim-to-real gap 是个空白;
2. **跨机器人形态泛化**:论文只展示了机械臂任务,移动操作、双足、灵巧手都未触及;
3. **PhyInf 的反演鲁棒性**64 帧视频反推 mass / friction 在受控背景下成立,复杂遮挡 / 光照变化下未验证;
4. **离"通用仿真器"还有距离**:流体、软体大变形、断裂、声学等仍未覆盖,与 NVIDIA Newton 等工程目标相比仍是研究原型。
### 5.3 一句话总结
OrbiSim 是 2026 年最有力地把"世界模型 = 可微物理引擎"这一**口号转成可跑代码**的工作,但其影响力会被"还需多少年才能真正替代 Isaac Sim 一线工作流"这个工程问题严重制约。
## 6. 与同期工作的关系
- **vs WEM**[^7]WEM 走视频生成端的解耦(world / ego),OrbiSim 走仿真引擎端的解耦(state / vision)。两者**几乎完全互补**——见 [`joint_synthesis.md`](joint_synthesis.md) §7。
- **vs DreamerV3**[^2]Dreamer 在 latent 中做"想象"OrbiSim 在物理状态空间中做"仿真";前者牺牲物理一致换样本效率,后者用更精确的 dynamics 换了梯度可用性。
- **vs NVIDIA Newton**Newton 是经典可微物理路线(解析雅可比),OrbiSim 是神经可微路线(自动微分通过 Transformer)。前者保证物理无误差,后者用网络容量换泛化。
- **vs AdaWorld / Vid2World**[^4][^5]:被 OrbiSim 在 PSNR / FVD / TrajErr 上全方位超越,但这两者本就不以物理精度为目标——比较仅说明"video-only" 范式不适合精确控制。
## 参考文献
[^1]: **OrbiSim: World Models as Differentiable Physics Engines for Embodied Intelligence** (2026). _Jiajian Li, Jingyuan Huang, Junru Gong, Qi Wang, Xiaokang Yang, Yunbo Wang._ arXiv:2605.16395. [[PDF]](../../papers/2605.16395v1.pdf)
[^2]: **Mastering Diverse Domains through World Models (DreamerV3)** (2023). _Danijar Hafner et al._ arXiv:2301.04104.
[^3]: **robosuite: A Modular Simulation Framework and Benchmark for Robot Learning** (2020). _Yuke Zhu et al._
[^4]: **AdaWorld: Adaptive World Models for Robotic Manipulation** (2025).
[^5]: **Vid2World: Video-to-World Generative Models** (2025).
[^6]: **Physion: Evaluating Physical Prediction from Vision in Humans and Machines** (2021).
[^7]: **World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks** (2026). _Zuyao Lin et al._ arXiv:2605.19957. [[PDF]](../../papers/2605.19957v1.pdf)
@@ -0,0 +1,209 @@
---
title: "WEM 深度解读:把世界模型拆成『世界』与『自我』两支"
date: 2026-05-20
lastmod: 2026-05-20
draft: false
summary: "WEM (arXiv:2605.19957) 提出 World-Ego Modeling 新范式,把未来演化分解为 world / ego 两支,并通过 CP-MoE 扩散生成器在长视野混合导航-操作任务上把 EWMScore 推到 61.48。"
tags: ["world-models", "world-ego-disentanglement", "diffusion", "MoE", "embodied-ai", "long-horizon", "HTEWorld", "WEM"]
categories: ["research", "world-models"]
weight: 30
math: true
toc: true
---
## 1. 摘要复述
**WEM**[^1]World-Ego Model)由 CASIA / 国科大 / 中关村学院 / 上交 / 北大联合提出(一作 Zuyao Lin,通讯 Xingyu Chen),其核心论断是:
> 现有世界模型把"持久的、指令无关的场景规律(world)"和"以机器人为中心的、指令条件化的动力学(ego)"塞在**同一条预测流**里,导致**长视野混合任务**hybrid navigation-manipulation)严重退化。
WEM 把未来视频生成显式分解为 $S^{w}$world state)与 $S^{e}$ego state)两支,并给出三种边界定义(motion / semantic / intention)和三种解耦策略(pre / post / full)。架构上采用**冻结的 Qwen3-VL-2B**[^9] 做规划,加上**基于 Wan2.2-TI2V-5B**[^8] 的 **CP-MoE DiT** 做生成。同时发布了**首个混合导航-操作长视野基准 HTEWorld**125K 训练片段(4.5M+ 帧)+ 300 评估轨迹(2K+ 指令),并公开模型 [`Zoorao/WEM`](https://huggingface.co/Zoorao/WEM) 与数据集 [`Zoorao/HTEWorld`](https://huggingface.co/datasets/Zoorao/HTEWorld)。
在 HTEWorld 上,WEM 的综合指标 **EWMScore = 61.48**,超过 PAN-style 5B58.40)、Cosmos-Predict 2.5-14B55.41)、WoW-7B53.44)等所有基线。
## 2. 动机:长视野混合任务为什么会退化
作者把"具身长视野"拆出一个被忽视的子集:**混合导航-操作任务**——机器人需要在大场景里走过去、找到目标、操作、再走回来或进入下一个房间。这类任务有两个特殊难点:
1. **场景规律是持久的**:墙、家具、室内布局对任何指令都基本不变;
2. **机器人动力学是瞬时且指令相关的**:手臂轨迹、抓取序列高度依赖指令。
如果用单流 video predictorCosmos、WoW、Wan2.2)建模,二者的统计特征会互相污染:长视野自回归 rollout 时,scene 漂移导致 ego 失锚,ego 噪声又反馈进 scene token,最终视频陷入"语义糊掉 + 物体闪现"的失败模式。
WEM 的诊断是:**这不是参数量不够,是分解结构不对**。哪怕 Cosmos-Predict 2.5-14B 这种 14B 模型,在 HTEWorld 上 EWMScore 也只有 55.41,落后于 5B 量级的 PAN-style58.40)和 WEM 自身(61.48)。
## 3. 方法
### 3.1 形式化:World-Ego 分解
设未来时刻 $k$ 的隐状态为 $S_k$,WEM 把它显式分解为:
$$
S_k = S^{w}_k \;\oplus\; S^{e}_k
$$
其中 $S^{w}_k$ 是指令无关的世界 token$S^{e}_k$ 是指令条件化的自我 token。生成目标用 flow-matching 损失,并加上掩码一致性正则:
$$
\mathcal{L} = \mathcal{L}_{\text{FM}}\bigl(\hat{v}_\theta(S_k, \text{instr}, t), v^{*}_k\bigr) \;+\; \lambda \,\mathcal{L}_{\text{mask}}(S^{w}_k, S^{e}_k)
$$
### 3.2 三种 World-Ego 边界
| 边界 | 定义 | EWMScore |
|---|---|---|
| Motion-based | 用光流幅值阈值 | 59.36 |
| **Semantic-based**(默认) | 用实例分割决定哪个 patch 属于机器人本体 | **61.48** |
| Intention-based | 用指令对齐的注意力图 | 58.69 |
Semantic 在三者中最优,因为它直接利用**像素级语义边界**,最不易被运动模糊或指令歧义污染。代价是推理时依赖实例分割掩码。
### 3.3 三种解耦策略
| 策略 | 何时分两支 | EWMScore |
|---|---|---|
| 无解耦(baseline, PAN-style | 始终单流 | 58.40 |
| Pre-disent | 输入阶段就分流 | 58.85 |
| Post-disentw/ semantic proxy | 生成后再分 | 61.09 |
| **Full-disent**(默认) | 输入、注意力、专家、输出全程分 | **61.48** |
### 3.4 架构总览
```
指令 + 历史帧
┌──────────────────────────┐
│ Qwen3-VL-2B (frozen) │ ← 规划:产生 world/ego query
│ + Role-Conditioned Attn │
│ + Asymmetric Query Budget│ 192 world tokens / 64 ego tokens
└─────────────┬────────────┘
│ 256 cond. tokens
┌──────────────────────────┐
│ CP-MoE DiT (Wan2.2-TI2V) │
│ ├─ 24 shared DiT blocks │
│ ├─ semantic head │ ← world/ego routing
│ ├─ 6 world expert blocks│ ┐
│ ├─ 6 ego expert blocks │ ├─ parallel
│ └─ unrouting + FM head │ ┘
└─────────────┬────────────┘
未来视频 chunk
```
几个关键点:
- **Role-Conditioned Attention (RCA)**:在 cross-attn 里用 role tag 区分 world / ego query,使 Qwen 输出的 256 个 condition token 一开始就带有解耦先验。
- **Asymmetric Query Budget192 + 64**world 比 ego 多 3×,因为场景信息更丰富但变化更慢;ego 较少但更密集地参与动力学预测。消融显示去掉非对称预算后 EWMScore 跌到 60.50。
- **CP-MoE = Cascade-Parallel MoE**24 个 DiT block 共享,之后 semantic head 路由到 world / ego 专家各 6 个 block 并行,再 unrouting 汇总进入 flow-matching head。
- **Neighbor-Expanded Routing**:路由不是 hard top-1,而是把空间邻居也带入对应专家,去掉后 EWMScore 跌至 59.57。
### 3.5 训练配置
- 16× A100 80GBlr = 1e-5EMA 0.994 epochs
- 480×480 @ 16 FPS35 diffusion steps37 frames / chunk
- 在 BEHAVIOR-1K 衍生数据上构建 125K 训练片段(>4.5M 帧)。
## 4. 实验
### 4.1 HTEWorld 主结果
| 模型 | 规模 | EWMScore ↑ |
|---|---|---|
| WoW-7B | 7B | 53.44 |
| Cosmos-Predict 2.5 | 2B | 54.83 |
| Cosmos-Predict 2.5 | 14B | 55.41 |
| PAN-style | 5B | 58.40 |
| **WEM** | 5B | **61.48** |
值得注意的是 **WEM 5B 战胜了 Cosmos 14B 近 6.1 分**。说明结构性解耦的边际收益超过 3× 参数扩张。
### 4.2 设计研究(Design Study
| Study | 变量 | 最优 | 次优 | 差距 |
|---|---|---|---|---|
| I — 边界 | motion / semantic / intention | Semantic 61.48 | Motion 59.36 | +2.12 |
| II — 策略 | pre / post / full / none | Full 61.48 | Post 61.09 | +0.39 |
### 4.3 WorldArena 兼容性
| 模型 | WorldArena |
|---|---|
| IRASim[^6] | 58.12 |
| Ctrl-World | 59.70 |
| **WEM** | 58.10 |
WEM 在 WorldArena 上不掉队(接近 IRASim 和 Ctrl-World),说明 world-ego 解耦不是"只在 HTEWorld 上有效"的过拟合 trick。
### 4.4 关键消融
| 移除组件 | EWMScore |
|---|---|
| 完整 WEM | 61.48 |
| Asymmetric Query Budget | 60.50 |
| Role-Conditioned Attention | 60.64 |
| Neighbor-Expanded Routing | 59.57 |
三者均贡献 ~1 分,叠加起来正好恢复至 baseline 58.40 附近。
### 4.5 HTEWorld 的 6 项专属指标
WEM 顺带提出了 6 个针对混合长视野的指标:
- **RCBD**RobotContext Boundary Drift):world / ego 边界漂移;
- **LPSA**Long-horizon Persistent Scene Adherence):长视野场景一致性;
- **CISR**Cross-Instruction Style Robustness):跨指令风格鲁棒性;
- **PMPA**Per-Manipulation Pose Accuracy):操作位姿精度;
- **CPDM**Cross-Phase Dynamics Matching):阶段切换处的动力学一致;
- **FPHS**Full-Pipeline Human Score):人类打分。
EWMScore 即是六者的加权融合,使评测既覆盖物理控制又覆盖视频质量。
## 5. 个人评析
### 5.1 真正的范式贡献
WEM 把"为什么 video world model 在具身长视野任务上不行"这一长期被归咎于参数量或数据的问题,**转译成了一个明确可拆解的结构性问题**:world 与 ego 没有分流。Cosmos-14B 的 55.41 vs WEM-5B 的 61.48 这一组数字本身就是论文的全部说服力来源——它说明扩参数无法补结构。
### 5.2 真正的硬约束
1. **仅在仿真数据评测**BEHAVIOR-1K 是高保真仿真但不是真机,sim-to-real 完全未验证;
2. **默认依赖实例分割标注**Semantic 边界优于 motion / intention 的代价是必须在训练数据里提供分割掩码,部署到无标注真实数据的扩展路径尚不清晰;
3. **长视野自回归仍有 chunk 间漂移**:37 帧/chunk 的拼接处依然出现一致性下降(论文 LPSA 指标中可看出),未根治;
4. **缺乏可微动力学闭环**:和 OrbiSim 相反,WEM 没有提供"用梯度训练机器人策略"的接口——它依然是生成器,不是仿真器;
5. **MoE 推理成本**CP-MoE 引入约 +30% 推理延迟(论文附录),实时控制不友好。
### 5.3 一句话总结
WEM 是 2026 年最有力地把"世界模型应该分世界与自我两支"这一直觉**做成可复现 5B 模型 + 公开基准**的工作;它最大的不足是把所有筹码都压在视频生成端,对策略闭环和真实域几乎没有覆盖。
## 6. 与同期工作的关系
- **vs OrbiSim**[^10]:完全互补——OrbiSim 在物理状态层做可微(state-vs-vision),WEM 在视频生成层做语义分解(world-vs-ego)。范式合流的可能性见综述主文 [`joint_synthesis.md`](joint_synthesis.md) §7。
- **vs Cosmos-Predict 2.5**[^4]Cosmos 是单流大模型路线(2B / 14B),EWMScore 落后 WEM 6.1 分,证明结构 > 规模。
- **vs WoW-7B**[^5]WoW 是当下生成式世界模型的代表之一,53.44 vs 61.48 的差距说明"会预测视频"不等于"能完成混合任务"。
- **vs IRASim / Ctrl-World**[^6]WorldArena 上三者持平,说明 WEM 没有为通用基准牺牲单点能力。
- **vs JEPA**[^7]JEPA 提倡 latent-only 预测、抛弃像素;WEM 选择"保留像素 + 显式语义分支",是另一种"避免 pixel 噪声"的工程化答案。
## 参考文献
[^1]: **World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks** (2026). _Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Xingyu Chen._ arXiv:2605.19957. [[PDF]](../../papers/2605.19957v1.pdf) · [项目页](https://zgca-hmi-lab.github.io/WEM) · [HF 模型](https://huggingface.co/Zoorao/WEM) · [HF 数据集](https://huggingface.co/datasets/Zoorao/HTEWorld)
[^2]: **BEHAVIOR-1K: A Benchmark for Embodied AI with 1,000 Everyday Activities** (2023).
[^3]: **Wan2.2-TI2V: Text-Image-to-Video Generation** (2025).
[^4]: **Cosmos-Predict 2.5** (2025). _NVIDIA._
[^5]: **WoW: World-on-World Generative Model** (2025).
[^6]: **IRASim / Ctrl-World** (2025).
[^7]: **I-JEPA / V-JEPA** (20232024). _Yann LeCun et al._
[^8]: **Wan2.2** (2025).
[^9]: **Qwen3-VL** (2025). _Alibaba._
[^10]: **OrbiSim** (2026). arXiv:2605.16395. [[PDF]](../../papers/2605.16395v1.pdf)