docs(research): add world-models paradigm-redesign-2026 survey
Sync to site1 / sync (push) Has been cancelled

- Add literature survey on 2026.05 dual paradigm-shifting works:
  OrbiSim (differentiable physics engine) and WEM (world-ego disentanglement)
- Files: _index.md, orbisim_review.md, wem_review.md, joint_synthesis.md
- Update research/world-models/_index.md to register new sub-section
This commit is contained in:
gaojie
2026-05-21 09:15:25 +08:00
parent d63d3ebc69
commit 732706bb6f
5 changed files with 806 additions and 0 deletions
@@ -0,0 +1,209 @@
---
title: "WEM 深度解读:把世界模型拆成『世界』与『自我』两支"
date: 2026-05-20
lastmod: 2026-05-20
draft: false
summary: "WEM (arXiv:2605.19957) 提出 World-Ego Modeling 新范式,把未来演化分解为 world / ego 两支,并通过 CP-MoE 扩散生成器在长视野混合导航-操作任务上把 EWMScore 推到 61.48。"
tags: ["world-models", "world-ego-disentanglement", "diffusion", "MoE", "embodied-ai", "long-horizon", "HTEWorld", "WEM"]
categories: ["research", "world-models"]
weight: 30
math: true
toc: true
---
## 1. 摘要复述
**WEM**[^1]World-Ego Model)由 CASIA / 国科大 / 中关村学院 / 上交 / 北大联合提出(一作 Zuyao Lin,通讯 Xingyu Chen),其核心论断是:
> 现有世界模型把"持久的、指令无关的场景规律(world)"和"以机器人为中心的、指令条件化的动力学(ego)"塞在**同一条预测流**里,导致**长视野混合任务**hybrid navigation-manipulation)严重退化。
WEM 把未来视频生成显式分解为 $S^{w}$world state)与 $S^{e}$ego state)两支,并给出三种边界定义(motion / semantic / intention)和三种解耦策略(pre / post / full)。架构上采用**冻结的 Qwen3-VL-2B**[^9] 做规划,加上**基于 Wan2.2-TI2V-5B**[^8] 的 **CP-MoE DiT** 做生成。同时发布了**首个混合导航-操作长视野基准 HTEWorld**125K 训练片段(4.5M+ 帧)+ 300 评估轨迹(2K+ 指令),并公开模型 [`Zoorao/WEM`](https://huggingface.co/Zoorao/WEM) 与数据集 [`Zoorao/HTEWorld`](https://huggingface.co/datasets/Zoorao/HTEWorld)。
在 HTEWorld 上,WEM 的综合指标 **EWMScore = 61.48**,超过 PAN-style 5B58.40)、Cosmos-Predict 2.5-14B55.41)、WoW-7B53.44)等所有基线。
## 2. 动机:长视野混合任务为什么会退化
作者把"具身长视野"拆出一个被忽视的子集:**混合导航-操作任务**——机器人需要在大场景里走过去、找到目标、操作、再走回来或进入下一个房间。这类任务有两个特殊难点:
1. **场景规律是持久的**:墙、家具、室内布局对任何指令都基本不变;
2. **机器人动力学是瞬时且指令相关的**:手臂轨迹、抓取序列高度依赖指令。
如果用单流 video predictorCosmos、WoW、Wan2.2)建模,二者的统计特征会互相污染:长视野自回归 rollout 时,scene 漂移导致 ego 失锚,ego 噪声又反馈进 scene token,最终视频陷入"语义糊掉 + 物体闪现"的失败模式。
WEM 的诊断是:**这不是参数量不够,是分解结构不对**。哪怕 Cosmos-Predict 2.5-14B 这种 14B 模型,在 HTEWorld 上 EWMScore 也只有 55.41,落后于 5B 量级的 PAN-style58.40)和 WEM 自身(61.48)。
## 3. 方法
### 3.1 形式化:World-Ego 分解
设未来时刻 $k$ 的隐状态为 $S_k$,WEM 把它显式分解为:
$$
S_k = S^{w}_k \;\oplus\; S^{e}_k
$$
其中 $S^{w}_k$ 是指令无关的世界 token$S^{e}_k$ 是指令条件化的自我 token。生成目标用 flow-matching 损失,并加上掩码一致性正则:
$$
\mathcal{L} = \mathcal{L}_{\text{FM}}\bigl(\hat{v}_\theta(S_k, \text{instr}, t), v^{*}_k\bigr) \;+\; \lambda \,\mathcal{L}_{\text{mask}}(S^{w}_k, S^{e}_k)
$$
### 3.2 三种 World-Ego 边界
| 边界 | 定义 | EWMScore |
|---|---|---|
| Motion-based | 用光流幅值阈值 | 59.36 |
| **Semantic-based**(默认) | 用实例分割决定哪个 patch 属于机器人本体 | **61.48** |
| Intention-based | 用指令对齐的注意力图 | 58.69 |
Semantic 在三者中最优,因为它直接利用**像素级语义边界**,最不易被运动模糊或指令歧义污染。代价是推理时依赖实例分割掩码。
### 3.3 三种解耦策略
| 策略 | 何时分两支 | EWMScore |
|---|---|---|
| 无解耦(baseline, PAN-style | 始终单流 | 58.40 |
| Pre-disent | 输入阶段就分流 | 58.85 |
| Post-disentw/ semantic proxy | 生成后再分 | 61.09 |
| **Full-disent**(默认) | 输入、注意力、专家、输出全程分 | **61.48** |
### 3.4 架构总览
```
指令 + 历史帧
┌──────────────────────────┐
│ Qwen3-VL-2B (frozen) │ ← 规划:产生 world/ego query
│ + Role-Conditioned Attn │
│ + Asymmetric Query Budget│ 192 world tokens / 64 ego tokens
└─────────────┬────────────┘
│ 256 cond. tokens
┌──────────────────────────┐
│ CP-MoE DiT (Wan2.2-TI2V) │
│ ├─ 24 shared DiT blocks │
│ ├─ semantic head │ ← world/ego routing
│ ├─ 6 world expert blocks│ ┐
│ ├─ 6 ego expert blocks │ ├─ parallel
│ └─ unrouting + FM head │ ┘
└─────────────┬────────────┘
未来视频 chunk
```
几个关键点:
- **Role-Conditioned Attention (RCA)**:在 cross-attn 里用 role tag 区分 world / ego query,使 Qwen 输出的 256 个 condition token 一开始就带有解耦先验。
- **Asymmetric Query Budget192 + 64**world 比 ego 多 3×,因为场景信息更丰富但变化更慢;ego 较少但更密集地参与动力学预测。消融显示去掉非对称预算后 EWMScore 跌到 60.50。
- **CP-MoE = Cascade-Parallel MoE**24 个 DiT block 共享,之后 semantic head 路由到 world / ego 专家各 6 个 block 并行,再 unrouting 汇总进入 flow-matching head。
- **Neighbor-Expanded Routing**:路由不是 hard top-1,而是把空间邻居也带入对应专家,去掉后 EWMScore 跌至 59.57。
### 3.5 训练配置
- 16× A100 80GBlr = 1e-5EMA 0.994 epochs
- 480×480 @ 16 FPS35 diffusion steps37 frames / chunk
- 在 BEHAVIOR-1K 衍生数据上构建 125K 训练片段(>4.5M 帧)。
## 4. 实验
### 4.1 HTEWorld 主结果
| 模型 | 规模 | EWMScore ↑ |
|---|---|---|
| WoW-7B | 7B | 53.44 |
| Cosmos-Predict 2.5 | 2B | 54.83 |
| Cosmos-Predict 2.5 | 14B | 55.41 |
| PAN-style | 5B | 58.40 |
| **WEM** | 5B | **61.48** |
值得注意的是 **WEM 5B 战胜了 Cosmos 14B 近 6.1 分**。说明结构性解耦的边际收益超过 3× 参数扩张。
### 4.2 设计研究(Design Study
| Study | 变量 | 最优 | 次优 | 差距 |
|---|---|---|---|---|
| I — 边界 | motion / semantic / intention | Semantic 61.48 | Motion 59.36 | +2.12 |
| II — 策略 | pre / post / full / none | Full 61.48 | Post 61.09 | +0.39 |
### 4.3 WorldArena 兼容性
| 模型 | WorldArena |
|---|---|
| IRASim[^6] | 58.12 |
| Ctrl-World | 59.70 |
| **WEM** | 58.10 |
WEM 在 WorldArena 上不掉队(接近 IRASim 和 Ctrl-World),说明 world-ego 解耦不是"只在 HTEWorld 上有效"的过拟合 trick。
### 4.4 关键消融
| 移除组件 | EWMScore |
|---|---|
| 完整 WEM | 61.48 |
| Asymmetric Query Budget | 60.50 |
| Role-Conditioned Attention | 60.64 |
| Neighbor-Expanded Routing | 59.57 |
三者均贡献 ~1 分,叠加起来正好恢复至 baseline 58.40 附近。
### 4.5 HTEWorld 的 6 项专属指标
WEM 顺带提出了 6 个针对混合长视野的指标:
- **RCBD**RobotContext Boundary Drift):world / ego 边界漂移;
- **LPSA**Long-horizon Persistent Scene Adherence):长视野场景一致性;
- **CISR**Cross-Instruction Style Robustness):跨指令风格鲁棒性;
- **PMPA**Per-Manipulation Pose Accuracy):操作位姿精度;
- **CPDM**Cross-Phase Dynamics Matching):阶段切换处的动力学一致;
- **FPHS**Full-Pipeline Human Score):人类打分。
EWMScore 即是六者的加权融合,使评测既覆盖物理控制又覆盖视频质量。
## 5. 个人评析
### 5.1 真正的范式贡献
WEM 把"为什么 video world model 在具身长视野任务上不行"这一长期被归咎于参数量或数据的问题,**转译成了一个明确可拆解的结构性问题**:world 与 ego 没有分流。Cosmos-14B 的 55.41 vs WEM-5B 的 61.48 这一组数字本身就是论文的全部说服力来源——它说明扩参数无法补结构。
### 5.2 真正的硬约束
1. **仅在仿真数据评测**BEHAVIOR-1K 是高保真仿真但不是真机,sim-to-real 完全未验证;
2. **默认依赖实例分割标注**Semantic 边界优于 motion / intention 的代价是必须在训练数据里提供分割掩码,部署到无标注真实数据的扩展路径尚不清晰;
3. **长视野自回归仍有 chunk 间漂移**:37 帧/chunk 的拼接处依然出现一致性下降(论文 LPSA 指标中可看出),未根治;
4. **缺乏可微动力学闭环**:和 OrbiSim 相反,WEM 没有提供"用梯度训练机器人策略"的接口——它依然是生成器,不是仿真器;
5. **MoE 推理成本**CP-MoE 引入约 +30% 推理延迟(论文附录),实时控制不友好。
### 5.3 一句话总结
WEM 是 2026 年最有力地把"世界模型应该分世界与自我两支"这一直觉**做成可复现 5B 模型 + 公开基准**的工作;它最大的不足是把所有筹码都压在视频生成端,对策略闭环和真实域几乎没有覆盖。
## 6. 与同期工作的关系
- **vs OrbiSim**[^10]:完全互补——OrbiSim 在物理状态层做可微(state-vs-vision),WEM 在视频生成层做语义分解(world-vs-ego)。范式合流的可能性见综述主文 [`joint_synthesis.md`](joint_synthesis.md) §7。
- **vs Cosmos-Predict 2.5**[^4]Cosmos 是单流大模型路线(2B / 14B),EWMScore 落后 WEM 6.1 分,证明结构 > 规模。
- **vs WoW-7B**[^5]WoW 是当下生成式世界模型的代表之一,53.44 vs 61.48 的差距说明"会预测视频"不等于"能完成混合任务"。
- **vs IRASim / Ctrl-World**[^6]WorldArena 上三者持平,说明 WEM 没有为通用基准牺牲单点能力。
- **vs JEPA**[^7]JEPA 提倡 latent-only 预测、抛弃像素;WEM 选择"保留像素 + 显式语义分支",是另一种"避免 pixel 噪声"的工程化答案。
## 参考文献
[^1]: **World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks** (2026). _Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Xingyu Chen._ arXiv:2605.19957. [[PDF]](../../papers/2605.19957v1.pdf) · [项目页](https://zgca-hmi-lab.github.io/WEM) · [HF 模型](https://huggingface.co/Zoorao/WEM) · [HF 数据集](https://huggingface.co/datasets/Zoorao/HTEWorld)
[^2]: **BEHAVIOR-1K: A Benchmark for Embodied AI with 1,000 Everyday Activities** (2023).
[^3]: **Wan2.2-TI2V: Text-Image-to-Video Generation** (2025).
[^4]: **Cosmos-Predict 2.5** (2025). _NVIDIA._
[^5]: **WoW: World-on-World Generative Model** (2025).
[^6]: **IRASim / Ctrl-World** (2025).
[^7]: **I-JEPA / V-JEPA** (20232024). _Yann LeCun et al._
[^8]: **Wan2.2** (2025).
[^9]: **Qwen3-VL** (2025). _Alibaba._
[^10]: **OrbiSim** (2026). arXiv:2605.16395. [[PDF]](../../papers/2605.16395v1.pdf)