Files
worldmodel/research/world-models/paradigm-redesign-2026/wem_review.md
T
gaojie 732706bb6f
Sync to site1 / sync (push) Has been cancelled
docs(research): add world-models paradigm-redesign-2026 survey
- Add literature survey on 2026.05 dual paradigm-shifting works:
  OrbiSim (differentiable physics engine) and WEM (world-ego disentanglement)
- Files: _index.md, orbisim_review.md, wem_review.md, joint_synthesis.md
- Update research/world-models/_index.md to register new sub-section
2026-05-21 09:15:25 +08:00

210 lines
11 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
---
title: "WEM 深度解读:把世界模型拆成『世界』与『自我』两支"
date: 2026-05-20
lastmod: 2026-05-20
draft: false
summary: "WEM (arXiv:2605.19957) 提出 World-Ego Modeling 新范式,把未来演化分解为 world / ego 两支,并通过 CP-MoE 扩散生成器在长视野混合导航-操作任务上把 EWMScore 推到 61.48。"
tags: ["world-models", "world-ego-disentanglement", "diffusion", "MoE", "embodied-ai", "long-horizon", "HTEWorld", "WEM"]
categories: ["research", "world-models"]
weight: 30
math: true
toc: true
---
## 1. 摘要复述
**WEM**[^1]World-Ego Model)由 CASIA / 国科大 / 中关村学院 / 上交 / 北大联合提出(一作 Zuyao Lin,通讯 Xingyu Chen),其核心论断是:
> 现有世界模型把"持久的、指令无关的场景规律(world)"和"以机器人为中心的、指令条件化的动力学(ego)"塞在**同一条预测流**里,导致**长视野混合任务**hybrid navigation-manipulation)严重退化。
WEM 把未来视频生成显式分解为 $S^{w}$world state)与 $S^{e}$ego state)两支,并给出三种边界定义(motion / semantic / intention)和三种解耦策略(pre / post / full)。架构上采用**冻结的 Qwen3-VL-2B**[^9] 做规划,加上**基于 Wan2.2-TI2V-5B**[^8] 的 **CP-MoE DiT** 做生成。同时发布了**首个混合导航-操作长视野基准 HTEWorld**125K 训练片段(4.5M+ 帧)+ 300 评估轨迹(2K+ 指令),并公开模型 [`Zoorao/WEM`](https://huggingface.co/Zoorao/WEM) 与数据集 [`Zoorao/HTEWorld`](https://huggingface.co/datasets/Zoorao/HTEWorld)。
在 HTEWorld 上,WEM 的综合指标 **EWMScore = 61.48**,超过 PAN-style 5B58.40)、Cosmos-Predict 2.5-14B55.41)、WoW-7B53.44)等所有基线。
## 2. 动机:长视野混合任务为什么会退化
作者把"具身长视野"拆出一个被忽视的子集:**混合导航-操作任务**——机器人需要在大场景里走过去、找到目标、操作、再走回来或进入下一个房间。这类任务有两个特殊难点:
1. **场景规律是持久的**:墙、家具、室内布局对任何指令都基本不变;
2. **机器人动力学是瞬时且指令相关的**:手臂轨迹、抓取序列高度依赖指令。
如果用单流 video predictorCosmos、WoW、Wan2.2)建模,二者的统计特征会互相污染:长视野自回归 rollout 时,scene 漂移导致 ego 失锚,ego 噪声又反馈进 scene token,最终视频陷入"语义糊掉 + 物体闪现"的失败模式。
WEM 的诊断是:**这不是参数量不够,是分解结构不对**。哪怕 Cosmos-Predict 2.5-14B 这种 14B 模型,在 HTEWorld 上 EWMScore 也只有 55.41,落后于 5B 量级的 PAN-style58.40)和 WEM 自身(61.48)。
## 3. 方法
### 3.1 形式化:World-Ego 分解
设未来时刻 $k$ 的隐状态为 $S_k$,WEM 把它显式分解为:
$$
S_k = S^{w}_k \;\oplus\; S^{e}_k
$$
其中 $S^{w}_k$ 是指令无关的世界 token$S^{e}_k$ 是指令条件化的自我 token。生成目标用 flow-matching 损失,并加上掩码一致性正则:
$$
\mathcal{L} = \mathcal{L}_{\text{FM}}\bigl(\hat{v}_\theta(S_k, \text{instr}, t), v^{*}_k\bigr) \;+\; \lambda \,\mathcal{L}_{\text{mask}}(S^{w}_k, S^{e}_k)
$$
### 3.2 三种 World-Ego 边界
| 边界 | 定义 | EWMScore |
|---|---|---|
| Motion-based | 用光流幅值阈值 | 59.36 |
| **Semantic-based**(默认) | 用实例分割决定哪个 patch 属于机器人本体 | **61.48** |
| Intention-based | 用指令对齐的注意力图 | 58.69 |
Semantic 在三者中最优,因为它直接利用**像素级语义边界**,最不易被运动模糊或指令歧义污染。代价是推理时依赖实例分割掩码。
### 3.3 三种解耦策略
| 策略 | 何时分两支 | EWMScore |
|---|---|---|
| 无解耦(baseline, PAN-style | 始终单流 | 58.40 |
| Pre-disent | 输入阶段就分流 | 58.85 |
| Post-disentw/ semantic proxy | 生成后再分 | 61.09 |
| **Full-disent**(默认) | 输入、注意力、专家、输出全程分 | **61.48** |
### 3.4 架构总览
```
指令 + 历史帧
┌──────────────────────────┐
│ Qwen3-VL-2B (frozen) │ ← 规划:产生 world/ego query
│ + Role-Conditioned Attn │
│ + Asymmetric Query Budget│ 192 world tokens / 64 ego tokens
└─────────────┬────────────┘
│ 256 cond. tokens
┌──────────────────────────┐
│ CP-MoE DiT (Wan2.2-TI2V) │
│ ├─ 24 shared DiT blocks │
│ ├─ semantic head │ ← world/ego routing
│ ├─ 6 world expert blocks│ ┐
│ ├─ 6 ego expert blocks │ ├─ parallel
│ └─ unrouting + FM head │ ┘
└─────────────┬────────────┘
未来视频 chunk
```
几个关键点:
- **Role-Conditioned Attention (RCA)**:在 cross-attn 里用 role tag 区分 world / ego query,使 Qwen 输出的 256 个 condition token 一开始就带有解耦先验。
- **Asymmetric Query Budget192 + 64**world 比 ego 多 3×,因为场景信息更丰富但变化更慢;ego 较少但更密集地参与动力学预测。消融显示去掉非对称预算后 EWMScore 跌到 60.50。
- **CP-MoE = Cascade-Parallel MoE**24 个 DiT block 共享,之后 semantic head 路由到 world / ego 专家各 6 个 block 并行,再 unrouting 汇总进入 flow-matching head。
- **Neighbor-Expanded Routing**:路由不是 hard top-1,而是把空间邻居也带入对应专家,去掉后 EWMScore 跌至 59.57。
### 3.5 训练配置
- 16× A100 80GBlr = 1e-5EMA 0.994 epochs
- 480×480 @ 16 FPS35 diffusion steps37 frames / chunk
- 在 BEHAVIOR-1K 衍生数据上构建 125K 训练片段(>4.5M 帧)。
## 4. 实验
### 4.1 HTEWorld 主结果
| 模型 | 规模 | EWMScore ↑ |
|---|---|---|
| WoW-7B | 7B | 53.44 |
| Cosmos-Predict 2.5 | 2B | 54.83 |
| Cosmos-Predict 2.5 | 14B | 55.41 |
| PAN-style | 5B | 58.40 |
| **WEM** | 5B | **61.48** |
值得注意的是 **WEM 5B 战胜了 Cosmos 14B 近 6.1 分**。说明结构性解耦的边际收益超过 3× 参数扩张。
### 4.2 设计研究(Design Study
| Study | 变量 | 最优 | 次优 | 差距 |
|---|---|---|---|---|
| I — 边界 | motion / semantic / intention | Semantic 61.48 | Motion 59.36 | +2.12 |
| II — 策略 | pre / post / full / none | Full 61.48 | Post 61.09 | +0.39 |
### 4.3 WorldArena 兼容性
| 模型 | WorldArena |
|---|---|
| IRASim[^6] | 58.12 |
| Ctrl-World | 59.70 |
| **WEM** | 58.10 |
WEM 在 WorldArena 上不掉队(接近 IRASim 和 Ctrl-World),说明 world-ego 解耦不是"只在 HTEWorld 上有效"的过拟合 trick。
### 4.4 关键消融
| 移除组件 | EWMScore |
|---|---|
| 完整 WEM | 61.48 |
| Asymmetric Query Budget | 60.50 |
| Role-Conditioned Attention | 60.64 |
| Neighbor-Expanded Routing | 59.57 |
三者均贡献 ~1 分,叠加起来正好恢复至 baseline 58.40 附近。
### 4.5 HTEWorld 的 6 项专属指标
WEM 顺带提出了 6 个针对混合长视野的指标:
- **RCBD**RobotContext Boundary Drift):world / ego 边界漂移;
- **LPSA**Long-horizon Persistent Scene Adherence):长视野场景一致性;
- **CISR**Cross-Instruction Style Robustness):跨指令风格鲁棒性;
- **PMPA**Per-Manipulation Pose Accuracy):操作位姿精度;
- **CPDM**Cross-Phase Dynamics Matching):阶段切换处的动力学一致;
- **FPHS**Full-Pipeline Human Score):人类打分。
EWMScore 即是六者的加权融合,使评测既覆盖物理控制又覆盖视频质量。
## 5. 个人评析
### 5.1 真正的范式贡献
WEM 把"为什么 video world model 在具身长视野任务上不行"这一长期被归咎于参数量或数据的问题,**转译成了一个明确可拆解的结构性问题**:world 与 ego 没有分流。Cosmos-14B 的 55.41 vs WEM-5B 的 61.48 这一组数字本身就是论文的全部说服力来源——它说明扩参数无法补结构。
### 5.2 真正的硬约束
1. **仅在仿真数据评测**BEHAVIOR-1K 是高保真仿真但不是真机,sim-to-real 完全未验证;
2. **默认依赖实例分割标注**Semantic 边界优于 motion / intention 的代价是必须在训练数据里提供分割掩码,部署到无标注真实数据的扩展路径尚不清晰;
3. **长视野自回归仍有 chunk 间漂移**:37 帧/chunk 的拼接处依然出现一致性下降(论文 LPSA 指标中可看出),未根治;
4. **缺乏可微动力学闭环**:和 OrbiSim 相反,WEM 没有提供"用梯度训练机器人策略"的接口——它依然是生成器,不是仿真器;
5. **MoE 推理成本**CP-MoE 引入约 +30% 推理延迟(论文附录),实时控制不友好。
### 5.3 一句话总结
WEM 是 2026 年最有力地把"世界模型应该分世界与自我两支"这一直觉**做成可复现 5B 模型 + 公开基准**的工作;它最大的不足是把所有筹码都压在视频生成端,对策略闭环和真实域几乎没有覆盖。
## 6. 与同期工作的关系
- **vs OrbiSim**[^10]:完全互补——OrbiSim 在物理状态层做可微(state-vs-vision),WEM 在视频生成层做语义分解(world-vs-ego)。范式合流的可能性见综述主文 [`joint_synthesis.md`](joint_synthesis.md) §7。
- **vs Cosmos-Predict 2.5**[^4]Cosmos 是单流大模型路线(2B / 14B),EWMScore 落后 WEM 6.1 分,证明结构 > 规模。
- **vs WoW-7B**[^5]WoW 是当下生成式世界模型的代表之一,53.44 vs 61.48 的差距说明"会预测视频"不等于"能完成混合任务"。
- **vs IRASim / Ctrl-World**[^6]WorldArena 上三者持平,说明 WEM 没有为通用基准牺牲单点能力。
- **vs JEPA**[^7]JEPA 提倡 latent-only 预测、抛弃像素;WEM 选择"保留像素 + 显式语义分支",是另一种"避免 pixel 噪声"的工程化答案。
## 参考文献
[^1]: **World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks** (2026). _Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Xingyu Chen._ arXiv:2605.19957. [[PDF]](../../papers/2605.19957v1.pdf) · [项目页](https://zgca-hmi-lab.github.io/WEM) · [HF 模型](https://huggingface.co/Zoorao/WEM) · [HF 数据集](https://huggingface.co/datasets/Zoorao/HTEWorld)
[^2]: **BEHAVIOR-1K: A Benchmark for Embodied AI with 1,000 Everyday Activities** (2023).
[^3]: **Wan2.2-TI2V: Text-Image-to-Video Generation** (2025).
[^4]: **Cosmos-Predict 2.5** (2025). _NVIDIA._
[^5]: **WoW: World-on-World Generative Model** (2025).
[^6]: **IRASim / Ctrl-World** (2025).
[^7]: **I-JEPA / V-JEPA** (20232024). _Yann LeCun et al._
[^8]: **Wan2.2** (2025).
[^9]: **Qwen3-VL** (2025). _Alibaba._
[^10]: **OrbiSim** (2026). arXiv:2605.16395. [[PDF]](../../papers/2605.16395v1.pdf)