docs(research): add world-models paradigm-redesign-2026 survey
Sync to site1 / sync (push) Has been cancelled
Sync to site1 / sync (push) Has been cancelled
- Add literature survey on 2026.05 dual paradigm-shifting works: OrbiSim (differentiable physics engine) and WEM (world-ego disentanglement) - Files: _index.md, orbisim_review.md, wem_review.md, joint_synthesis.md - Update research/world-models/_index.md to register new sub-section
This commit is contained in:
@@ -0,0 +1,209 @@
|
||||
---
|
||||
title: "WEM 深度解读:把世界模型拆成『世界』与『自我』两支"
|
||||
date: 2026-05-20
|
||||
lastmod: 2026-05-20
|
||||
draft: false
|
||||
summary: "WEM (arXiv:2605.19957) 提出 World-Ego Modeling 新范式,把未来演化分解为 world / ego 两支,并通过 CP-MoE 扩散生成器在长视野混合导航-操作任务上把 EWMScore 推到 61.48。"
|
||||
tags: ["world-models", "world-ego-disentanglement", "diffusion", "MoE", "embodied-ai", "long-horizon", "HTEWorld", "WEM"]
|
||||
categories: ["research", "world-models"]
|
||||
weight: 30
|
||||
math: true
|
||||
toc: true
|
||||
---
|
||||
|
||||
## 1. 摘要复述
|
||||
|
||||
**WEM**[^1](World-Ego Model)由 CASIA / 国科大 / 中关村学院 / 上交 / 北大联合提出(一作 Zuyao Lin,通讯 Xingyu Chen),其核心论断是:
|
||||
|
||||
> 现有世界模型把"持久的、指令无关的场景规律(world)"和"以机器人为中心的、指令条件化的动力学(ego)"塞在**同一条预测流**里,导致**长视野混合任务**(hybrid navigation-manipulation)严重退化。
|
||||
|
||||
WEM 把未来视频生成显式分解为 $S^{w}$(world state)与 $S^{e}$(ego state)两支,并给出三种边界定义(motion / semantic / intention)和三种解耦策略(pre / post / full)。架构上采用**冻结的 Qwen3-VL-2B**[^9] 做规划,加上**基于 Wan2.2-TI2V-5B**[^8] 的 **CP-MoE DiT** 做生成。同时发布了**首个混合导航-操作长视野基准 HTEWorld**:125K 训练片段(4.5M+ 帧)+ 300 评估轨迹(2K+ 指令),并公开模型 [`Zoorao/WEM`](https://huggingface.co/Zoorao/WEM) 与数据集 [`Zoorao/HTEWorld`](https://huggingface.co/datasets/Zoorao/HTEWorld)。
|
||||
|
||||
在 HTEWorld 上,WEM 的综合指标 **EWMScore = 61.48**,超过 PAN-style 5B(58.40)、Cosmos-Predict 2.5-14B(55.41)、WoW-7B(53.44)等所有基线。
|
||||
|
||||
## 2. 动机:长视野混合任务为什么会退化
|
||||
|
||||
作者把"具身长视野"拆出一个被忽视的子集:**混合导航-操作任务**——机器人需要在大场景里走过去、找到目标、操作、再走回来或进入下一个房间。这类任务有两个特殊难点:
|
||||
|
||||
1. **场景规律是持久的**:墙、家具、室内布局对任何指令都基本不变;
|
||||
2. **机器人动力学是瞬时且指令相关的**:手臂轨迹、抓取序列高度依赖指令。
|
||||
|
||||
如果用单流 video predictor(Cosmos、WoW、Wan2.2)建模,二者的统计特征会互相污染:长视野自回归 rollout 时,scene 漂移导致 ego 失锚,ego 噪声又反馈进 scene token,最终视频陷入"语义糊掉 + 物体闪现"的失败模式。
|
||||
|
||||
WEM 的诊断是:**这不是参数量不够,是分解结构不对**。哪怕 Cosmos-Predict 2.5-14B 这种 14B 模型,在 HTEWorld 上 EWMScore 也只有 55.41,落后于 5B 量级的 PAN-style(58.40)和 WEM 自身(61.48)。
|
||||
|
||||
## 3. 方法
|
||||
|
||||
### 3.1 形式化:World-Ego 分解
|
||||
|
||||
设未来时刻 $k$ 的隐状态为 $S_k$,WEM 把它显式分解为:
|
||||
|
||||
$$
|
||||
S_k = S^{w}_k \;\oplus\; S^{e}_k
|
||||
$$
|
||||
|
||||
其中 $S^{w}_k$ 是指令无关的世界 token,$S^{e}_k$ 是指令条件化的自我 token。生成目标用 flow-matching 损失,并加上掩码一致性正则:
|
||||
|
||||
$$
|
||||
\mathcal{L} = \mathcal{L}_{\text{FM}}\bigl(\hat{v}_\theta(S_k, \text{instr}, t), v^{*}_k\bigr) \;+\; \lambda \,\mathcal{L}_{\text{mask}}(S^{w}_k, S^{e}_k)
|
||||
$$
|
||||
|
||||
### 3.2 三种 World-Ego 边界
|
||||
|
||||
| 边界 | 定义 | EWMScore |
|
||||
|---|---|---|
|
||||
| Motion-based | 用光流幅值阈值 | 59.36 |
|
||||
| **Semantic-based**(默认) | 用实例分割决定哪个 patch 属于机器人本体 | **61.48** |
|
||||
| Intention-based | 用指令对齐的注意力图 | 58.69 |
|
||||
|
||||
Semantic 在三者中最优,因为它直接利用**像素级语义边界**,最不易被运动模糊或指令歧义污染。代价是推理时依赖实例分割掩码。
|
||||
|
||||
### 3.3 三种解耦策略
|
||||
|
||||
| 策略 | 何时分两支 | EWMScore |
|
||||
|---|---|---|
|
||||
| 无解耦(baseline, PAN-style) | 始终单流 | 58.40 |
|
||||
| Pre-disent | 输入阶段就分流 | 58.85 |
|
||||
| Post-disent(w/ semantic proxy) | 生成后再分 | 61.09 |
|
||||
| **Full-disent**(默认) | 输入、注意力、专家、输出全程分 | **61.48** |
|
||||
|
||||
### 3.4 架构总览
|
||||
|
||||
```
|
||||
指令 + 历史帧
|
||||
│
|
||||
▼
|
||||
┌──────────────────────────┐
|
||||
│ Qwen3-VL-2B (frozen) │ ← 规划:产生 world/ego query
|
||||
│ + Role-Conditioned Attn │
|
||||
│ + Asymmetric Query Budget│ 192 world tokens / 64 ego tokens
|
||||
└─────────────┬────────────┘
|
||||
│ 256 cond. tokens
|
||||
▼
|
||||
┌──────────────────────────┐
|
||||
│ CP-MoE DiT (Wan2.2-TI2V) │
|
||||
│ ├─ 24 shared DiT blocks │
|
||||
│ ├─ semantic head │ ← world/ego routing
|
||||
│ ├─ 6 world expert blocks│ ┐
|
||||
│ ├─ 6 ego expert blocks │ ├─ parallel
|
||||
│ └─ unrouting + FM head │ ┘
|
||||
└─────────────┬────────────┘
|
||||
▼
|
||||
未来视频 chunk
|
||||
```
|
||||
|
||||
几个关键点:
|
||||
|
||||
- **Role-Conditioned Attention (RCA)**:在 cross-attn 里用 role tag 区分 world / ego query,使 Qwen 输出的 256 个 condition token 一开始就带有解耦先验。
|
||||
- **Asymmetric Query Budget(192 + 64)**:world 比 ego 多 3×,因为场景信息更丰富但变化更慢;ego 较少但更密集地参与动力学预测。消融显示去掉非对称预算后 EWMScore 跌到 60.50。
|
||||
- **CP-MoE = Cascade-Parallel MoE**:24 个 DiT block 共享,之后 semantic head 路由到 world / ego 专家各 6 个 block 并行,再 unrouting 汇总进入 flow-matching head。
|
||||
- **Neighbor-Expanded Routing**:路由不是 hard top-1,而是把空间邻居也带入对应专家,去掉后 EWMScore 跌至 59.57。
|
||||
|
||||
### 3.5 训练配置
|
||||
|
||||
- 16× A100 80GB;lr = 1e-5;EMA 0.99;4 epochs;
|
||||
- 480×480 @ 16 FPS;35 diffusion steps;37 frames / chunk;
|
||||
- 在 BEHAVIOR-1K 衍生数据上构建 125K 训练片段(>4.5M 帧)。
|
||||
|
||||
## 4. 实验
|
||||
|
||||
### 4.1 HTEWorld 主结果
|
||||
|
||||
| 模型 | 规模 | EWMScore ↑ |
|
||||
|---|---|---|
|
||||
| WoW-7B | 7B | 53.44 |
|
||||
| Cosmos-Predict 2.5 | 2B | 54.83 |
|
||||
| Cosmos-Predict 2.5 | 14B | 55.41 |
|
||||
| PAN-style | 5B | 58.40 |
|
||||
| **WEM** | 5B | **61.48** |
|
||||
|
||||
值得注意的是 **WEM 5B 战胜了 Cosmos 14B 近 6.1 分**。说明结构性解耦的边际收益超过 3× 参数扩张。
|
||||
|
||||
### 4.2 设计研究(Design Study)
|
||||
|
||||
| Study | 变量 | 最优 | 次优 | 差距 |
|
||||
|---|---|---|---|---|
|
||||
| I — 边界 | motion / semantic / intention | Semantic 61.48 | Motion 59.36 | +2.12 |
|
||||
| II — 策略 | pre / post / full / none | Full 61.48 | Post 61.09 | +0.39 |
|
||||
|
||||
### 4.3 WorldArena 兼容性
|
||||
|
||||
| 模型 | WorldArena |
|
||||
|---|---|
|
||||
| IRASim[^6] | 58.12 |
|
||||
| Ctrl-World | 59.70 |
|
||||
| **WEM** | 58.10 |
|
||||
|
||||
WEM 在 WorldArena 上不掉队(接近 IRASim 和 Ctrl-World),说明 world-ego 解耦不是"只在 HTEWorld 上有效"的过拟合 trick。
|
||||
|
||||
### 4.4 关键消融
|
||||
|
||||
| 移除组件 | EWMScore |
|
||||
|---|---|
|
||||
| 完整 WEM | 61.48 |
|
||||
| − Asymmetric Query Budget | 60.50 |
|
||||
| − Role-Conditioned Attention | 60.64 |
|
||||
| − Neighbor-Expanded Routing | 59.57 |
|
||||
|
||||
三者均贡献 ~1 分,叠加起来正好恢复至 baseline 58.40 附近。
|
||||
|
||||
### 4.5 HTEWorld 的 6 项专属指标
|
||||
|
||||
WEM 顺带提出了 6 个针对混合长视野的指标:
|
||||
|
||||
- **RCBD**(Robot–Context Boundary Drift):world / ego 边界漂移;
|
||||
- **LPSA**(Long-horizon Persistent Scene Adherence):长视野场景一致性;
|
||||
- **CISR**(Cross-Instruction Style Robustness):跨指令风格鲁棒性;
|
||||
- **PMPA**(Per-Manipulation Pose Accuracy):操作位姿精度;
|
||||
- **CPDM**(Cross-Phase Dynamics Matching):阶段切换处的动力学一致;
|
||||
- **FPHS**(Full-Pipeline Human Score):人类打分。
|
||||
|
||||
EWMScore 即是六者的加权融合,使评测既覆盖物理控制又覆盖视频质量。
|
||||
|
||||
## 5. 个人评析
|
||||
|
||||
### 5.1 真正的范式贡献
|
||||
|
||||
WEM 把"为什么 video world model 在具身长视野任务上不行"这一长期被归咎于参数量或数据的问题,**转译成了一个明确可拆解的结构性问题**:world 与 ego 没有分流。Cosmos-14B 的 55.41 vs WEM-5B 的 61.48 这一组数字本身就是论文的全部说服力来源——它说明扩参数无法补结构。
|
||||
|
||||
### 5.2 真正的硬约束
|
||||
|
||||
1. **仅在仿真数据评测**:BEHAVIOR-1K 是高保真仿真但不是真机,sim-to-real 完全未验证;
|
||||
2. **默认依赖实例分割标注**:Semantic 边界优于 motion / intention 的代价是必须在训练数据里提供分割掩码,部署到无标注真实数据的扩展路径尚不清晰;
|
||||
3. **长视野自回归仍有 chunk 间漂移**:37 帧/chunk 的拼接处依然出现一致性下降(论文 LPSA 指标中可看出),未根治;
|
||||
4. **缺乏可微动力学闭环**:和 OrbiSim 相反,WEM 没有提供"用梯度训练机器人策略"的接口——它依然是生成器,不是仿真器;
|
||||
5. **MoE 推理成本**:CP-MoE 引入约 +30% 推理延迟(论文附录),实时控制不友好。
|
||||
|
||||
### 5.3 一句话总结
|
||||
|
||||
WEM 是 2026 年最有力地把"世界模型应该分世界与自我两支"这一直觉**做成可复现 5B 模型 + 公开基准**的工作;它最大的不足是把所有筹码都压在视频生成端,对策略闭环和真实域几乎没有覆盖。
|
||||
|
||||
## 6. 与同期工作的关系
|
||||
|
||||
- **vs OrbiSim**[^10]:完全互补——OrbiSim 在物理状态层做可微(state-vs-vision),WEM 在视频生成层做语义分解(world-vs-ego)。范式合流的可能性见综述主文 [`joint_synthesis.md`](joint_synthesis.md) §7。
|
||||
- **vs Cosmos-Predict 2.5**[^4]:Cosmos 是单流大模型路线(2B / 14B),EWMScore 落后 WEM 6.1 分,证明结构 > 规模。
|
||||
- **vs WoW-7B**[^5]:WoW 是当下生成式世界模型的代表之一,53.44 vs 61.48 的差距说明"会预测视频"不等于"能完成混合任务"。
|
||||
- **vs IRASim / Ctrl-World**[^6]:WorldArena 上三者持平,说明 WEM 没有为通用基准牺牲单点能力。
|
||||
- **vs JEPA**[^7]:JEPA 提倡 latent-only 预测、抛弃像素;WEM 选择"保留像素 + 显式语义分支",是另一种"避免 pixel 噪声"的工程化答案。
|
||||
|
||||
## 参考文献
|
||||
|
||||
[^1]: **World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks** (2026). _Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Xingyu Chen._ arXiv:2605.19957. [[PDF]](../../papers/2605.19957v1.pdf) · [项目页](https://zgca-hmi-lab.github.io/WEM) · [HF 模型](https://huggingface.co/Zoorao/WEM) · [HF 数据集](https://huggingface.co/datasets/Zoorao/HTEWorld)
|
||||
|
||||
[^2]: **BEHAVIOR-1K: A Benchmark for Embodied AI with 1,000 Everyday Activities** (2023).
|
||||
|
||||
[^3]: **Wan2.2-TI2V: Text-Image-to-Video Generation** (2025).
|
||||
|
||||
[^4]: **Cosmos-Predict 2.5** (2025). _NVIDIA._
|
||||
|
||||
[^5]: **WoW: World-on-World Generative Model** (2025).
|
||||
|
||||
[^6]: **IRASim / Ctrl-World** (2025).
|
||||
|
||||
[^7]: **I-JEPA / V-JEPA** (2023–2024). _Yann LeCun et al._
|
||||
|
||||
[^8]: **Wan2.2** (2025).
|
||||
|
||||
[^9]: **Qwen3-VL** (2025). _Alibaba._
|
||||
|
||||
[^10]: **OrbiSim** (2026). arXiv:2605.16395. [[PDF]](../../papers/2605.16395v1.pdf)
|
||||
Reference in New Issue
Block a user