Files
gaojie 732706bb6f
Sync to site1 / sync (push) Has been cancelled
docs(research): add world-models paradigm-redesign-2026 survey
- Add literature survey on 2026.05 dual paradigm-shifting works:
  OrbiSim (differentiable physics engine) and WEM (world-ego disentanglement)
- Files: _index.md, orbisim_review.md, wem_review.md, joint_synthesis.md
- Update research/world-models/_index.md to register new sub-section
2026-05-21 09:15:25 +08:00

11 KiB
Raw Permalink Blame History

title, date, lastmod, draft, summary, tags, categories, weight, math, toc
title date lastmod draft summary tags categories weight math toc
WEM 深度解读:把世界模型拆成『世界』与『自我』两支 2026-05-20 2026-05-20 false WEM (arXiv:2605.19957) 提出 World-Ego Modeling 新范式,把未来演化分解为 world / ego 两支,并通过 CP-MoE 扩散生成器在长视野混合导航-操作任务上把 EWMScore 推到 61.48。
world-models
world-ego-disentanglement
diffusion
MoE
embodied-ai
long-horizon
HTEWorld
WEM
research
world-models
30 true true

1. 摘要复述

WEM1 World-Ego Model)由 CASIA / 国科大 / 中关村学院 / 上交 / 北大联合提出(一作 Zuyao Lin,通讯 Xingyu Chen),其核心论断是:

现有世界模型把"持久的、指令无关的场景规律(world)"和"以机器人为中心的、指令条件化的动力学(ego)"塞在同一条预测流里,导致长视野混合任务hybrid navigation-manipulation)严重退化。

WEM 把未来视频生成显式分解为 $S^{w}$world state)与 $S^{e}$ego state)两支,并给出三种边界定义(motion / semantic / intention)和三种解耦策略(pre / post / full)。架构上采用冻结的 Qwen3-VL-2B2 做规划,加上基于 Wan2.2-TI2V-5B3 CP-MoE DiT 做生成。同时发布了首个混合导航-操作长视野基准 HTEWorld125K 训练片段(4.5M+ 帧)+ 300 评估轨迹(2K+ 指令),并公开模型 Zoorao/WEM 与数据集 Zoorao/HTEWorld

在 HTEWorld 上,WEM 的综合指标 EWMScore = 61.48,超过 PAN-style 5B58.40)、Cosmos-Predict 2.5-14B55.41)、WoW-7B53.44)等所有基线。

2. 动机:长视野混合任务为什么会退化

作者把"具身长视野"拆出一个被忽视的子集:混合导航-操作任务——机器人需要在大场景里走过去、找到目标、操作、再走回来或进入下一个房间。这类任务有两个特殊难点:

  1. 场景规律是持久的:墙、家具、室内布局对任何指令都基本不变;
  2. 机器人动力学是瞬时且指令相关的:手臂轨迹、抓取序列高度依赖指令。

如果用单流 video predictorCosmos、WoW、Wan2.2)建模,二者的统计特征会互相污染:长视野自回归 rollout 时,scene 漂移导致 ego 失锚,ego 噪声又反馈进 scene token,最终视频陷入"语义糊掉 + 物体闪现"的失败模式。

WEM 的诊断是:这不是参数量不够,是分解结构不对。哪怕 Cosmos-Predict 2.5-14B 这种 14B 模型,在 HTEWorld 上 EWMScore 也只有 55.41,落后于 5B 量级的 PAN-style58.40)和 WEM 自身(61.48)。

3. 方法

3.1 形式化:World-Ego 分解

设未来时刻 k 的隐状态为 $S_k$,WEM 把它显式分解为:


S_k = S^{w}_k \;\oplus\; S^{e}_k

其中 S^{w}_k 是指令无关的世界 tokenS^{e}_k 是指令条件化的自我 token。生成目标用 flow-matching 损失,并加上掩码一致性正则:


\mathcal{L} = \mathcal{L}_{\text{FM}}\bigl(\hat{v}_\theta(S_k, \text{instr}, t), v^{*}_k\bigr) \;+\; \lambda \,\mathcal{L}_{\text{mask}}(S^{w}_k, S^{e}_k)

3.2 三种 World-Ego 边界

边界 定义 EWMScore
Motion-based 用光流幅值阈值 59.36
Semantic-based(默认) 用实例分割决定哪个 patch 属于机器人本体 61.48
Intention-based 用指令对齐的注意力图 58.69

Semantic 在三者中最优,因为它直接利用像素级语义边界,最不易被运动模糊或指令歧义污染。代价是推理时依赖实例分割掩码。

3.3 三种解耦策略

策略 何时分两支 EWMScore
无解耦(baseline, PAN-style 始终单流 58.40
Pre-disent 输入阶段就分流 58.85
Post-disentw/ semantic proxy 生成后再分 61.09
Full-disent(默认) 输入、注意力、专家、输出全程分 61.48

3.4 架构总览

指令 + 历史帧
     │
     ▼
┌──────────────────────────┐
│ Qwen3-VL-2B (frozen)     │  ← 规划:产生 world/ego query
│ + Role-Conditioned Attn  │
│ + Asymmetric Query Budget│   192 world tokens / 64 ego tokens
└─────────────┬────────────┘
              │ 256 cond. tokens
              ▼
┌──────────────────────────┐
│ CP-MoE DiT (Wan2.2-TI2V) │
│  ├─ 24 shared DiT blocks │
│  ├─ semantic head        │  ← world/ego routing
│  ├─ 6 world expert blocks│   ┐
│  ├─ 6 ego expert blocks  │   ├─ parallel
│  └─ unrouting + FM head  │   ┘
└─────────────┬────────────┘
              ▼
        未来视频 chunk

几个关键点:

  • Role-Conditioned Attention (RCA):在 cross-attn 里用 role tag 区分 world / ego query,使 Qwen 输出的 256 个 condition token 一开始就带有解耦先验。
  • Asymmetric Query Budget192 + 64world 比 ego 多 3×,因为场景信息更丰富但变化更慢;ego 较少但更密集地参与动力学预测。消融显示去掉非对称预算后 EWMScore 跌到 60.50。
  • CP-MoE = Cascade-Parallel MoE24 个 DiT block 共享,之后 semantic head 路由到 world / ego 专家各 6 个 block 并行,再 unrouting 汇总进入 flow-matching head。
  • Neighbor-Expanded Routing:路由不是 hard top-1,而是把空间邻居也带入对应专家,去掉后 EWMScore 跌至 59.57。

3.5 训练配置

  • 16× A100 80GBlr = 1e-5EMA 0.994 epochs
  • 480×480 @ 16 FPS35 diffusion steps37 frames / chunk
  • 在 BEHAVIOR-1K 衍生数据上构建 125K 训练片段(>4.5M 帧)。

4. 实验

4.1 HTEWorld 主结果

模型 规模 EWMScore ↑
WoW-7B 7B 53.44
Cosmos-Predict 2.5 2B 54.83
Cosmos-Predict 2.5 14B 55.41
PAN-style 5B 58.40
WEM 5B 61.48

值得注意的是 WEM 5B 战胜了 Cosmos 14B 近 6.1 分。说明结构性解耦的边际收益超过 3× 参数扩张。

4.2 设计研究(Design Study

Study 变量 最优 次优 差距
I — 边界 motion / semantic / intention Semantic 61.48 Motion 59.36 +2.12
II — 策略 pre / post / full / none Full 61.48 Post 61.09 +0.39

4.3 WorldArena 兼容性

模型 WorldArena
IRASim4 58.12
Ctrl-World 59.70
WEM 58.10

WEM 在 WorldArena 上不掉队(接近 IRASim 和 Ctrl-World),说明 world-ego 解耦不是"只在 HTEWorld 上有效"的过拟合 trick。

4.4 关键消融

移除组件 EWMScore
完整 WEM 61.48
Asymmetric Query Budget 60.50
Role-Conditioned Attention 60.64
Neighbor-Expanded Routing 59.57

三者均贡献 ~1 分,叠加起来正好恢复至 baseline 58.40 附近。

4.5 HTEWorld 的 6 项专属指标

WEM 顺带提出了 6 个针对混合长视野的指标:

  • RCBDRobotContext Boundary Drift):world / ego 边界漂移;
  • LPSALong-horizon Persistent Scene Adherence):长视野场景一致性;
  • CISRCross-Instruction Style Robustness):跨指令风格鲁棒性;
  • PMPAPer-Manipulation Pose Accuracy):操作位姿精度;
  • CPDMCross-Phase Dynamics Matching):阶段切换处的动力学一致;
  • FPHSFull-Pipeline Human Score):人类打分。

EWMScore 即是六者的加权融合,使评测既覆盖物理控制又覆盖视频质量。

5. 个人评析

5.1 真正的范式贡献

WEM 把"为什么 video world model 在具身长视野任务上不行"这一长期被归咎于参数量或数据的问题,转译成了一个明确可拆解的结构性问题world 与 ego 没有分流。Cosmos-14B 的 55.41 vs WEM-5B 的 61.48 这一组数字本身就是论文的全部说服力来源——它说明扩参数无法补结构。

5.2 真正的硬约束

  1. 仅在仿真数据评测BEHAVIOR-1K 是高保真仿真但不是真机,sim-to-real 完全未验证;
  2. 默认依赖实例分割标注Semantic 边界优于 motion / intention 的代价是必须在训练数据里提供分割掩码,部署到无标注真实数据的扩展路径尚不清晰;
  3. 长视野自回归仍有 chunk 间漂移:37 帧/chunk 的拼接处依然出现一致性下降(论文 LPSA 指标中可看出),未根治;
  4. 缺乏可微动力学闭环:和 OrbiSim 相反,WEM 没有提供"用梯度训练机器人策略"的接口——它依然是生成器,不是仿真器;
  5. MoE 推理成本CP-MoE 引入约 +30% 推理延迟(论文附录),实时控制不友好。

5.3 一句话总结

WEM 是 2026 年最有力地把"世界模型应该分世界与自我两支"这一直觉做成可复现 5B 模型 + 公开基准的工作;它最大的不足是把所有筹码都压在视频生成端,对策略闭环和真实域几乎没有覆盖。

6. 与同期工作的关系

  • vs OrbiSim5 :完全互补——OrbiSim 在物理状态层做可微(state-vs-vision),WEM 在视频生成层做语义分解(world-vs-ego)。范式合流的可能性见综述主文 joint_synthesis.md §7。
  • vs Cosmos-Predict 2.56 :Cosmos 是单流大模型路线(2B / 14B),EWMScore 落后 WEM 6.1 分,证明结构 > 规模。
  • vs WoW-7B7 :WoW 是当下生成式世界模型的代表之一,53.44 vs 61.48 的差距说明"会预测视频"不等于"能完成混合任务"。
  • vs IRASim / Ctrl-World4 WorldArena 上三者持平,说明 WEM 没有为通用基准牺牲单点能力。
  • vs JEPA8 JEPA 提倡 latent-only 预测、抛弃像素;WEM 选择"保留像素 + 显式语义分支",是另一种"避免 pixel 噪声"的工程化答案。

参考文献


  1. World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks (2026). Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Xingyu Chen. arXiv:2605.19957. [PDF] · 项目页 · HF 模型 · HF 数据集 ↩︎

  2. Qwen3-VL (2025). Alibaba. ↩︎

  3. Wan2.2 (2025). ↩︎

  4. IRASim / Ctrl-World (2025). ↩︎

  5. OrbiSim (2026). arXiv:2605.16395. [PDF] ↩︎

  6. Cosmos-Predict 2.5 (2025). NVIDIA. ↩︎

  7. WoW: World-on-World Generative Model (2025). ↩︎

  8. I-JEPA / V-JEPA (20232024). Yann LeCun et al. ↩︎