- Add literature survey on 2026.05 dual paradigm-shifting works: OrbiSim (differentiable physics engine) and WEM (world-ego disentanglement) - Files: _index.md, orbisim_review.md, wem_review.md, joint_synthesis.md - Update research/world-models/_index.md to register new sub-section
11 KiB
title, date, lastmod, draft, summary, tags, categories, weight, math, toc
| title | date | lastmod | draft | summary | tags | categories | weight | math | toc | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| WEM 深度解读:把世界模型拆成『世界』与『自我』两支 | 2026-05-20 | 2026-05-20 | false | WEM (arXiv:2605.19957) 提出 World-Ego Modeling 新范式,把未来演化分解为 world / ego 两支,并通过 CP-MoE 扩散生成器在长视野混合导航-操作任务上把 EWMScore 推到 61.48。 |
|
|
30 | true | true |
1. 摘要复述
WEM1 (World-Ego Model)由 CASIA / 国科大 / 中关村学院 / 上交 / 北大联合提出(一作 Zuyao Lin,通讯 Xingyu Chen),其核心论断是:
现有世界模型把"持久的、指令无关的场景规律(world)"和"以机器人为中心的、指令条件化的动力学(ego)"塞在同一条预测流里,导致长视野混合任务(hybrid navigation-manipulation)严重退化。
WEM 把未来视频生成显式分解为 $S^{w}$(world state)与 $S^{e}$(ego state)两支,并给出三种边界定义(motion / semantic / intention)和三种解耦策略(pre / post / full)。架构上采用冻结的 Qwen3-VL-2B2 做规划,加上基于 Wan2.2-TI2V-5B3 的 CP-MoE DiT 做生成。同时发布了首个混合导航-操作长视野基准 HTEWorld:125K 训练片段(4.5M+ 帧)+ 300 评估轨迹(2K+ 指令),并公开模型 Zoorao/WEM 与数据集 Zoorao/HTEWorld。
在 HTEWorld 上,WEM 的综合指标 EWMScore = 61.48,超过 PAN-style 5B(58.40)、Cosmos-Predict 2.5-14B(55.41)、WoW-7B(53.44)等所有基线。
2. 动机:长视野混合任务为什么会退化
作者把"具身长视野"拆出一个被忽视的子集:混合导航-操作任务——机器人需要在大场景里走过去、找到目标、操作、再走回来或进入下一个房间。这类任务有两个特殊难点:
- 场景规律是持久的:墙、家具、室内布局对任何指令都基本不变;
- 机器人动力学是瞬时且指令相关的:手臂轨迹、抓取序列高度依赖指令。
如果用单流 video predictor(Cosmos、WoW、Wan2.2)建模,二者的统计特征会互相污染:长视野自回归 rollout 时,scene 漂移导致 ego 失锚,ego 噪声又反馈进 scene token,最终视频陷入"语义糊掉 + 物体闪现"的失败模式。
WEM 的诊断是:这不是参数量不够,是分解结构不对。哪怕 Cosmos-Predict 2.5-14B 这种 14B 模型,在 HTEWorld 上 EWMScore 也只有 55.41,落后于 5B 量级的 PAN-style(58.40)和 WEM 自身(61.48)。
3. 方法
3.1 形式化:World-Ego 分解
设未来时刻 k 的隐状态为 $S_k$,WEM 把它显式分解为:
S_k = S^{w}_k \;\oplus\; S^{e}_k
其中 S^{w}_k 是指令无关的世界 token,S^{e}_k 是指令条件化的自我 token。生成目标用 flow-matching 损失,并加上掩码一致性正则:
\mathcal{L} = \mathcal{L}_{\text{FM}}\bigl(\hat{v}_\theta(S_k, \text{instr}, t), v^{*}_k\bigr) \;+\; \lambda \,\mathcal{L}_{\text{mask}}(S^{w}_k, S^{e}_k)
3.2 三种 World-Ego 边界
| 边界 | 定义 | EWMScore |
|---|---|---|
| Motion-based | 用光流幅值阈值 | 59.36 |
| Semantic-based(默认) | 用实例分割决定哪个 patch 属于机器人本体 | 61.48 |
| Intention-based | 用指令对齐的注意力图 | 58.69 |
Semantic 在三者中最优,因为它直接利用像素级语义边界,最不易被运动模糊或指令歧义污染。代价是推理时依赖实例分割掩码。
3.3 三种解耦策略
| 策略 | 何时分两支 | EWMScore |
|---|---|---|
| 无解耦(baseline, PAN-style) | 始终单流 | 58.40 |
| Pre-disent | 输入阶段就分流 | 58.85 |
| Post-disent(w/ semantic proxy) | 生成后再分 | 61.09 |
| Full-disent(默认) | 输入、注意力、专家、输出全程分 | 61.48 |
3.4 架构总览
指令 + 历史帧
│
▼
┌──────────────────────────┐
│ Qwen3-VL-2B (frozen) │ ← 规划:产生 world/ego query
│ + Role-Conditioned Attn │
│ + Asymmetric Query Budget│ 192 world tokens / 64 ego tokens
└─────────────┬────────────┘
│ 256 cond. tokens
▼
┌──────────────────────────┐
│ CP-MoE DiT (Wan2.2-TI2V) │
│ ├─ 24 shared DiT blocks │
│ ├─ semantic head │ ← world/ego routing
│ ├─ 6 world expert blocks│ ┐
│ ├─ 6 ego expert blocks │ ├─ parallel
│ └─ unrouting + FM head │ ┘
└─────────────┬────────────┘
▼
未来视频 chunk
几个关键点:
- Role-Conditioned Attention (RCA):在 cross-attn 里用 role tag 区分 world / ego query,使 Qwen 输出的 256 个 condition token 一开始就带有解耦先验。
- Asymmetric Query Budget(192 + 64):world 比 ego 多 3×,因为场景信息更丰富但变化更慢;ego 较少但更密集地参与动力学预测。消融显示去掉非对称预算后 EWMScore 跌到 60.50。
- CP-MoE = Cascade-Parallel MoE:24 个 DiT block 共享,之后 semantic head 路由到 world / ego 专家各 6 个 block 并行,再 unrouting 汇总进入 flow-matching head。
- Neighbor-Expanded Routing:路由不是 hard top-1,而是把空间邻居也带入对应专家,去掉后 EWMScore 跌至 59.57。
3.5 训练配置
- 16× A100 80GB;lr = 1e-5;EMA 0.99;4 epochs;
- 480×480 @ 16 FPS;35 diffusion steps;37 frames / chunk;
- 在 BEHAVIOR-1K 衍生数据上构建 125K 训练片段(>4.5M 帧)。
4. 实验
4.1 HTEWorld 主结果
| 模型 | 规模 | EWMScore ↑ |
|---|---|---|
| WoW-7B | 7B | 53.44 |
| Cosmos-Predict 2.5 | 2B | 54.83 |
| Cosmos-Predict 2.5 | 14B | 55.41 |
| PAN-style | 5B | 58.40 |
| WEM | 5B | 61.48 |
值得注意的是 WEM 5B 战胜了 Cosmos 14B 近 6.1 分。说明结构性解耦的边际收益超过 3× 参数扩张。
4.2 设计研究(Design Study)
| Study | 变量 | 最优 | 次优 | 差距 |
|---|---|---|---|---|
| I — 边界 | motion / semantic / intention | Semantic 61.48 | Motion 59.36 | +2.12 |
| II — 策略 | pre / post / full / none | Full 61.48 | Post 61.09 | +0.39 |
4.3 WorldArena 兼容性
| 模型 | WorldArena |
|---|---|
| IRASim4 | 58.12 |
| Ctrl-World | 59.70 |
| WEM | 58.10 |
WEM 在 WorldArena 上不掉队(接近 IRASim 和 Ctrl-World),说明 world-ego 解耦不是"只在 HTEWorld 上有效"的过拟合 trick。
4.4 关键消融
| 移除组件 | EWMScore |
|---|---|
| 完整 WEM | 61.48 |
| − Asymmetric Query Budget | 60.50 |
| − Role-Conditioned Attention | 60.64 |
| − Neighbor-Expanded Routing | 59.57 |
三者均贡献 ~1 分,叠加起来正好恢复至 baseline 58.40 附近。
4.5 HTEWorld 的 6 项专属指标
WEM 顺带提出了 6 个针对混合长视野的指标:
- RCBD(Robot–Context Boundary Drift):world / ego 边界漂移;
- LPSA(Long-horizon Persistent Scene Adherence):长视野场景一致性;
- CISR(Cross-Instruction Style Robustness):跨指令风格鲁棒性;
- PMPA(Per-Manipulation Pose Accuracy):操作位姿精度;
- CPDM(Cross-Phase Dynamics Matching):阶段切换处的动力学一致;
- FPHS(Full-Pipeline Human Score):人类打分。
EWMScore 即是六者的加权融合,使评测既覆盖物理控制又覆盖视频质量。
5. 个人评析
5.1 真正的范式贡献
WEM 把"为什么 video world model 在具身长视野任务上不行"这一长期被归咎于参数量或数据的问题,转译成了一个明确可拆解的结构性问题:world 与 ego 没有分流。Cosmos-14B 的 55.41 vs WEM-5B 的 61.48 这一组数字本身就是论文的全部说服力来源——它说明扩参数无法补结构。
5.2 真正的硬约束
- 仅在仿真数据评测:BEHAVIOR-1K 是高保真仿真但不是真机,sim-to-real 完全未验证;
- 默认依赖实例分割标注:Semantic 边界优于 motion / intention 的代价是必须在训练数据里提供分割掩码,部署到无标注真实数据的扩展路径尚不清晰;
- 长视野自回归仍有 chunk 间漂移:37 帧/chunk 的拼接处依然出现一致性下降(论文 LPSA 指标中可看出),未根治;
- 缺乏可微动力学闭环:和 OrbiSim 相反,WEM 没有提供"用梯度训练机器人策略"的接口——它依然是生成器,不是仿真器;
- MoE 推理成本:CP-MoE 引入约 +30% 推理延迟(论文附录),实时控制不友好。
5.3 一句话总结
WEM 是 2026 年最有力地把"世界模型应该分世界与自我两支"这一直觉做成可复现 5B 模型 + 公开基准的工作;它最大的不足是把所有筹码都压在视频生成端,对策略闭环和真实域几乎没有覆盖。
6. 与同期工作的关系
- vs OrbiSim5 :完全互补——OrbiSim 在物理状态层做可微(state-vs-vision),WEM 在视频生成层做语义分解(world-vs-ego)。范式合流的可能性见综述主文
joint_synthesis.md§7。 - vs Cosmos-Predict 2.56 :Cosmos 是单流大模型路线(2B / 14B),EWMScore 落后 WEM 6.1 分,证明结构 > 规模。
- vs WoW-7B7 :WoW 是当下生成式世界模型的代表之一,53.44 vs 61.48 的差距说明"会预测视频"不等于"能完成混合任务"。
- vs IRASim / Ctrl-World4 :WorldArena 上三者持平,说明 WEM 没有为通用基准牺牲单点能力。
- vs JEPA8 :JEPA 提倡 latent-only 预测、抛弃像素;WEM 选择"保留像素 + 显式语义分支",是另一种"避免 pixel 噪声"的工程化答案。
参考文献
-
World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks (2026). Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Xingyu Chen. arXiv:2605.19957. [PDF] · 项目页 · HF 模型 · HF 数据集 ↩︎
-
Qwen3-VL (2025). Alibaba. ↩︎
-
Wan2.2 (2025). ↩︎
-
IRASim / Ctrl-World (2025). ↩︎
-
Cosmos-Predict 2.5 (2025). NVIDIA. ↩︎
-
WoW: World-on-World Generative Model (2025). ↩︎
-
I-JEPA / V-JEPA (2023–2024). Yann LeCun et al. ↩︎