Files
worldmodel/research/world-models/paradigm-redesign-2026/joint_synthesis.md
T
gaojie 732706bb6f
Sync to site1 / sync (push) Has been cancelled
docs(research): add world-models paradigm-redesign-2026 survey
- Add literature survey on 2026.05 dual paradigm-shifting works:
  OrbiSim (differentiable physics engine) and WEM (world-ego disentanglement)
- Files: _index.md, orbisim_review.md, wem_review.md, joint_synthesis.md
- Update research/world-models/_index.md to register new sub-section
2026-05-21 09:15:25 +08:00

26 KiB
Raw Blame History

title, date, lastmod, draft, summary, tags, categories, weight, math, toc
title date lastmod draft summary tags categories weight math toc
世界模型的范式重塑:从单流视频预测到结构化解耦——OrbiSim 与 WEM 综合评析 2026-05-20 2026-05-20 false 2026 年 5 月几乎同期发布的 OrbiSim 与 WEM 共同向『单流视频世界模型』发起范式挑战:前者把世界模型重写为可微物理引擎(状态-视觉解耦),后者把它重写为世界-自我解耦的视频生成器。本文给出形式化、分类法、对比表、批判分析与合流前景。
world-models
embodied-ai
differentiable-physics
world-ego-disentanglement
diffusion
robotics
taxonomy
2026
research
world-models
10 true true

1. 引言

世界模型(World Model)从 2018 年 Ha & Schmidhuber 的 latent-RNN 雏形出发,在 20222024 年间被 DreamerV3、Sora、GAIA、Cosmos、JEPA 等一系列工作推向高潮。但从 2025 年开始,研究社区逐渐意识到一个尴尬事实:虽然视频质量、分辨率、时长都在指数级增长,世界模型在真正具身任务上的表现却进入了瓶颈。生成模型能"画出"一段看起来合理的未来视频,却不能在那段视频里完成稀疏奖励的强化学习、也不能在长视野的混合导航-操作任务中保持场景一致——更不用说为控制策略提供可用的解析梯度。这种"看上去越来越像、用起来越来越难"的撕裂感,是 2026 年开年的核心张力。

问题根源逐渐收敛到一个共识:当代主流的"视频预测器式"世界模型把太多东西揉在了一条流里。物理状态和像素观测被纠缠在 latent 中——所以梯度不能干净地流回策略;持久的场景规律和瞬时的机器人本体动力学也被塞进同一个生成头——所以长视野自回归会同时被场景漂移和指令噪声放大。两个问题都不是参数量能解决的:Cosmos-Predict 2.5 从 2B 扩到 14B,在长视野基准上只多了 0.58 分;DreamerV3 与各类 video predictor 在稀疏奖励控制任务上始终被卡在 ~25% 成功率。

2026 年 5 月,几乎在同一周里,两篇风格迥异但底层主张惊人一致的论文先后登陆 arXiv,构成了我们所谓的"范式重塑双子星":上海交通大学的 OrbiSimarXiv:2605.16395[^1]2026-05-12)把世界模型重新定义为端到端可微的物理引擎,主张"状态 vs 视觉"分流;CASIA 与北大、上交联合提出的 WEMarXiv:2605.19957[^2]2026-05-19)把世界模型重新定义为世界-自我双分支的视频生成器,主张"world vs ego"分流。一个把单流模型向下打回到"可微仿真器",一个把它向上抬高为"双分支生成器"——两条路从两端夹击同一个旧范式。

本综述把范围严格收敛到这两篇 2026 年 5 月同期工作上,目的是:(i) 用统一的形式化语言抽出两者的范式骨架;(ii) 建立一个用于解析后续工作的分类法;(iii) 用对比表把它们与 2024–2026 的代表性基线放在同一张坐标系下;(iv) 给出批判性评价与合流可能性的具体建议。文章组织如下:第 2 节给出符号系统与三类世界模型的数学定义;第 3 节建立分类法(解耦轴 / 可微性 / 评测载体);第 4–5 节分别深入剖析 OrbiSim 与 WEM 的核心机制;第 6 节用三张表给出 metadata / 架构 / 评测的横向对比;第 7 节是关键结果汇总与批判分析;第 8 节讨论合流前景;第 9 节展望挑战;第 10 节给出读者下一步的阅读建议。两篇论文的单篇详细解读分别在 orbisim_review.mdwem_review.md

2. 问题定义与符号表

2.1 经典世界模型

最一般的世界模型可形式化为一个由动力学 f 与观测函数 g 组成的可控动力系统:


s_{t+1} = f_\theta(s_t, a_t) + \epsilon_t, \qquad o_t = g_\phi(s_t) + \nu_t

其中 s_t 是隐状态,a_t 是动作,o_t 是观测,\epsilon_t, \nu_t 是噪声。Ha & Schmidhuber、PlaNet、Dreamer 系列都属于这一框架,区别只在 f, g 的具体实例化与训练目标。

这一通用框架下,2024–2025 年的主流路线——Sora / Cosmos / WoW / Wan2.2 / AdaWorld / Vid2World——本质上是把 fg 融合为单一的视频自回归 / 扩散生成器 $\mathcal{V}_\theta$


o_{t+1:t+H} = \mathcal{V}_\theta(o_{t-K:t}, a_{t:t+H-1}, \text{instr})

显式状态 s_t 在这一范式中消失了——所有信息都流入像素隐空间。这正是 OrbiSim 与 WEM 共同攻击的目标。

2.2 OrbiSim 的可微链

OrbiSim 把世界模型重新分裂回 f 和 $g$,但二者都用神经网络实例化并保持端到端可微:


\underbrace{x_{t+1} = \mathrm{Dynamics}_\theta(x_t, a_t, c)}_{\text{显式物理状态转移}}, \qquad
\underbrace{o_t = \mathrm{Vision}_\phi(x_t, \bar{x}, \xi_t)}_{\text{state-guided latent diffusion}}

其中 x_t 是显式物理状态(位姿、速度、关节角、点云特征),\bar{x} 是一组参考状态-观测对,\xi_t 是扩散噪声。关键性质是:策略梯度只需要 \partial x_{t+1} / \partial x_t 与 $\partial r_t / \partial x_t$,可以完全绕开 Vision 这条扩散链


\nabla_\pi J = \sum_t \frac{\partial r_t}{\partial x_t} \cdot \prod_{k < t} \frac{\partial x_{k+1}}{\partial x_k} \cdot \frac{\partial \pi(a_k|x_k)}{\partial \pi}

这就是 OrbiSim 的"解析策略梯度(Analytic Policy Gradient, APG"——它在数学上等价于经典可微物理引擎(如 DiffTaichi)上的梯度,但把可微部分从手写的解析雅可比换成了神经网络的自动微分。

2.3 WEM 的世界-自我解耦

WEM 选择不动 $g$(依然是扩散视频生成),但把隐空间 S_k 显式切成两支:


S_k = S^{w}_k \oplus S^{e}_k

其中 S^{w}_k 承载指令无关的场景持久信息(world state),S^{e}_k 承载指令条件化的机器人本体动力学(ego state)。生成目标是 flow-matching 损失加上一个掩码一致性正则:


\mathcal{L} = \mathcal{L}_{\text{FM}}\bigl(\hat{v}_\theta(S_k, \text{instr}, t), v^{*}_k\bigr) + \lambda\, \mathcal{L}_{\text{mask}}(S^{w}_k, S^{e}_k)

WEM 对这一分解给出了三种边界定义motion / semantic / intention)和三种解耦策略pre / post / full)的笛卡尔积研究,最终 (semantic, full) 组合最优。

2.4 三者并置

路线 隐变量 可微范围 控制接口
单流视频预测 (Cosmos/WoW) 单一 latent z_t 生成器内部 仅可作 rollout buffer
OrbiSim 显式物理状态 x_t + 视觉 latent 全链 (xo) 解析策略梯度 (APG)
WEM 双隐变量 S^w_k, S^e_k 生成器内部 视频质量 / 长视野指令跟随

3. 分类法(Taxonomy

为把 OrbiSim、WEM 与既有工作放进同一张坐标系,本节建立一棵围绕"范式重塑"的分类树。

graph TD
    A[世界模型 范式] --> B[1. 解耦轴]
    A --> C[2. 可微性]
    A --> D[3. 评测载体]

    B --> B1[无解耦<br/>Cosmos · WoW · Sora]
    B --> B2[状态/视觉解耦<br/><b>OrbiSim</b>]
    B --> B3[世界/自我解耦<br/><b>WEM</b>]
    B --> B4[latent/pixel 解耦<br/>JEPA 系]

    C --> C1[不可微<br/>MuJoCo · PhysX · Isaac Sim]
    C --> C2[仅生成可微<br/>Cosmos · WoW · Wan2.2 · <b>WEM</b>]
    C --> C3[完全可微<br/><b>OrbiSim</b> · DiffTaichi · NVIDIA Newton]

    D --> D1[物理控制<br/>RL 成功率 · TrajErr · APG<br/><b>OrbiSim</b> · DreamerV3]
    D --> D2[视频质量<br/>FVD · PSNR · LPIPS<br/>Sora · Cosmos · <b>WEM</b>]
    D --> D3[长视野指令跟随<br/>EWMScore · WorldArena<br/><b>WEM</b> · IRASim · Ctrl-World]

3.1 按解耦轴

  • 无解耦(单流)Cosmos-Predict、WoW、Sora、Wan2.2 等,所有信息共享一个 latent。
  • 状态/视觉解耦OrbiSim 是 2026 年代表,物理状态与像素观测分别由 Dynamics 与 Vision 子网络处理。
  • 世界/自我解耦:WEM 是 2026 年代表,场景信息与机器人本体在 token 级、注意力级、专家级三层全部分流。
  • latent/pixel 解耦JEPA 系(I-JEPA、V-JEPA、V-JEPA 2)抛弃像素重建,只在 latent 中做掩码预测。

3.2 按可微性

  • 不可微MuJoCo、PhysX、Isaac Sim、Bullet——经典物理引擎,雅可比通常不导出或受限于刚体接触。
  • 仅生成可微:扩散视频模型与 WEM 在像素层面是可微的,但策略梯度需要穿过整条 denoising 链,方差大、显存高。
  • 完全可微OrbiSim、DiffTaichi、NVIDIA Newton(解析)、Brax/JAX-MD(解析)——可直接将梯度回传给策略 / 形状 / 物理参数。

3.3 按评测载体

  • 物理控制:以 robosuite、Isaac Lab、AdaManip、Physion 为主,关注 RL 成功率、轨迹误差、可微反演——OrbiSim 的主场。
  • 视频质量:以 UCF-101、Kinetics、内部数据为主,关注 FVD、PSNR、LPIPS——Cosmos、Sora、WoW 的主场。
  • 长视野指令跟随:以 HTEWorld、WorldArena、CALVIN-long 为主,关注 EWMScore、多轮指令一致性——WEM 与 IRASim、Ctrl-World 的主场。

4. 方法详解 IOrbiSim

4.1 架构原理

OrbiSim 把世界模型拆为两个互不依赖的子模块:

  • OrbiSim-Dynamicsobject-centric Transformer + AdaLN,把每个物体作为 token,预测其在下一时刻的位姿、速度、关节角;
  • OrbiSim-Visionstate-guided latent diffusion,把当前状态 x_t 与一组参考状态-观测对 \bar{x} 作为条件,扩散出 RGB 观测 $o_t$。

资产层用三类原语统一表示:刚体(6-DoF 位姿 + 速度,Embedding 编码)、关节体(URDF + Point Transformer V3 / Sonata)、可变形体(稀疏点云)。这意味着同一份 Dynamics 网络可以承接 robosuite 推/堆、AdaManip 铰接、Physion 布料模拟,无需为每类对象单独训练 head。

4.2 训练策略

为了让自回归滚动稳定,OrbiSim 采用两阶段课程:

  1. Teacher Forcing:以 ground-truth x_t 喂入;
  2. Cosine-Annealed AR Rollout:用余弦曲线将 ground-truth 概率从 1.0 退火到 0.0,逐步切换到自回归。

视觉端引入 Context Frame Sparsification——训练时随机稀疏参考帧数量,使推理时 1–8 帧条件下均稳定。

Real-to-Sim 通路有两条:StaInf(单帧 RGB → 可见状态)与 PhyInf(64 帧视频 → 隐藏物理参数)。后者把 Dynamics 当作可微前向,用梯度反演 mass、friction 等隐藏参数——这是经典仿真器只能"前向 + 网格搜索"完成的事情。

4.3 关键 Ablation

  • 去掉状态-视觉解耦(让策略梯度穿过扩散链):APG 训练发散,成功率跌回 BC 水平(~20%);
  • 去掉 cosine AR(纯 teacher forcing):PSNR100 下降约 2 dB,长视野 FVD 翻倍;
  • 去掉 Object-Centric Transformer(换 token-mixed Transformer):多物体接触建模失效,TrajErr 翻 1.8×。

三个 ablation 共同指出:OrbiSim 的性能并非源于参数堆叠,而是源于显式物理状态 + 可微通路 + 物体中心化表示的协同

5. 方法详解 IIWEM

5.1 架构原理

WEM 由两段构成:

  • 冻结的 Qwen3-VL-2B 规划器 + Role-Conditioned Attention (RCA) + 不对称 query 预算(192 world / 64 ego——输出 256 个 condition token,自带 world / ego 角色标签。
  • CP-MoE DiT 生成器(基于 Wan2.2-TI2V-5B):24 个共享 block → semantic head 路由 → world 专家 6 block / ego 专家 6 block 并行 → unrouting → flow-matching head。

其中 Asymmetric Query Budget 的设计直觉是:场景信息丰富但变化慢,分配 192 token;机器人本体信息少但密集,分配 64 token。Neighbor-Expanded Routing 把 hard top-1 路由改为带空间邻居的软路由,避免边界处的语义切割伪影。

5.2 训练策略

16× A100 80GBlr = 1e-5EMA 0.994 epochs480×480 @ 16 FPS35 diffusion steps37 frames / chunk。数据基于 BEHAVIOR-1K 构建:125K 训练片段(>4.5M 帧)。HTEWorld 评测集另含 300 条多轮轨迹(>2K 指令)。

5.3 关键 Ablation

移除组件 EWMScore
完整 WEM 61.48
Asymmetric Query Budget 60.50
Role-Conditioned Attention 60.64
Neighbor-Expanded Routing 59.57
无解耦(PAN-style baseline 58.40

三个组件分别贡献 ~1 分,叠加恰好恢复至 baseline。Design Study I(边界选择)显示 Semantic 61.48 > Motion 59.36 > Intention 58.69Design Study II(解耦时机)显示 Full 61.48 > Post 61.09 > Pre 58.85 > None 58.40。

6. 横向对比表

6.1 表 1:两篇论文 Metadata 对比

维度 OrbiSim[^1] WEM[^2]
arXiv 2605.16395v1 2605.19957v1
上线日期 2026-05-12 2026-05-19
主题分类 cs.RO cs.CV
主要机构 上海交大 MoE Key Lab / NeoWorld CASIA / 国科大 / 中关村学院 / 上交 / 北大
通讯作者 Yunbo Wang Xingyu Chen
模型规模 未明示(Dynamics 小,Vision 中等) ~5BWan2.2-TI2V-5B 主干 + CP-MoE
开源现状 论文未提供 HF / 项目页 Zoorao/WEM · Zoorao/HTEWorld · 项目页
是否新基准 否(沿用 robosuite / Isaac Lab / AdaManip / Physion (HTEWorld,首个混合导航-操作长视野基准)
显式可微 (端到端) 仅生成器内部
解耦轴 状态 vs 视觉 世界 vs 自我

6.2 表 2:架构对比

维度 OrbiSim WEM
解耦轴 物理状态 x_t vs 像素观测 o_t world token S^w_k vs ego token S^e_k
状态表示 显式物理量(位姿/速度/关节角/点云) 隐式 latent token192 + 64
动力学骨干 Object-centric Transformer + AdaLN Qwen3-VL-2B (frozen) + RCA
生成骨干 State-guided latent diffusion CP-MoE DiT24 shared + 2×6 experton Wan2.2-TI2V-5B
输出形式 物理状态轨迹 + RGB 观测 RGB 视频(37 帧/chunk @ 16 FPS
可微性 完全可微(含 APG 仅扩散内部可微
训练课程 TF → cosine-annealed AR flow-matching + mask 正则
资产支持 刚体 / 关节体 / 可变形体 取决于 BEHAVIOR-1K 资产
Real-to-Sim StaInf + PhyInf(梯度反演)

6.3 表 3:评测对比

维度 OrbiSim WEM
主基准 robosuite Push、Isaac Lab Stack、AdaManip Articulated、Physion Drape HTEWorld(自建)+ WorldArena
关键指标 PSNR100 / LPIPS100 / FVD / TrajErr / RL Success Rate / steps/s EWMScoreRCBD/LPSA/CISR/PMPA/CPDM/FPHS 加权)
代表数字 RL Success 42.71%vs DreamerV3 25.00%);TrajErr 0.446829.41 steps/s @ 372 MB EWMScore 61.48vs Cosmos-Predict 2.5-14B 55.41PAN-style 58.40
OOD 表现 FVD 597.3vs AdaWorld 1288.5 未单独评测 OOD 物体
跨基准能力 4 个仿真基准均覆盖 HTEWorld + WorldArena 双基准
主要基线 Vid2World、AdaWorld、SAC、PPO、PPO+RND、BC、DreamerV3、NVIDIA Newton WoW-7B、Cosmos-Predict 2.5 (2B/14B)、PAN-style 5B、Wan2.2、CogVideoX、IRASim、Ctrl-World
评测对象 机器人策略 + 视频生成器 视频生成器(长视野多指令)

7. 关键结果汇总与批判分析

7.1 把数字摆在一起

  • OrbiSim 的"4 个 4 字"TrajErr 0.4468、RL Success 42.71%、29.41 steps/s、OOD FVD 597.3——前两个把可微物理引擎的"控制可用性"立住,第三个把工程效率立住,第四个把 OOD 立住。
  • WEM 的"61 分故事"EWMScore 61.485B)压过 Cosmos-Predict 2.5-14B 的 55.4114B)近 6 分,是 2026 年最干净的"结构胜过规模"案例。

7.2 各自的核心 Trade-off

维度 OrbiSim 的取舍 WEM 的取舍
可微性 ↑ 通过显式物理状态 + 解耦 vision,获得 APG 不显式追求;策略闭环留给下游
视频质量 服务于状态一致性,PSNR100 19.98 / FVD 533.9 已够用 优先目标,长视野 EWMScore 61.48
长视野能力 100 步 rollout TrajErr 0.4468,但只测单任务 跨多轮指令 + 跨阶段,但 chunk 间漂移仍存
模型规模 小(Dynamics + 中等 Vision 5B 全量
数据成本 仿真采样可控,无人工分割标注 依赖 BEHAVIOR-1K 实例分割掩码
资产泛化 三类原语统一刚体/关节/可变形 受限于训练资产覆盖
工程吞吐 29.41 steps/s @ 372 MB 16× A100 + 35 diffusion steps,实时不可用

一句话:OrbiSim 选择了"控制可用性 + 工程效率"WEM 选择了"视频质量 + 长视野指令跟随"——它们在 Pareto 前沿的不同象限。

7.3 共同盲点

盲点 OrbiSim WEM
Sim-to-Real 未验证 未验证
跨形态泛化(双足/灵巧手/移动操作) 仅机械臂 部分覆盖(BEHAVIOR-1K 含移动机器人)
真实视频训练 未涉及 未涉及
长视野自回归漂移 cosine AR 缓解但未根治 chunk 间漂移仍存(LPSA 指标可见)
通用基准缺位 无 sim-to-real 评测协议 HTEWorld 自家发布,待外部验证
物理参数反演 PhyInf 仅在受控背景 未提供

两个最关键的共同盲点:

  1. 都不出仿真:所有评测都在仿真器内进行。这意味着 2026.05 的范式重塑虽然完成了"理论上更对"的结构升级,但在真实机器人侧的可用性还需要至少一个时间窗的验证;
  2. 都没有公开统一基准:OrbiSim 在四个分散基准上自评,WEM 自建 HTEWorld,两者结果不可直接对照。Section 9 会展开建议。

7.4 范式合流的可能性

把表 2 并排看,会发现 OrbiSim 与 WEM 的解耦轴几乎是正交的

                  状态维度
                     ↑
                 显式 x_t
                     |
       OrbiSim ─────┼───── 合流目标
                     |
                 latent z
                     |─────────→ 解耦轴
                                  world / ego
                                     ↑
                                    WEM

一个直观的合流方案是把 OrbiSim 的 Vision 模块替换为 WEM 的 CP-MoE DiT

  • Dynamics 端继承 OrbiSim:显式物理状态 x_t + APG 支持下游 RL
  • Vision 端继承 WEM:把 x_t 同时解耦为 $x_t^w$(场景物体状态)与 $x_t^e$(机器人本体状态),分别条件化 world / ego 专家,让长视野多轮指令生成不再退化;
  • 统一损失$\mathcal{L} = \mathcal{L}{\text{dyn}} + \mathcal{L}{\text{FM}} + \lambda_1 \mathcal{L}{\text{mask}} + \lambda_2 \mathcal{L}{\text{APG}}$。

这种"OrbiSim-Dynamics × WEM-Vision"组合在理论上能同时拿到:可微策略梯度、长视野场景一致性、跨多轮指令鲁棒性。工程上,它的最大障碍是数据——既要有物理状态级标签(OrbiSim 训练范式),又要有 world/ego 分割掩码(WEM 训练范式)。BEHAVIOR-1K 是少数同时满足两者的数据源,故合流的最快路径很可能也起于 BEHAVIOR-1K。

8. 挑战与未来方向

8.1 Sim-to-Real

两篇论文的最大空缺。可行路径:

  • OrbiSim 路径:复用 PhyInf 的梯度反演思路,在真实 RGB-D 视频上反推物理参数,把仿真器逐步"贴近"真实;同时用域随机化训练 Vision 模块,缓解光照-纹理 gap。
  • WEM 路径:在真实示教视频上做无监督的 world/ego 分割(如用 SAM 系列 + 时序一致性),把对显式分割掩码的依赖剥离。

8.2 跨形态与跨场景泛化

OrbiSim 的 object-centric Transformer 已经天然支持任意物体数量,但机器人本体形态泛化(机械臂 → 双足 → 灵巧手)尚未验证;WEM 的 ego 分支默认指机器人本体,但单一 ego latent 难以承载灵巧手 21-DoF 这种高维状态。未来可考虑:

  • 对 ego latent 做分层base / arm / hand);
  • 在训练数据里混合多形态机器人,看 ego 专家是否能自发分化。

8.3 长视野自回归漂移

OrbiSim 的 cosine AR 与 WEM 的 chunk 化生成都缓解但未根治漂移。可探索方向:

  • 引入显式 keyframe 锚定(类似视频压缩里的 I-frame),定期用 ground-truth 状态/帧重置;
  • 借鉴 Hierarchical World Model 思路,在更高时间粒度建立"事件级"动力学。

8.4 统一基准

OrbiSim 与 WEM 之所以难以直接比较,是因为前者优化"控制可用性"指标、后者优化"视频质量 + 多轮指令"指标。建议社区构建一个双视角混合基准

  • 任务集来自 BEHAVIOR-1K / HTEWorld,保证多轮长视野;
  • 指标同时包含 EWMScore(视频质量侧)与 RL Success / TrajErr(控制侧);
  • 提供统一的 sim-to-real 验证桥(如真实 Aloha 机器人执行同一指令)。

8.5 可微性的工程化

OrbiSim 的 APG 在仿真里跑得通,但要进入工业管线,仍缺少:

  • 可微接触模型与刚体引擎的对齐验证;
  • 与 Isaac Sim / Newton 现有渲染、传感器栈的接口;
  • 多 GPU 训练 + 模型并行下的梯度数值稳定性测试。

9. 结论:哪条路线更具前景

如果只能下一个赌注,本综述给出的判断如下:

  • 短期(612 个月)WEM 路线更易出 demo——视频生成端的工具链最成熟,HTEWorld 与开源模型已经把门槛压到了"5B 模型 + 1 张分割掩码",社区会涌现一批 world/ego 解耦的变体。
  • 中期(12 年)OrbiSim 路线的潜在天花板更高——一旦把可微物理引擎与真实机器人闭环打通,它会重新定义"机器人仿真器"这一品类的入口,比"更好看的视频"价值高一个数量级。
  • 长期(2 年以上)二者合流几乎是必然——一个不可微的世界模型无法服务策略学习,一个不能解耦世界/自我的世界模型无法服务长视野任务。预计 2027 年前后会出现首批同时具备 APG 接口与 world-ego 解耦的统一架构。

9.1 给读者的下一步阅读建议

  1. 想做物理/控制方向研究:先把 OrbiSim 论文与本仓库的 orbisim_review.md 一起读,然后回到 DreamerV3、DiffTaichi、NVIDIA Newton 的源码理解可微物理的工程实现;
  2. 想做生成/视频方向研究:先看 wem_review.md、HTEWorld 数据集、Cosmos-Predict 2.5 与 Wan2.2-TI2V 的对比,再回到 IRASim / Ctrl-World 评估长视野生成;
  3. 想做范式融合研究:直接以本节 §7.4 描绘的"OrbiSim-Dynamics × WEM-Vision"作为出发点,关注 BEHAVIOR-1K 的同时标注可行性;
  4. 关心本仓库其他世界模型综述:参见 world_models_review.mdworld_models_arxiv_2025_survey.mdphysics_world_models_review.mdlyra2_review.mdjepa/index.md,本节相当于它们在 2026.05 时间点的专题切片。

10. 参考文献

[1] OrbiSim: World Models as Differentiable Physics Engines for Embodied Intelligence (2026). Jiajian Li, Jingyuan Huang, Junru Gong, Qi Wang, Xiaokang Yang, Yunbo Wang. arXiv:2605.16395. [PDF]

[2] World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks (2026). Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Xingyu Chen. arXiv:2605.19957. [PDF] · 项目页 · HF 模型 · HF 数据集

[3] Mastering Diverse Domains through World Models (DreamerV3) (2023). Danijar Hafner, Jurgis Pasukonis, Jimmy Ba, Timothy Lillicrap. arXiv:2301.04104.

[4] World Models (2018). David Ha, Jürgen Schmidhuber. arXiv:1803.10122.

[5] Cosmos-Predict 2.5 (2025). NVIDIA. 大规模视频世界模型,作为 WEM 主要基线之一。

[6] WoW: World-on-World Generative Model (2025). 7B 视频世界模型基线。

[7] AdaWorld: Adaptive World Models for Robotic Manipulation (2025). OrbiSim 的主要预测保真度基线。

[8] Vid2World: Video-to-World Generative Models (2025). OrbiSim 的主要视频预测基线。

[9] I-JEPA / V-JEPA / V-JEPA 2 (20232024). Yann LeCun et al. Latent-only 预测范式的代表,与本文 §3.1 的 latent/pixel 解耦轴对应。详见 jepa/index.md

[10] IRASim (2025). 长视野指令跟随基准 WorldArena 的代表方法。

[11] Ctrl-World (2025). 同上。

[12] Wan2.2-TI2V (2025). WEM 的视频生成主干。

[13] Qwen3-VL (2025). Alibaba. WEM 的冻结规划器。

[14] BEHAVIOR-1K: A Benchmark for Embodied AI with 1,000 Everyday Activities (2023). HTEWorld 数据构建的底层资产源。

[15] robosuite: A Modular Simulation Framework and Benchmark for Robot Learning (2020). Yuke Zhu et al. OrbiSim Push / Stack 任务的基础环境。

[16] Isaac Lab / NVIDIA Newton (20242026). 经典 / 可微物理仿真器,OrbiSim 的对照参照系。

[17] Physion: Evaluating Physical Prediction from Vision in Humans and Machines (2021). OrbiSim 可变形物体(Drape)任务的来源。

[18] AdaManip (2024). OrbiSim 关节物体(Articulated)任务的来源。

[19] DiffTaichi: Differentiable Programming for Physical Simulation (2020). Yuanming Hu et al. 经典可微物理的代表。

[20] PAN-style baselines (2025). WEM 的"无解耦同规模 5B"对照组。