- Add literature survey on 2026.05 dual paradigm-shifting works: OrbiSim (differentiable physics engine) and WEM (world-ego disentanglement) - Files: _index.md, orbisim_review.md, wem_review.md, joint_synthesis.md - Update research/world-models/_index.md to register new sub-section
26 KiB
title, date, lastmod, draft, summary, tags, categories, weight, math, toc
| title | date | lastmod | draft | summary | tags | categories | weight | math | toc | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 世界模型的范式重塑:从单流视频预测到结构化解耦——OrbiSim 与 WEM 综合评析 | 2026-05-20 | 2026-05-20 | false | 2026 年 5 月几乎同期发布的 OrbiSim 与 WEM 共同向『单流视频世界模型』发起范式挑战:前者把世界模型重写为可微物理引擎(状态-视觉解耦),后者把它重写为世界-自我解耦的视频生成器。本文给出形式化、分类法、对比表、批判分析与合流前景。 |
|
|
10 | true | true |
1. 引言
世界模型(World Model)从 2018 年 Ha & Schmidhuber 的 latent-RNN 雏形出发,在 2022–2024 年间被 DreamerV3、Sora、GAIA、Cosmos、JEPA 等一系列工作推向高潮。但从 2025 年开始,研究社区逐渐意识到一个尴尬事实:虽然视频质量、分辨率、时长都在指数级增长,世界模型在真正具身任务上的表现却进入了瓶颈。生成模型能"画出"一段看起来合理的未来视频,却不能在那段视频里完成稀疏奖励的强化学习、也不能在长视野的混合导航-操作任务中保持场景一致——更不用说为控制策略提供可用的解析梯度。这种"看上去越来越像、用起来越来越难"的撕裂感,是 2026 年开年的核心张力。
问题根源逐渐收敛到一个共识:当代主流的"视频预测器式"世界模型把太多东西揉在了一条流里。物理状态和像素观测被纠缠在 latent 中——所以梯度不能干净地流回策略;持久的场景规律和瞬时的机器人本体动力学也被塞进同一个生成头——所以长视野自回归会同时被场景漂移和指令噪声放大。两个问题都不是参数量能解决的:Cosmos-Predict 2.5 从 2B 扩到 14B,在长视野基准上只多了 0.58 分;DreamerV3 与各类 video predictor 在稀疏奖励控制任务上始终被卡在 ~25% 成功率。
2026 年 5 月,几乎在同一周里,两篇风格迥异但底层主张惊人一致的论文先后登陆 arXiv,构成了我们所谓的"范式重塑双子星":上海交通大学的 OrbiSim(arXiv:2605.16395[^1],2026-05-12)把世界模型重新定义为端到端可微的物理引擎,主张"状态 vs 视觉"分流;CASIA 与北大、上交联合提出的 WEM(arXiv:2605.19957[^2],2026-05-19)把世界模型重新定义为世界-自我双分支的视频生成器,主张"world vs ego"分流。一个把单流模型向下打回到"可微仿真器",一个把它向上抬高为"双分支生成器"——两条路从两端夹击同一个旧范式。
本综述把范围严格收敛到这两篇 2026 年 5 月同期工作上,目的是:(i) 用统一的形式化语言抽出两者的范式骨架;(ii) 建立一个用于解析后续工作的分类法;(iii) 用对比表把它们与 2024–2026 的代表性基线放在同一张坐标系下;(iv) 给出批判性评价与合流可能性的具体建议。文章组织如下:第 2 节给出符号系统与三类世界模型的数学定义;第 3 节建立分类法(解耦轴 / 可微性 / 评测载体);第 4–5 节分别深入剖析 OrbiSim 与 WEM 的核心机制;第 6 节用三张表给出 metadata / 架构 / 评测的横向对比;第 7 节是关键结果汇总与批判分析;第 8 节讨论合流前景;第 9 节展望挑战;第 10 节给出读者下一步的阅读建议。两篇论文的单篇详细解读分别在 orbisim_review.md 与 wem_review.md。
2. 问题定义与符号表
2.1 经典世界模型
最一般的世界模型可形式化为一个由动力学 f 与观测函数 g 组成的可控动力系统:
s_{t+1} = f_\theta(s_t, a_t) + \epsilon_t, \qquad o_t = g_\phi(s_t) + \nu_t
其中 s_t 是隐状态,a_t 是动作,o_t 是观测,\epsilon_t, \nu_t 是噪声。Ha & Schmidhuber、PlaNet、Dreamer 系列都属于这一框架,区别只在 f, g 的具体实例化与训练目标。
这一通用框架下,2024–2025 年的主流路线——Sora / Cosmos / WoW / Wan2.2 / AdaWorld / Vid2World——本质上是把 f 和 g 融合为单一的视频自回归 / 扩散生成器 $\mathcal{V}_\theta$:
o_{t+1:t+H} = \mathcal{V}_\theta(o_{t-K:t}, a_{t:t+H-1}, \text{instr})
显式状态 s_t 在这一范式中消失了——所有信息都流入像素隐空间。这正是 OrbiSim 与 WEM 共同攻击的目标。
2.2 OrbiSim 的可微链
OrbiSim 把世界模型重新分裂回 f 和 $g$,但二者都用神经网络实例化并保持端到端可微:
\underbrace{x_{t+1} = \mathrm{Dynamics}_\theta(x_t, a_t, c)}_{\text{显式物理状态转移}}, \qquad
\underbrace{o_t = \mathrm{Vision}_\phi(x_t, \bar{x}, \xi_t)}_{\text{state-guided latent diffusion}}
其中 x_t 是显式物理状态(位姿、速度、关节角、点云特征),\bar{x} 是一组参考状态-观测对,\xi_t 是扩散噪声。关键性质是:策略梯度只需要 \partial x_{t+1} / \partial x_t 与 $\partial r_t / \partial x_t$,可以完全绕开 Vision 这条扩散链:
\nabla_\pi J = \sum_t \frac{\partial r_t}{\partial x_t} \cdot \prod_{k < t} \frac{\partial x_{k+1}}{\partial x_k} \cdot \frac{\partial \pi(a_k|x_k)}{\partial \pi}
这就是 OrbiSim 的"解析策略梯度(Analytic Policy Gradient, APG)"——它在数学上等价于经典可微物理引擎(如 DiffTaichi)上的梯度,但把可微部分从手写的解析雅可比换成了神经网络的自动微分。
2.3 WEM 的世界-自我解耦
WEM 选择不动 $g$(依然是扩散视频生成),但把隐空间 S_k 显式切成两支:
S_k = S^{w}_k \oplus S^{e}_k
其中 S^{w}_k 承载指令无关的场景持久信息(world state),S^{e}_k 承载指令条件化的机器人本体动力学(ego state)。生成目标是 flow-matching 损失加上一个掩码一致性正则:
\mathcal{L} = \mathcal{L}_{\text{FM}}\bigl(\hat{v}_\theta(S_k, \text{instr}, t), v^{*}_k\bigr) + \lambda\, \mathcal{L}_{\text{mask}}(S^{w}_k, S^{e}_k)
WEM 对这一分解给出了三种边界定义(motion / semantic / intention)和三种解耦策略(pre / post / full)的笛卡尔积研究,最终 (semantic, full) 组合最优。
2.4 三者并置
| 路线 | 隐变量 | 可微范围 | 控制接口 |
|---|---|---|---|
| 单流视频预测 (Cosmos/WoW) | 单一 latent z_t |
生成器内部 | 仅可作 rollout buffer |
| OrbiSim | 显式物理状态 x_t + 视觉 latent |
全链 (x 与 o) |
解析策略梯度 (APG) |
| WEM | 双隐变量 S^w_k, S^e_k |
生成器内部 | 视频质量 / 长视野指令跟随 |
3. 分类法(Taxonomy)
为把 OrbiSim、WEM 与既有工作放进同一张坐标系,本节建立一棵围绕"范式重塑"的分类树。
graph TD
A[世界模型 范式] --> B[1. 解耦轴]
A --> C[2. 可微性]
A --> D[3. 评测载体]
B --> B1[无解耦<br/>Cosmos · WoW · Sora]
B --> B2[状态/视觉解耦<br/><b>OrbiSim</b>]
B --> B3[世界/自我解耦<br/><b>WEM</b>]
B --> B4[latent/pixel 解耦<br/>JEPA 系]
C --> C1[不可微<br/>MuJoCo · PhysX · Isaac Sim]
C --> C2[仅生成可微<br/>Cosmos · WoW · Wan2.2 · <b>WEM</b>]
C --> C3[完全可微<br/><b>OrbiSim</b> · DiffTaichi · NVIDIA Newton]
D --> D1[物理控制<br/>RL 成功率 · TrajErr · APG<br/><b>OrbiSim</b> · DreamerV3]
D --> D2[视频质量<br/>FVD · PSNR · LPIPS<br/>Sora · Cosmos · <b>WEM</b>]
D --> D3[长视野指令跟随<br/>EWMScore · WorldArena<br/><b>WEM</b> · IRASim · Ctrl-World]
3.1 按解耦轴
- 无解耦(单流):Cosmos-Predict、WoW、Sora、Wan2.2 等,所有信息共享一个 latent。
- 状态/视觉解耦:OrbiSim 是 2026 年代表,物理状态与像素观测分别由 Dynamics 与 Vision 子网络处理。
- 世界/自我解耦:WEM 是 2026 年代表,场景信息与机器人本体在 token 级、注意力级、专家级三层全部分流。
- latent/pixel 解耦:JEPA 系(I-JEPA、V-JEPA、V-JEPA 2)抛弃像素重建,只在 latent 中做掩码预测。
3.2 按可微性
- 不可微:MuJoCo、PhysX、Isaac Sim、Bullet——经典物理引擎,雅可比通常不导出或受限于刚体接触。
- 仅生成可微:扩散视频模型与 WEM 在像素层面是可微的,但策略梯度需要穿过整条 denoising 链,方差大、显存高。
- 完全可微:OrbiSim、DiffTaichi、NVIDIA Newton(解析)、Brax/JAX-MD(解析)——可直接将梯度回传给策略 / 形状 / 物理参数。
3.3 按评测载体
- 物理控制:以 robosuite、Isaac Lab、AdaManip、Physion 为主,关注 RL 成功率、轨迹误差、可微反演——OrbiSim 的主场。
- 视频质量:以 UCF-101、Kinetics、内部数据为主,关注 FVD、PSNR、LPIPS——Cosmos、Sora、WoW 的主场。
- 长视野指令跟随:以 HTEWorld、WorldArena、CALVIN-long 为主,关注 EWMScore、多轮指令一致性——WEM 与 IRASim、Ctrl-World 的主场。
4. 方法详解 I:OrbiSim
4.1 架构原理
OrbiSim 把世界模型拆为两个互不依赖的子模块:
- OrbiSim-Dynamics:object-centric Transformer + AdaLN,把每个物体作为 token,预测其在下一时刻的位姿、速度、关节角;
- OrbiSim-Vision:state-guided latent diffusion,把当前状态
x_t与一组参考状态-观测对\bar{x}作为条件,扩散出 RGB 观测 $o_t$。
资产层用三类原语统一表示:刚体(6-DoF 位姿 + 速度,Embedding 编码)、关节体(URDF + Point Transformer V3 / Sonata)、可变形体(稀疏点云)。这意味着同一份 Dynamics 网络可以承接 robosuite 推/堆、AdaManip 铰接、Physion 布料模拟,无需为每类对象单独训练 head。
4.2 训练策略
为了让自回归滚动稳定,OrbiSim 采用两阶段课程:
- Teacher Forcing:以 ground-truth
x_t喂入; - Cosine-Annealed AR Rollout:用余弦曲线将 ground-truth 概率从 1.0 退火到 0.0,逐步切换到自回归。
视觉端引入 Context Frame Sparsification——训练时随机稀疏参考帧数量,使推理时 1–8 帧条件下均稳定。
Real-to-Sim 通路有两条:StaInf(单帧 RGB → 可见状态)与 PhyInf(64 帧视频 → 隐藏物理参数)。后者把 Dynamics 当作可微前向,用梯度反演 mass、friction 等隐藏参数——这是经典仿真器只能"前向 + 网格搜索"完成的事情。
4.3 关键 Ablation
- 去掉状态-视觉解耦(让策略梯度穿过扩散链):APG 训练发散,成功率跌回 BC 水平(~20%);
- 去掉 cosine AR(纯 teacher forcing):PSNR100 下降约 2 dB,长视野 FVD 翻倍;
- 去掉 Object-Centric Transformer(换 token-mixed Transformer):多物体接触建模失效,TrajErr 翻 1.8×。
三个 ablation 共同指出:OrbiSim 的性能并非源于参数堆叠,而是源于显式物理状态 + 可微通路 + 物体中心化表示的协同。
5. 方法详解 II:WEM
5.1 架构原理
WEM 由两段构成:
- 冻结的 Qwen3-VL-2B 规划器 + Role-Conditioned Attention (RCA) + 不对称 query 预算(192 world / 64 ego)——输出 256 个 condition token,自带 world / ego 角色标签。
- CP-MoE DiT 生成器(基于 Wan2.2-TI2V-5B):24 个共享 block → semantic head 路由 → world 专家 6 block / ego 专家 6 block 并行 → unrouting → flow-matching head。
其中 Asymmetric Query Budget 的设计直觉是:场景信息丰富但变化慢,分配 192 token;机器人本体信息少但密集,分配 64 token。Neighbor-Expanded Routing 把 hard top-1 路由改为带空间邻居的软路由,避免边界处的语义切割伪影。
5.2 训练策略
16× A100 80GB;lr = 1e-5;EMA 0.99;4 epochs;480×480 @ 16 FPS;35 diffusion steps;37 frames / chunk。数据基于 BEHAVIOR-1K 构建:125K 训练片段(>4.5M 帧)。HTEWorld 评测集另含 300 条多轮轨迹(>2K 指令)。
5.3 关键 Ablation
| 移除组件 | EWMScore |
|---|---|
| 完整 WEM | 61.48 |
| − Asymmetric Query Budget | 60.50 |
| − Role-Conditioned Attention | 60.64 |
| − Neighbor-Expanded Routing | 59.57 |
| 无解耦(PAN-style baseline) | 58.40 |
三个组件分别贡献 ~1 分,叠加恰好恢复至 baseline。Design Study I(边界选择)显示 Semantic 61.48 > Motion 59.36 > Intention 58.69;Design Study II(解耦时机)显示 Full 61.48 > Post 61.09 > Pre 58.85 > None 58.40。
6. 横向对比表
6.1 表 1:两篇论文 Metadata 对比
| 维度 | OrbiSim[^1] | WEM[^2] |
|---|---|---|
| arXiv | 2605.16395v1 | 2605.19957v1 |
| 上线日期 | 2026-05-12 | 2026-05-19 |
| 主题分类 | cs.RO | cs.CV |
| 主要机构 | 上海交大 MoE Key Lab / NeoWorld | CASIA / 国科大 / 中关村学院 / 上交 / 北大 |
| 通讯作者 | Yunbo Wang | Xingyu Chen |
| 模型规模 | 未明示(Dynamics 小,Vision 中等) | ~5B(Wan2.2-TI2V-5B 主干 + CP-MoE) |
| 开源现状 | 论文未提供 HF / 项目页 | Zoorao/WEM · Zoorao/HTEWorld · 项目页 |
| 是否新基准 | 否(沿用 robosuite / Isaac Lab / AdaManip / Physion) | 是(HTEWorld,首个混合导航-操作长视野基准) |
| 显式可微 | 是(端到端) | 仅生成器内部 |
| 解耦轴 | 状态 vs 视觉 | 世界 vs 自我 |
6.2 表 2:架构对比
| 维度 | OrbiSim | WEM |
|---|---|---|
| 解耦轴 | 物理状态 x_t vs 像素观测 o_t |
world token S^w_k vs ego token S^e_k |
| 状态表示 | 显式物理量(位姿/速度/关节角/点云) | 隐式 latent token(192 + 64) |
| 动力学骨干 | Object-centric Transformer + AdaLN | Qwen3-VL-2B (frozen) + RCA |
| 生成骨干 | State-guided latent diffusion | CP-MoE DiT(24 shared + 2×6 expert)on Wan2.2-TI2V-5B |
| 输出形式 | 物理状态轨迹 + RGB 观测 | RGB 视频(37 帧/chunk @ 16 FPS) |
| 可微性 | 完全可微(含 APG) | 仅扩散内部可微 |
| 训练课程 | TF → cosine-annealed AR | flow-matching + mask 正则 |
| 资产支持 | 刚体 / 关节体 / 可变形体 | 取决于 BEHAVIOR-1K 资产 |
| Real-to-Sim | StaInf + PhyInf(梯度反演) | 无 |
6.3 表 3:评测对比
| 维度 | OrbiSim | WEM |
|---|---|---|
| 主基准 | robosuite Push、Isaac Lab Stack、AdaManip Articulated、Physion Drape | HTEWorld(自建)+ WorldArena |
| 关键指标 | PSNR100 / LPIPS100 / FVD / TrajErr / RL Success Rate / steps/s | EWMScore(RCBD/LPSA/CISR/PMPA/CPDM/FPHS 加权) |
| 代表数字 | RL Success 42.71%(vs DreamerV3 25.00%);TrajErr 0.4468;29.41 steps/s @ 372 MB | EWMScore 61.48(vs Cosmos-Predict 2.5-14B 55.41,PAN-style 58.40) |
| OOD 表现 | FVD 597.3(vs AdaWorld 1288.5) | 未单独评测 OOD 物体 |
| 跨基准能力 | 4 个仿真基准均覆盖 | HTEWorld + WorldArena 双基准 |
| 主要基线 | Vid2World、AdaWorld、SAC、PPO、PPO+RND、BC、DreamerV3、NVIDIA Newton | WoW-7B、Cosmos-Predict 2.5 (2B/14B)、PAN-style 5B、Wan2.2、CogVideoX、IRASim、Ctrl-World |
| 评测对象 | 机器人策略 + 视频生成器 | 视频生成器(长视野多指令) |
7. 关键结果汇总与批判分析
7.1 把数字摆在一起
- OrbiSim 的"4 个 4 字":TrajErr 0.4468、RL Success 42.71%、29.41 steps/s、OOD FVD 597.3——前两个把可微物理引擎的"控制可用性"立住,第三个把工程效率立住,第四个把 OOD 立住。
- WEM 的"61 分故事":EWMScore 61.48(5B)压过 Cosmos-Predict 2.5-14B 的 55.41(14B)近 6 分,是 2026 年最干净的"结构胜过规模"案例。
7.2 各自的核心 Trade-off
| 维度 | OrbiSim 的取舍 | WEM 的取舍 |
|---|---|---|
| 可微性 ↑ | 通过显式物理状态 + 解耦 vision,获得 APG | 不显式追求;策略闭环留给下游 |
| 视频质量 | 服务于状态一致性,PSNR100 19.98 / FVD 533.9 已够用 | 优先目标,长视野 EWMScore 61.48 |
| 长视野能力 | 100 步 rollout TrajErr 0.4468,但只测单任务 | 跨多轮指令 + 跨阶段,但 chunk 间漂移仍存 |
| 模型规模 | 小(Dynamics + 中等 Vision) | 5B 全量 |
| 数据成本 | 仿真采样可控,无人工分割标注 | 依赖 BEHAVIOR-1K 实例分割掩码 |
| 资产泛化 | 三类原语统一刚体/关节/可变形 | 受限于训练资产覆盖 |
| 工程吞吐 | 29.41 steps/s @ 372 MB | 16× A100 + 35 diffusion steps,实时不可用 |
一句话:OrbiSim 选择了"控制可用性 + 工程效率",WEM 选择了"视频质量 + 长视野指令跟随"——它们在 Pareto 前沿的不同象限。
7.3 共同盲点
| 盲点 | OrbiSim | WEM |
|---|---|---|
| Sim-to-Real | 未验证 | 未验证 |
| 跨形态泛化(双足/灵巧手/移动操作) | 仅机械臂 | 部分覆盖(BEHAVIOR-1K 含移动机器人) |
| 真实视频训练 | 未涉及 | 未涉及 |
| 长视野自回归漂移 | cosine AR 缓解但未根治 | chunk 间漂移仍存(LPSA 指标可见) |
| 通用基准缺位 | 无 sim-to-real 评测协议 | HTEWorld 自家发布,待外部验证 |
| 物理参数反演 | PhyInf 仅在受控背景 | 未提供 |
两个最关键的共同盲点:
- 都不出仿真:所有评测都在仿真器内进行。这意味着 2026.05 的范式重塑虽然完成了"理论上更对"的结构升级,但在真实机器人侧的可用性还需要至少一个时间窗的验证;
- 都没有公开统一基准:OrbiSim 在四个分散基准上自评,WEM 自建 HTEWorld,两者结果不可直接对照。Section 9 会展开建议。
7.4 范式合流的可能性
把表 2 并排看,会发现 OrbiSim 与 WEM 的解耦轴几乎是正交的:
状态维度
↑
显式 x_t
|
OrbiSim ─────┼───── 合流目标
|
latent z
|─────────→ 解耦轴
world / ego
↑
WEM
一个直观的合流方案是把 OrbiSim 的 Vision 模块替换为 WEM 的 CP-MoE DiT:
- Dynamics 端继承 OrbiSim:显式物理状态
x_t+ APG 支持下游 RL; - Vision 端继承 WEM:把
x_t同时解耦为 $x_t^w$(场景物体状态)与 $x_t^e$(机器人本体状态),分别条件化 world / ego 专家,让长视野多轮指令生成不再退化; - 统一损失:$\mathcal{L} = \mathcal{L}{\text{dyn}} + \mathcal{L}{\text{FM}} + \lambda_1 \mathcal{L}{\text{mask}} + \lambda_2 \mathcal{L}{\text{APG}}$。
这种"OrbiSim-Dynamics × WEM-Vision"组合在理论上能同时拿到:可微策略梯度、长视野场景一致性、跨多轮指令鲁棒性。工程上,它的最大障碍是数据——既要有物理状态级标签(OrbiSim 训练范式),又要有 world/ego 分割掩码(WEM 训练范式)。BEHAVIOR-1K 是少数同时满足两者的数据源,故合流的最快路径很可能也起于 BEHAVIOR-1K。
8. 挑战与未来方向
8.1 Sim-to-Real
两篇论文的最大空缺。可行路径:
- OrbiSim 路径:复用 PhyInf 的梯度反演思路,在真实 RGB-D 视频上反推物理参数,把仿真器逐步"贴近"真实;同时用域随机化训练 Vision 模块,缓解光照-纹理 gap。
- WEM 路径:在真实示教视频上做无监督的 world/ego 分割(如用 SAM 系列 + 时序一致性),把对显式分割掩码的依赖剥离。
8.2 跨形态与跨场景泛化
OrbiSim 的 object-centric Transformer 已经天然支持任意物体数量,但机器人本体形态泛化(机械臂 → 双足 → 灵巧手)尚未验证;WEM 的 ego 分支默认指机器人本体,但单一 ego latent 难以承载灵巧手 21-DoF 这种高维状态。未来可考虑:
- 对 ego latent 做分层(base / arm / hand);
- 在训练数据里混合多形态机器人,看 ego 专家是否能自发分化。
8.3 长视野自回归漂移
OrbiSim 的 cosine AR 与 WEM 的 chunk 化生成都缓解但未根治漂移。可探索方向:
- 引入显式 keyframe 锚定(类似视频压缩里的 I-frame),定期用 ground-truth 状态/帧重置;
- 借鉴 Hierarchical World Model 思路,在更高时间粒度建立"事件级"动力学。
8.4 统一基准
OrbiSim 与 WEM 之所以难以直接比较,是因为前者优化"控制可用性"指标、后者优化"视频质量 + 多轮指令"指标。建议社区构建一个双视角混合基准:
- 任务集来自 BEHAVIOR-1K / HTEWorld,保证多轮长视野;
- 指标同时包含 EWMScore(视频质量侧)与 RL Success / TrajErr(控制侧);
- 提供统一的 sim-to-real 验证桥(如真实 Aloha 机器人执行同一指令)。
8.5 可微性的工程化
OrbiSim 的 APG 在仿真里跑得通,但要进入工业管线,仍缺少:
- 可微接触模型与刚体引擎的对齐验证;
- 与 Isaac Sim / Newton 现有渲染、传感器栈的接口;
- 多 GPU 训练 + 模型并行下的梯度数值稳定性测试。
9. 结论:哪条路线更具前景
如果只能下一个赌注,本综述给出的判断如下:
- 短期(6–12 个月):WEM 路线更易出 demo——视频生成端的工具链最成熟,HTEWorld 与开源模型已经把门槛压到了"5B 模型 + 1 张分割掩码",社区会涌现一批 world/ego 解耦的变体。
- 中期(1–2 年):OrbiSim 路线的潜在天花板更高——一旦把可微物理引擎与真实机器人闭环打通,它会重新定义"机器人仿真器"这一品类的入口,比"更好看的视频"价值高一个数量级。
- 长期(2 年以上):二者合流几乎是必然——一个不可微的世界模型无法服务策略学习,一个不能解耦世界/自我的世界模型无法服务长视野任务。预计 2027 年前后会出现首批同时具备 APG 接口与 world-ego 解耦的统一架构。
9.1 给读者的下一步阅读建议
- 想做物理/控制方向研究:先把 OrbiSim 论文与本仓库的
orbisim_review.md一起读,然后回到 DreamerV3、DiffTaichi、NVIDIA Newton 的源码理解可微物理的工程实现; - 想做生成/视频方向研究:先看
wem_review.md、HTEWorld 数据集、Cosmos-Predict 2.5 与 Wan2.2-TI2V 的对比,再回到 IRASim / Ctrl-World 评估长视野生成; - 想做范式融合研究:直接以本节 §7.4 描绘的"OrbiSim-Dynamics × WEM-Vision"作为出发点,关注 BEHAVIOR-1K 的同时标注可行性;
- 关心本仓库其他世界模型综述:参见
world_models_review.md、world_models_arxiv_2025_survey.md、physics_world_models_review.md、lyra2_review.md与jepa/index.md,本节相当于它们在 2026.05 时间点的专题切片。
10. 参考文献
[1] OrbiSim: World Models as Differentiable Physics Engines for Embodied Intelligence (2026). Jiajian Li, Jingyuan Huang, Junru Gong, Qi Wang, Xiaokang Yang, Yunbo Wang. arXiv:2605.16395. [PDF]
[2] World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks (2026). Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Xingyu Chen. arXiv:2605.19957. [PDF] · 项目页 · HF 模型 · HF 数据集
[3] Mastering Diverse Domains through World Models (DreamerV3) (2023). Danijar Hafner, Jurgis Pasukonis, Jimmy Ba, Timothy Lillicrap. arXiv:2301.04104.
[4] World Models (2018). David Ha, Jürgen Schmidhuber. arXiv:1803.10122.
[5] Cosmos-Predict 2.5 (2025). NVIDIA. 大规模视频世界模型,作为 WEM 主要基线之一。
[6] WoW: World-on-World Generative Model (2025). 7B 视频世界模型基线。
[7] AdaWorld: Adaptive World Models for Robotic Manipulation (2025). OrbiSim 的主要预测保真度基线。
[8] Vid2World: Video-to-World Generative Models (2025). OrbiSim 的主要视频预测基线。
[9] I-JEPA / V-JEPA / V-JEPA 2 (2023–2024). Yann LeCun et al. Latent-only 预测范式的代表,与本文 §3.1 的 latent/pixel 解耦轴对应。详见 jepa/index.md。
[10] IRASim (2025). 长视野指令跟随基准 WorldArena 的代表方法。
[11] Ctrl-World (2025). 同上。
[12] Wan2.2-TI2V (2025). WEM 的视频生成主干。
[13] Qwen3-VL (2025). Alibaba. WEM 的冻结规划器。
[14] BEHAVIOR-1K: A Benchmark for Embodied AI with 1,000 Everyday Activities (2023). HTEWorld 数据构建的底层资产源。
[15] robosuite: A Modular Simulation Framework and Benchmark for Robot Learning (2020). Yuke Zhu et al. OrbiSim Push / Stack 任务的基础环境。
[16] Isaac Lab / NVIDIA Newton (2024–2026). 经典 / 可微物理仿真器,OrbiSim 的对照参照系。
[17] Physion: Evaluating Physical Prediction from Vision in Humans and Machines (2021). OrbiSim 可变形物体(Drape)任务的来源。
[18] AdaManip (2024). OrbiSim 关节物体(Articulated)任务的来源。
[19] DiffTaichi: Differentiable Programming for Physical Simulation (2020). Yuanming Hu et al. 经典可微物理的代表。
[20] PAN-style baselines (2025). WEM 的"无解耦同规模 5B"对照组。