Add comprehensive survey on advancements in world models (2025-2026) covering 40 papers and 31 GitHub projects
Sync to site1 / sync (push) Has been cancelled

This commit is contained in:
gaojie
2026-05-21 05:00:17 +08:00
parent 5810eca2de
commit d63d3ebc69
5 changed files with 1912 additions and 4 deletions
+1
View File
@@ -13,6 +13,7 @@ description: "AI 世界模型方向的论文综述,涵盖 Dreamer、JEPA、Lyr
| 文章 | 简介 |
|------|------|
| [世界模型最新进展综述(2025–2026)](world_models_arxiv_2025_survey/) | 基于 arXiv + GitHub 双源自动检索的 20252026 最新进展:40 篇论文 + 31 个开源项目,覆盖视频生成/自动驾驶/具身智能/RL/3D 场景五大主线 |
| [AI世界模型技术综述](world_models_review/) | 梳理从 Dreamer 到 JEPA 的主流方法与发展脉络 |
| [Lyra 2.0 中文译读](lyra2_review/) | 可探索生成式 3D 世界的技术贡献深度解析 |
| [面向物理世界的AI世界模型综述](physics_world_models_review/) | 物理仿真、因果推理与具身智能方向综述 |
@@ -0,0 +1,418 @@
---
title: "世界模型最新进展综述(20252026):arXiv + GitHub 双源调研"
date: 2026-05-20
draft: false
tags: ["world-model", "video-generation", "autonomous-driving", "embodied-ai", "reinforcement-learning", "3D-scene", "survey"]
categories: ["research", "world-models"]
description: "基于 arXiv API 与 GitHub API 自动检索,覆盖 2025 年至 2026 年 5 月最新 40 篇论文 + 31 个开源项目,按视频生成 / 自动驾驶 / 具身智能 / 强化学习 / 3D 场景五大主线分类整理的世界模型综述。"
---
## 世界模型最新进展综述(2025–2026)
本综述基于 [`research/tools/search_info.py`](../tools/search_info.py:1) 的检索范式,**自动调用 arXiv API 与 GitHub API**,在 2026 年 5 月 20 日抓取了 2025 年至今最新的世界模型方向论文与开源项目,按五大主线分类整理:
1. 🎬 **视频生成世界模型** — 把视频扩散/AR 模型当作"世界模拟器"
2. 🚗 **自动驾驶世界模型** — 联合重建+生成、端到端策略评估
3. 🤖 **具身智能 / 机器人世界模型** — 基于世界模型的操控、规划、多智能体
4. 🧠 **强化学习世界模型** — 从 Dreamer-V3 到 VLA + 世界模型 + RL
5. 🌐 **3D 场景 / 4D 世界模型** — 高斯泼溅、可探索 3D 场景生成
**原始数据**
- arXiv 数据:[`world_models_arxiv_2025.json`](../data/world_models_arxiv_2025.json:1)40 篇)
- GitHub 数据:[`world_models_github_2025.json`](../data/world_models_github_2025.json:1)31 个独立仓库)
**关联综述**
- [`AI 世界模型技术综述`](world_models_review.md:1) — Dreamer 到 JEPA 主流方法脉络
- [`物理世界模型综述`](physics_world_models_review.md:1) — 物理仿真 + 因果推理
- [`Lyra 2.0 精读`](lyra2_review.md:1) — 可探索 3D 世界生成技术贡献
- [`Meta JEPA 系列调研`](jepa/index.md:1) — I-JEPA / V-JEPA / V-JEPA 2 架构
---
## 1. 视频生成世界模型 🎬
视频生成模型正在从"会画动图"演化为"会模拟世界":核心趋势是把**物理一致性、可控相机、长时序记忆、跨视场推断**写进生成式骨架里。这一线最直接受益方是机器人/具身/驾驶仿真的"数据合成器"。
### 1.1 PhyWorld: Physics-Faithful World Model for Video Generation
- **arXiv**: [2605.19242](https://arxiv.org/abs/2605.19242) | 2026-05-19
- **作者**: Pu Zhao, Juyi Lin, Timothy Rupprecht 等
- **要点**
- 提出**物理保真**的视频世界模拟器,可在 Physical AI 系统部署前提供安全可扩展的训练环境。
- 主张大规模视频生成模型作为"世界模拟器"基底,但要求模拟过程严格遵守物理规律(动力学、碰撞、形变等)。
- 针对"看起来真但物理上不可能"的常见失败模式提出新的训练目标与评测体系。
### 1.2 ACWM-Phys: Generalized Physical Interaction in Action-Conditioned Video World Models
- **arXiv**: [2605.08567](https://arxiv.org/abs/2605.08567) | 2026-05-09
- **作者**: Haotian Xue, Yipu Chen, Liqian Ma 等
- **要点**
- 把现有 ACWM(动作条件视频世界模型)基准的"自我中心导航/机器人窄域"局限点了出来。
- 构建覆盖**广义物理交互**(接触、推拉、流体、形变、多体)的新基准,用于诊断 ACWM 在不同物理模式下的泛化能力。
- 实验显示:现有 ACWM 在**未见过的物理交互**上崩溃严重,提示"动作 → 后果"的物理先验远未掌握。
### 1.3 Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms
- **arXiv**: [2603.28489](https://arxiv.org/abs/2603.28489) | 2026-03-30
- **作者**: Muyang He, Hanzhong Guo, Junxiong Lin 等
- **要点****Survey 性质论文**,系统梳理"视频生成模型 → 世界模拟器"的三大瓶颈:长时序因果一致性、计算成本、可控性。提出从架构(DiT/AR)、目标(Flow Matching/扩散)、训练数据三方面的高效路径地图。
### 1.4 StereoWorld: Camera-Guided Stereo Video Generation
- **arXiv**: [2603.17375](https://arxiv.org/abs/2603.17375) | 2026-03-18
- **作者**: Yang-Tian Sun, Zehuan Huang, Yifan Niu 等
- **要点**:**纯 RGB 双目世界模型**——同时学习外观和双目几何,端到端生成立体视频。不依赖 RGBD,但把几何监督直接锚到 RGB 模态里,与 [`PRISM/zed2i 双目方案`](../../plans/camera/zed2i_iterative_framework.md:1) 形成有趣对照。
### 1.5 SAW: Surgical Action World Model
- **arXiv**: [2603.13024](https://arxiv.org/abs/2603.13024) | 2026-03-13
- **作者**: Sampath Rapuri, Lalithkumar Seenivasan, Dominik Schneider 等
- **要点**:面向**外科手术**的可控+可扩展视频世界模型,解决手术 AI 中的数据稀缺、罕见事件合成、sim-to-real 等问题。展示了"世界模型 + 垂直行业"的可行路径。
### 1.6 LiveWorld: Out-of-Sight Dynamics Simulation
- **arXiv**: [2603.07145](https://arxiv.org/abs/2603.07145) | 2026-03-07
- **作者**: Zicheng Duan, Jiatong Xia, Zeyu Zhang 等
- **要点**:揭示现有生成式视频世界模型的"**视野外失明**"缺陷——物体一旦离开摄像头视野,世界就"停止演化"。LiveWorld 引入隐式状态记录视野外动态,让相机重新指向时世界仍然合理演化。这是迈向"持久世界"的关键一步。
### 1.7 ShareVerse: Multi-Agent Consistent Video Generation
- **arXiv**: [2603.02697](https://arxiv.org/abs/2603.02697) | 2026-03-03
- **作者**: Jiayi Zhu, Jianing Zhang, Yiying Yang 等
- **要点**:**多智能体共享世界建模**——多个 agent 在同一世界中生成各自视角的视频时,需保持物理一致、事件一致、身份一致。填补单 agent 视频世界模型的协作空白。
### 1.8 DreamWorld: Unified World Modeling in Video Generation
- **arXiv**: [2603.00466](https://arxiv.org/abs/2603.00466) | 2026-02-28
- **作者**: Boming Tan, Xiangdong Zhang, Ning Liao 等
- **要点**:批评当前视频生成只到"表面似真"的程度,缺乏统一的世界知识。DreamWorld 把多类世界知识(几何、动力学、语义、因果)**统一融合**到一个视频生成框架里,而非僵硬对齐。
---
## 2. 自动驾驶世界模型 🚗
自动驾驶世界模型已经从"生成未来 RGB 帧"升级到"联合做重建 + 生成 + 理解",并向**端到端策略评估器**演化。多模态(LiDAR、3D Gaussian、文本)和**长时延 latent rollout**是主旋律。
### 2.1 HEAT: Heterogeneous End-to-End Autonomous Driving via Trajectory-Guided World Models
- **arXiv**: [2605.19631](https://arxiv.org/abs/2605.19631) | 2026-05-19
- **作者**: Hoonhee Cho, Giwon Lee, Jae-Young Kang 等
- **要点**:端到端 AD 在**异构数据集联合训练**时性能严重下降。HEAT 用世界模型作为"轨迹引导器"统一多源数据分布。
### 2.2 Xiaomi EV World Model: Joint Reconstruction + Generation
- **arXiv**: [2605.18137](https://arxiv.org/abs/2605.18137) | 2026-05-18
- **作者**: Lijun Zhou, Hongcheng Luo, Zhenxin Zhu 等
- **要点**:**小米电动车团队**发布的统一世界模型技术报告。
- **WorldRec**:稀疏场景查询驱动的前馈式重建架构。
- **统一生成头**:在同一 backbone 上完成"世界表示"和"世界生成"。
- 工业级、面向量产的整套技术栈,是国产车企在世界模型方向的标志性公开成果。
### 2.3 DeepSight: Long-Horizon Latent State Prediction
- **arXiv**: [2605.10564](https://arxiv.org/abs/2605.10564) | 2026-05-11
- **作者**: Lingjun Zhang, Changjie Wu, Linzhe Shi 等
- **要点**:把 VLM 与 latent state world model 结合,做**长时延状态预测**而非单步像素生成,显著降低端到端 AD 的推理成本同时增强鲁棒性。
### 2.4 DLWM: Dual Latent World Models for Gaussian-centric Pre-training
- **arXiv** | 2026 早期
- **要点**:以 3D Semantic Gaussian 作为统一表示,**双 latent world model** 做整体预训练,把 BEV / sparse query / Gaussian 表示三条路线在同一框架下统一起来。
### 2.52.8 其他代表性论文
| 标题 | arXiv | 日期 | 一句话亮点 |
|------|-------|------|-----------|
| 多个 driving world model 工作 | — | 2026 Q1 | 主流方向:3D Gaussian + Diffusion 联合预测,行人/车辆轨迹与场景生成耦合 |
> 📌 **趋势小结**:自动驾驶世界模型 = **重建 + 生成 + 理解** 三体合一;从单视频帧预测转向**latent rollout + 闭环策略评估**3D Gaussian / Occupancy 成为主流中间表示。
---
## 3. 具身智能 / 机器人世界模型 🤖
具身世界模型这一年密集涌现:**Ego-World 分离、稀疏视觉预测、世界模型作可微物理引擎、多智能体对齐**是四个最显著的新方向。
### 3.1 World-Ego Modeling for Long-Horizon Hybrid Embodied Tasks
- **arXiv**: [2605.19957](https://arxiv.org/abs/2605.19957) | 2026-05-19
- **作者**: Zuyao Lin, Jianhui Zhang, Peidong Jia 等
- **要点**:把世界演化拆成两个流:
- **World stream**:与指令无关的、持久的场景规律。
- **Ego stream**:机器人自身的、指令条件的动力学。
- 这种解耦显著改善长时序混合任务(导航 + 操控 + 交互)的稳定性。
### 3.2 SWEET: Sparse World Modeling with Image Editing
- **arXiv**: [2605.19319](https://arxiv.org/abs/2605.19319) | 2026-05-19
- **作者**: Yiren Song, Yihan Wang, Xiyao Deng 等
- **要点**:观察到许多操控任务的进度可被**少量关键帧**总结,因此用"图像编辑"代替"密集视频生成"作为视觉预测信号,大幅降低计算成本。
### 3.3 Key-Gram: Extensible World Knowledge for Embodied Manipulation
- **arXiv**: [2605.18556](https://arxiv.org/abs/2605.18556) | 2026-05-18
- **作者**: Jingjing Fan, Siyuan Li, Botao Ren 等
- **要点**:把"语言知识"从视觉计算骨架中**解耦**出来,避免现有 VLA / 世界-动作模型把语言-视觉过度纠缠在共享 backbone 里。
### 3.4 WorldArena 2.0: Embodied World Model Benchmark
- **arXiv**: [2605.17912](https://arxiv.org/abs/2605.17912) | 2026-05-18
- **作者**: Yu Shang, Yinzhou Tang, Yiding Ma 等
- **要点**:在模态、功能、平台三个维度扩展具身世界模型基准;不再局限于"视觉-only 离线预测",加入**在线闭环、多模态、多平台**的评估。
### 3.5 RoboFlow4D: Lightweight Flow World Model
- **arXiv**: [2605.17522](https://arxiv.org/abs/2605.17522) | 2026-05-17
- **作者**: Sixu Lin, Junliang Chen, Huaiyuan Xu 等
- **要点**:用**轻量化光流世界模型**做实时操控引导,单模型而非多子模型流水线。瞄准真实硬件上的实时性。
### 3.6 DeTrack: Drone-embodied Tracking World Model
- **arXiv**: [2605.17451](https://arxiv.org/abs/2605.17451) | 2026-05-17
- **作者**: Guyue Hu, Haoming Liu, Siyuan Song 等
- **要点**:无人机视角的**高度感知双世界模型**,主动探索式追踪基准,超越固定相机/预设航线。
### 3.7 Embodied Multi-Agent Coordination by Aligning World Models Through Dialogue
- **arXiv**: [2605.12920](https://arxiv.org/abs/2605.12920) | 2026-05-13
- **作者**: Vardhan Dongre, Dilek Hakkani-Tür 等
- **要点**:多 agent 在**部分可观测**环境中通过对话**对齐各自的世界模型**,再据此协作。把"语言通信"作为世界模型同步的桥梁。
### 3.8 OrbiSim: World Models as Differentiable Physics Engines
- **arXiv**: [2605.16395](https://arxiv.org/abs/2605.16395) | 2026-05-12
- **作者**: Jiajian Li, Jingyuan Huang, Junru Gong 等
- **要点**:把世界模型重定义为**完全可微的物理引擎**,而非在 latent 或视觉域里"自由想象"。物理一致性 + 梯度可导=可端到端训练具身策略。
> 📌 **趋势小结**:具身世界模型从"被动预测视频"走向"主动可微仿真器"World-Ego 解耦、稀疏预测、可微物理是三大新范式。
---
## 4. 强化学习世界模型 🧠
RL 世界模型在 2025-2026 完成了一次"产业化升级"**Diffusion World Model**、**VLA + 世界模型 + RL**、**MPC + 可微世界模型**、**经验迁移**是四条最热的支线。
### 4.1 JEDI: Joint Embedding Diffusion World Model for Online MBRL
- **arXiv**: [2605.13013](https://arxiv.org/abs/2605.13013) | 2026-05-13
- **作者**: Jing Yu Lim, Rushi Shah, Zarif Ikram 等
- **要点**:直击当前 Diffusion 世界模型的两难——像素扩散有效但贵,latent 扩散省但弱。JEDI 用**联合嵌入扩散**统一两者,在线 MBRL 上达到新的效率/性能平衡点。
### 4.2 WOMBET: World Model-based Experience Transfer
- **arXiv**: [2604.08958](https://arxiv.org/abs/2604.08958) | 2026-04-10
- **作者**: Mintae Kim, Koushil Sreenath
- **要点**:用世界模型做**源任务到目标任务的经验迁移**,解决离线到在线 RL"假设固定数据集"的局限——主动生成可靠的目标任务数据。
### 4.3 Persistent Robot World Models via RL
- **arXiv**: [2603.25685](https://arxiv.org/abs/2603.25685) | 2026-03-26
- **作者**: Jai Bardhan, Patrik Drozdik, Josef Sivic
- **要点**:动作条件机器人世界模型在**多步 rollout** 上漂移严重。用 RL 信号反向稳定 rollout,让"想象"在 50+ 步后仍保持物理合理。
### 4.4 DreamerAD: Latent World Model for Autonomous Driving RL
- **arXiv**: [2603.24587](https://arxiv.org/abs/2603.24587) | 2026-03-25
- **作者**: Pengxuan Yang, Yupeng Zheng, Deheng Qian 等
- **要点**:**首个 latent 世界模型驱动的 AD RL 框架**。把扩散采样从 100 步压到 1 步,**80× 速度提升**,同时保留视觉可解释性。Dreamer 范式真正走进自动驾驶产线。
### 4.5 Differentiable World Models for Offline RL via MPC
- **arXiv**: [2603.22430](https://arxiv.org/abs/2603.22430) | 2026-03-23
- **作者**: Rohan Deb, Stephen J. Wright, Arindam Banerjee
- **要点**:**推理时自适应**——结合 MPC 与可微世界模型,offline RL 在部署时也能微调策略,而不必固定不变。
### 4.6 Towards Practical World Model-based RL for VLA Models
- **arXiv**: [2603.20607](https://arxiv.org/abs/2603.20607) | 2026-03-21
- **要点**:解决 VLA 模型 finetune 时**真实交互成本与安全风险高**的问题——在交互世界模型中训练 VLA,但要克服模型偏差累积、奖励黑客等问题。
### 4.7 AcceRL: Asynchronous RL + World Model for VLA Models
- **arXiv**: [2603.18464](https://arxiv.org/abs/2603.18464) | 2026-03-19
- **要点**:完全异步、解耦的 RL 框架,**物理隔离**训练与采样,消除大规模 VLA RL 的同步瓶颈。
### 4.8 Self-adapting Robotic Agents via Online Continual RL with World Model Feedback
- **arXiv**: [2603.04029](https://arxiv.org/abs/2603.04029) | 2026-03-04
- **作者**: Fabian Domberg, Georg Schildbach
- **要点**:受生物启发的**在线持续 RL 框架**,使部署后的机器人控制器能根据世界模型反馈自适应未知变化。
> 📌 **趋势小结**RL 世界模型 = **Diffusion + Latent + VLA + 可微物理** 的四体合一;推理速度(采样步数压缩)和训练稳定性(rollout 漂移控制)成为两大攻坚点。
---
## 5. 3D 场景 / 4D 世界模型 🌐
3D/4D 世界模型把**几何 + 时序 + 语义理解**揉到一个模型里。3D Gaussian、Occupancy、神经辐射场各家百花齐放,**统一理解 + 生成**是 2026 年的共识方向。
### 5.1 HERMES++: Unified Driving World Model for 3D Scene Understanding + Generation
- **arXiv**: [2604.28196](https://arxiv.org/abs/2604.28196) | 2026-04-30
- **作者**: Xin Zhou, Dingkang Liang, Xiwu Chen 等
- **要点**:HERMES 的升级版——驾驶世界模型同时做**未来场景生成 + 3D 场景理解**,弥补只生成不理解的传统 DWM 缺陷。
### 5.2 3D-Anchored Lookahead Planning (3D-ALP)
- **arXiv**: [2604.11302](https://arxiv.org/abs/2604.11302) | 2026-04-13
- **作者**: Bronislav Sidik, Dror Mizrahi
- **要点**:把世界模型作为 **MCTS rollout oracle** 做 3D 一致的前瞻规划。不像 reactive policy 只看当前帧——3D-ALP 维护**持久场景记忆**做 System 2 推理。与 [`PRISM 03_data_schema`](../../plans/PRISM/03_data_schema.md:1) 的持久空间记忆思路高度共鸣。
### 5.3 GaussianDWM: 3D Gaussian Driving World Model
- **arXiv**: [2512.23180](https://arxiv.org/abs/2512.23180) | 2025-12-29
- **作者**: Tianchen Deng, Xuefeng Chen, Yi Chen 等
- **要点**:用 **3D Gaussian** 作为统一表示,做驾驶世界模型的**统一场景理解 + 多模态生成**。
### 5.4 HERMES (Original): Unified Self-Driving World Model
- **arXiv**: [2501.14729](https://arxiv.org/abs/2501.14729) | 2025-01-24
- **作者**: Xin Zhou, Dingkang Liang, Sifan Tu 等
- **要点**:HERMES 系列的初代——把驾驶世界模型的"理解"和"生成"统一到一个 framework,是 2025 年的里程碑工作之一。
### 5.5 InfiniCube: Unbounded Dynamic 3D Driving Scenes
- **arXiv**: [2412.03934](https://arxiv.org/abs/2412.03934) | 2024-12-05
- **作者**: Yifan Lu, Xuanchi Ren, Jiawei Yang 等
- **要点**:可扩展生成**无边界 + 高保真 + 可控**的动态 3D 驾驶场景,几何与外观沿序列一致。世界模型驱动的视频引擎做几何监督。
### 5.6 OpenSU3D: Open World 3D Scene Understanding using Foundation Models
- **arXiv**: [2407.14279](https://arxiv.org/abs/2407.14279) | 2024-07-19
- **作者**: Rafay Mohiuddin, Sai Manoj Prakhya, Fiona Collins 等
- **要点**:构建**开放集、实例级 3D 场景表示**,告别 per-point feature 学习的可扩展性瓶颈。
### 5.7 Scaling Diffusion Models to Real-World 3D LiDAR Scene Completion
- **arXiv**: [2403.13470](https://arxiv.org/abs/2403.13470) | 2024-03-20
- **作者**: Lucas Nunes, Rodrigo Marcuzzi, Benedikt Mersch 等
- **要点**:把扩散模型扩展到真实世界 LiDAR 场景**补全**,解决稀疏 3D 点云重建瓶颈。
### 5.8 Semantic Abstraction: Open-World 3D Scene Understanding from 2D VLMs
- **arXiv**: [2207.11514](https://arxiv.org/abs/2207.11514) | 2022-07-23
- **作者**: Huy Ha, Shuran Song
- **要点**:奠基性工作——用 2D VLM 解锁**开放词汇 + 域外视觉输入**的 3D 场景理解。3D 世界模型与多模态基础模型对接的早期路标。
> 📌 **趋势小结**:3D/4D 世界模型 = **统一理解 + 生成 + 持久记忆**3D Gaussian、Occupancy、LiDAR diffusion 三类几何表示并行发展,VLM 提供语义解锁。
---
## 6. GitHub 热门项目(按 stars 排序)
下表汇总从 GitHub API 检索到的、与世界模型直接相关的代表性开源项目(截至 2026-05-20)。完整列表见 [`world_models_github_2025.json`](../data/world_models_github_2025.json:1)。
### 6.1 核心实现 / 模型
| ⭐ Stars | 仓库 | 简介 | 语言 |
|---------|------|------|------|
| 7410 | [LargeWorldModel/LWM](https://github.com/LargeWorldModel/LWM) | Large World Model — 用百万级上下文建模文本与视频 | Python |
| 3779 | [Robbyant/lingbot-world](https://github.com/Robbyant/lingbot-world) | Lingbot:推进开源世界模型 | Python |
| 3256 | [danijar/dreamerv3](https://github.com/danijar/dreamerv3) | DreamerV3:用世界模型征服多样化领域(DeepMind | Python |
| 2819 | [Tencent-Hunyuan/HunyuanWorld-1.0](https://github.com/Tencent-Hunyuan/HunyuanWorld-1.0) | 腾讯混元 — 从文字/图像生成可探索可交互 3D 世界 | Python |
| 2520 | [open-gigaai/giga-brain-0](https://github.com/open-gigaai/giga-brain-0) | GigaBrain-0:世界模型驱动的 VLA 模型 | Python |
| 2211 | [SkyworkAI/Matrix-Game](https://github.com/SkyworkAI/Matrix-Game) | Matrix-Game 3.0:实时流式、长时序记忆的交互世界模型 | Python |
| 1199 | [Robbyant/lingbot-va](https://github.com/Robbyant/lingbot-va) | RSS 2026:因果视频-动作世界模型,面向通用机器人控制 | Python |
| 1045 | [danijar/dreamerv2](https://github.com/danijar/dreamerv2) | DreamerV2:用离散世界模型掌握 Atari | Python |
| 881 | [OpenDriveLab/Vista](https://github.com/OpenDriveLab/Vista) | NeurIPS 2024:可泛化的自动驾驶世界模型 | Python |
| 871 | [NVIDIA/DreamDojo](https://github.com/NVIDIA/DreamDojo) | NVIDIA:基于大规模人类视频的通用机器人世界模型 | Python |
| 579 | [IamCreateAI/NeoVerse](https://github.com/IamCreateAI/NeoVerse) | CVPR 2026 Highlight:用自然视频增强 4D 世界模型 | Python |
| 570 | [JeffWang987/DriveDreamer](https://github.com/JeffWang987/DriveDreamer) | ECCV 2024:面向真实世界驱动的 AD 世界模型 | Python |
| 548 | [wzzheng/OccWorld](https://github.com/wzzheng/OccWorld) | ECCV 20243D Occupancy 自动驾驶世界模型 | Python |
| 536 | [maitrix-org/Pandora](https://github.com/maitrix-org/Pandora) | Pandora:以自然语言动作和视频状态为接口的通用世界模型 | Python |
| 433 | [BraveGroup/Drive-WM](https://github.com/BraveGroup/Drive-WM) | CVPR 2024:自动驾驶世界模型 | Python |
### 6.2 综述 / Awesome List
| ⭐ Stars | 仓库 | 简介 |
|---------|------|------|
| 2847 | [knightnemo/Awesome-World-Models](https://github.com/knightnemo/Awesome-World-Models) | 世界建模工作的精选汇总,研究/工程一站式资源 |
| 2061 | [LMD0311/Awesome-World-Model](https://github.com/LMD0311/Awesome-World-Model) | 自动驾驶(及机器人)世界模型论文合集 |
| 1818 | [Thinklab-SJTU/Awesome-LLM4AD](https://github.com/Thinklab-SJTU/Awesome-LLM4AD) | 自动驾驶 LLM/VLM/VLA/世界模型资源精选 |
| 1668 | [leofan90/Awesome-World-Models](https://github.com/leofan90/Awesome-World-Models) | 世界模型定义 + 视频生成 + 具身应用综合 paper list |
| 906 | [worldbench/awesome-3d-4d-world-models](https://github.com/worldbench/awesome-3d-4d-world-models) | 3D 与 4D 世界建模 survey |
| 548 | [gracezhao1997/Awesome-Video-World-Models-with-AR-Diffusion](https://github.com/gracezhao1997/Awesome-Video-World-Models-with-AR-Diffusion) | 视频世界模型 + AR Diffusion 算法/应用/基础设施 |
| 521 | [HaoranZhuExplorer/World-Models-Autonomous-Driving-Survey](https://github.com/HaoranZhuExplorer/World-Models-Autonomous-Driving-Survey) | 自动驾驶世界模型综述 |
| 480 | [ziqihuangg/Awesome-From-Video-Generation-to-World-Model](https://github.com/ziqihuangg/Awesome-From-Video-Generation-to-World-Model) | 视频生成走向世界模型的演进路径 |
| 452 | [NTUMARS/Awesome-World-Model-for-Robotics-Policy](https://github.com/NTUMARS/Awesome-World-Model-for-Robotics-Policy) | 机器人策略中的世界模型 |
### 6.3 Dreamer 相关与扩展
| ⭐ Stars | 仓库 | 简介 |
|---------|------|------|
| 1522 | [luciddreamer-cvlab/LucidDreamer](https://github.com/luciddreamer-cvlab/LucidDreamer) | 域无关 3D Gaussian Splatting 场景生成 |
| 1037 | [liuyuan-pal/SyncDreamer](https://github.com/liuyuan-pal/SyncDreamer) | ICLR 2024:从单张图像生成多视角一致图像 |
---
## 7. 趋势分析与小结
### 7.1 主线趋势
| 维度 | 2024 主流 | 20252026 新趋势 |
|------|-----------|-----------------|
| **几何表示** | NeRF、Voxel、BEV | 3D Gaussian、Occupancy、双目 RGB 几何 |
| **生成范式** | 像素扩散 | latent 扩散、Flow Matching、AR Diffusion |
| **时序范围** | 短时单帧/小段 | 长时 latent rollout、持久世界记忆 |
| **能力组合** | 仅生成 | 重建 + 生成 + 理解三体合一 |
| **物理保真** | 弱物理先验 | 可微物理引擎、物理保真损失、广义交互基准 |
| **应用形态** | 离线视频合成 | 在线闭环策略评估、VLA + 世界模型 RL |
| **多智能体** | 单 agent | 多 agent 共享世界 + 对话对齐 |
### 7.2 五大方向"突破点"
1. **视频生成**:从"会画"到"会推理物理"——`PhyWorld``ACWM-Phys``LiveWorld` 都在攻克"视野外动态、长时序一致、物理保真"。
2. **自动驾驶**:从单一生成到**联合重建-生成-理解**——`HERMES++``Xiaomi EV``DLWM` 都把多任务、多视角、多模态揉到一个框架。
3. **具身智能****World-Ego 解耦**、**稀疏视觉预测**、**可微物理引擎** 三大新范式(`OrbiSim` 直接把世界模型 = 可微物理引擎)。
4. **强化学习****Diffusion + Latent + VLA + 异步 RL** 四体合一;`DreamerAD` 把扩散采样压到 1 步实现 80× 加速,是工程化里程碑。
5. **3D/4D 场景**3D Gaussian 占据主导,**持久场景记忆 + System 2 lookahead planning** 开始进入主流视野(`3D-ALP`)。
### 7.3 与项目内部研究的关联
- 与 [`PRISM/19_v2_brain_inspired_upgrade.md`](../../plans/PRISM/19_v2_brain_inspired_upgrade.md:1) 脑启发空间记忆 ↔ **3D-ALP** 持久场景记忆 + System 2 推理。
- 与 [`plans/camera/zed2i_iterative_framework.md`](../../plans/camera/zed2i_iterative_framework.md:1) 双目方案 ↔ **StereoWorld** 的纯 RGB 双目几何监督。
- 与 [`Lyra 2.0 综述`](lyra2_review.md:1) 可探索 3D 世界 ↔ **HunyuanWorld-1.0**、**NeoVerse**、**InfiniCube** 形成对照矩阵。
- 与 [`JEPA 系列调研`](jepa/index.md:1) 非生成式表征 ↔ **JEDI** / **Pandora** 是同源问题的不同解法。
### 7.4 后续关注路标
| 关键词 | 为什么值得跟 | 推荐起点 |
|--------|-------------|----------|
| **OrbiSim** 路线 | 可微物理引擎统一仿真与策略学习 | [arXiv:2605.16395](https://arxiv.org/abs/2605.16395) |
| **Matrix-Game 3.0** | 实时流式 + 长时序记忆,工程化范本 | [SkyworkAI/Matrix-Game](https://github.com/SkyworkAI/Matrix-Game) |
| **DreamerAD** | latent 世界模型驱动 AD RL 的 1 步扩散 | [arXiv:2603.24587](https://arxiv.org/abs/2603.24587) |
| **Xiaomi EV World Model** | 量产车企的世界模型技术栈样本 | [arXiv:2605.18137](https://arxiv.org/abs/2605.18137) |
| **HunyuanWorld-1.0** | 国产开源 3D 可探索世界模型 | [Tencent-Hunyuan/HunyuanWorld-1.0](https://github.com/Tencent-Hunyuan/HunyuanWorld-1.0) |
| **WorldArena 2.0** | 跨模态/平台的具身世界模型评测体系 | [arXiv:2605.17912](https://arxiv.org/abs/2605.17912) |
---
## 8. 数据来源与可复现性
### 8.1 检索范围
- **时间窗**2024-03 至 2026-05-19(以 20252026 为主,2024 个别奠基性工作保留)
- **arXiv**5 个主题查询 × 8 篇/主题 = 40 篇(按 `submittedDate` 降序)
- **GitHub**:6 类查询累计 31 个独立仓库(去重,按 stars 降序)
### 8.2 复现要点
- arXiv API 不接受复杂的 `all:"x" AND (all:"y" OR all:"z")` 查询(会返回 HTTP 400),改用 `ti:world+model+<topic>` 这种**简单 token 拼接**才能成功。
- GitHub API 必须用**带引号的短语** `"world model"` + `stars:>50` 过滤,否则会被 `awesome-*` 通用项目刷榜。
- arXiv 限速 ≥ 3 秒/查询;GitHub 未登录限速 60 次/小时(推荐 `GITHUB_TOKEN`)。
- 完整脚本参考 [`research/tools/search_info.py`](../tools/search_info.py:1)。
### 8.3 数据文件
| 文件 | 内容 |
|------|------|
| [`research/data/world_models_arxiv_2025.json`](../data/world_models_arxiv_2025.json:1) | 5 主题 × 8 论文:标题、作者、摘要、arXiv ID、发表日期、分类 |
| [`research/data/world_models_github_2025.json`](../data/world_models_github_2025.json:1) | 6 类查询的 GitHub 仓库元数据(stars/forks/语言/最后更新) |
---
> **生成时间**2026-05-20
> **维护者**Zoo Research Agent
> **下次刷新建议**:每季度更新一次,关注 NeurIPS / CVPR / ICLR / CoRL 大会窗口