refactor: reorganize research/ into topic subfolders (world-models, spatial-memory, crowdroom, plans)
Sync to site1 / sync (push) Has been cancelled

This commit is contained in:
gaojie
2026-05-21 03:05:45 +08:00
parent 0968c881d6
commit 11b4c32172
13 changed files with 82 additions and 14 deletions
+18
View File
@@ -0,0 +1,18 @@
---
title: "AI 世界模型综述"
date: 2026-05-20
draft: false
tags: ["world-model", "AI", "综述"]
categories: ["research"]
description: "AI 世界模型方向的论文综述,涵盖 Dreamer、JEPA、Lyra 2.0、物理世界模型等主流方法。"
---
## AI 世界模型综述
本目录收录 AI 世界模型(World Models)方向的论文综述与译读文章。
| 文章 | 简介 |
|------|------|
| [AI世界模型技术综述](world_models_review/) | 梳理从 Dreamer 到 JEPA 的主流方法与发展脉络 |
| [Lyra 2.0 中文译读](lyra2_review/) | 可探索生成式 3D 世界的技术贡献深度解析 |
| [面向物理世界的AI世界模型综述](physics_world_models_review/) | 物理仿真、因果推理与具身智能方向综述 |
+362
View File
@@ -0,0 +1,362 @@
---
title: "Lyra 2.0:可探索的生成式 3D 世界 — 中文译读"
date: 2026-05-20
draft: false
tags: ["调研", "论文综述", "Gaussian Splatting", "arXiv", "物理"]
categories: ["research"]
---
# Lyra 2.0:可探索的生成式 3D 世界 — 中文译读
> **原文**:[Lyra 2.0: Explorable Generative 3D Worlds](https://arxiv.org/abs/2604.13036) (arXiv:2604.13036v1, 2026-04-14)
> **作者**:Tianchang Shen\*、Sherwin Bahmani、Kai He、Sangeetha Grama Srinivasan、Tianshi Cao、Jiawei Ren、Ruilong Li、Zian Wang、Nicholas Sharp、Zan Gojcic、Sanja Fidler、Jiahui Huang、Huan Ling、Jun Gao、Xuanchi Ren\* (\* equal contribution)
> **机构**:NVIDIA Spatial Intelligence Lab + 多伦多大学
> **项目页**:<https://research.nvidia.com/labs/sil/lyra2/>
> **PDF 本地**:[`research/lyra2_paper.pdf`](lyra2_paper.pdf) (13 MB, 169 引用文献)
> **译读版本**:v1.0,撰写于 2026-05-16
---
## 0. 一句话总结
> **"用 80 帧滑动窗口的视频扩散模型 + 几何只用作路由(不参与外观合成) + 自增强训练抗漂移,实现从一张照片到任意长度可走通的 3D 场景。"**
Lyra 2.0 的核心贡献是**解决长程视频生成的两大顽疾**:**空间遗忘**(spatial forgetting,镜头转回去时拼不回原貌)与 **时间漂移** (temporal drifting,自回归累积误差导致色彩/几何越生成越烂)。
---
## 1. 问题背景:从 video diffusion 到 explorable 3D world
### 1.1 什么是 generative reconstruction (生成式重建)
给定**一张图 + 一条相机轨迹**,流程是:
1. **视频扩散模型** (DiT-based, Wan 2.1-14B) 沿轨迹合成稠密新视角视频 →
2. **前馈 3D 重建**(Depth Anything v3 → 3D Gaussian Splatting / mesh)→
3. 得到可被 NVIDIA Isaac Sim 等仿真器直接吃的 3D 资产。
**替代真实采集**,可批量造出多样化、虚构、甚至超大尺度的 3D 环境。
### 1.2 长程探索的两个失败模式
| 失败模式 | 物理直觉 | 现象 |
|---|---|---|
| **空间遗忘 (spatial forgetting)** | 相机走远后,早期看过的区域**超出模型时间上下文窗口**,转回去时只能凭空"幻想"结构 | 同一面墙第二次看是不一样的 |
| **时间漂移 (temporal drifting)** | 每帧合成的小误差**自回归地累积** | 色偏、模糊、几何扭曲越生成越严重 |
### 1.3 现有方案为何不够
| 方案 | 谁在做 | 缺点 |
|---|---|---|
| 累积全局 3D 表征做 conditioning | GEN3C / SPMem / WorldExplorer | 早期深度估计的小误差→**几何被污染**→后续生成被错误引导,**误差放大** |
| 把历史帧塞进 attention(用 camera pose embed) | CameraCtrl / Yume | 在大视角变化下,**纯自注意力难以推出长程几何对应** |
| 扩长 temporal context | FramePack | 早期帧滑出 FOV,**对新区域无帮助** |
Lyra 2.0 选择**桥接两条路径**——既保留 3D 几何记忆,又**只用它做"路由",不用它做"合成"**。
---
## 2. 核心思想(三句话讲完)
1. **空间记忆 ≠ 用来渲染,只用来检索**——维护**每帧独立**的 3D 缓存,通过视点重投影,挑出最相关的历史帧塞进 attention 上下文,**让扩散模型自己合成像素**。
2. **几何对应用规范坐标(canonical coords)而非 warped RGB**——前者只携带几何信息,不带 disocclusion / 拉伸 / 颜色 bleeding,模型不会"以为这些瑕疵是真的"。
3. **自增强训练 (Self-Augmentation)**——训练时**用模型自己的 1-step 去噪结果当历史**,让它在训练阶段就学会"接住坏输入并修正",从而抗推理时累积误差。
---
## 3. 方法详解(§ 4)
### 3.1 整体流水线(Retrieve-Generate-Update 循环)
```
单图 I₀
▼ ── 用户给一段相机轨迹 + (可选)文本 prompt ──
检索阶段:在空间记忆 𝒞 中找 Nₛ=5 个对目标视角"最可见"的历史帧
生成阶段:DiT 在 [anchor + 空间 slots + 时间 slots + g₂₀ 生成 token] 上做 flow-matching 去噪
更新阶段:用 Depth Anything v3 估计新帧深度 → 写回 𝒞 (每帧独立)
▼ 重复
80 帧/段, 35-step 去噪/段 → 1 段 ~194 s on GB200
─ DMD 蒸馏后 4-step → ~15 s/段 (13× 加速)
```
最后:把累积视频一次性喂给微调过的 Depth Anything v3 做**前馈 3DGS**,再用 OpenVDB 稀疏分层做 marching-cubes 出 mesh。
### 3.2 模块 1:Anti-Forgetting(抗空间遗忘)— § 4.2
#### (a) 3D 缓存的结构 — **每帧独立,绝不融合**
对每个生成帧 $I_i$ 估深度 $D_i$ + 已知 $(T_i, K_i)$,缓存两份:
1. **全分辨率深度图 $D_i$** + 相机参数(后续做 dense correspondence 用)
2. **下采样点云 $P_i \in \mathbb{R}^{(H/d)\times(W/d)\times 3}$**(子采样 d=8,只用于检索可见性打分)
> **关键设计**:**绝不把多帧融合成一个全局点云**!理由:生成视频的深度估计随时间退化,如果融合就把"小错误"累积为"全局错误"。**每帧独立 = 错了只错那帧,不会扩散。**
#### (b) 几何感知检索 (Geometry-Aware Retrieval)
给目标相机 $(T^*, K^*)$,对每个历史帧:
1. 把 $P_i$ 投影到目标像平面
2. 对每个目标像素,取所有投影中**最浅深度**(处理遮挡)
3. 一个点视为"可见" iff 其深度与最小深度差 $< \delta = 0.1$(归一化深度单位)
4. **可见性得分 $\varphi(i)$ = 可见点数**
**贪心覆盖最大化**:迭代选择最大化"尚未覆盖目标像素数"的帧,共选 $N_s = 5$ 帧。避免选很近的几张冗余视图。
> **效果**:即使相机几百帧后转回原地,**远超时间上下文窗口**,也能通过 3D 重叠把当时的几张关键帧准确召回。
#### (c) 把空间记忆塞进 DiT
完整 token 布局(每个 $\mathtt{f}_n \mathtt{k}_m$ = n 帧用 m 倍空间子采样后做 patchify):
```
[anchor I₀] [4 spatial slots @ k=2 + 1 @ k=1] [time slots f₁k₁ f₂k₂ f₁k₁ f₁₆k₄] [g₂₀ 生成 20 帧]
```
> 即:**初始锚帧 + 5 张空间记忆(检索得来)+ FramePack 时间压缩(近密远疏)+ 20 帧生成目标**,全部 jointly attend。
#### (d) 用 canonical coordinates 做 dense correspondence
**不**把 retrieved frames 直接 warp 成 RGB(因为会有 disocclusion 黑洞 + 拉伸 + 颜色 bleed,扩散模型会"信以为真"再生成出来)。
而是给每个 retrieved frame 一个 **canonical coordinate map** $C_j \in [-1,1]^{3\times H\times W}$,3 个通道:
- $(u, v)$ = 该像素在源帧的归一化位置
- $\frac{2j}{N_s} - 1$ = 帧索引编码
然后**前向 warp** 到目标视角:
$$\hat{C}_j = \mathrm{FwdWarp}(C_j, D_j^s, T_j^s, T^*, K_j^s, K^*)$$
并把 warped depth 作为第 4 通道,得到 **4-channel correspondence map**。这个 4 通道图经 sin/cos 位置编码 + MLP → 添加到每个 transformer block 的 self-attention **Q 和 K**(不动 V)。
> **关键洞察**:**几何对应只参与"哪些 token 应该 attend 哪些 token"的决定,不参与"内容是什么"的合成**——把"路由"与"合成"彻底解耦。
---
### 3.3 模块 2:Anti-Drifting(抗时间漂移)— § 4.3
#### (a) 漂移的根源:**Train-Test Discrepancy(训练-推理偏置)**
- **训练时**:模型看见的历史 = 干净的 ground-truth 帧
- **推理时**:模型看见的历史 = **它自己刚生成的、带瑕疵的帧**
→ 每步的微小误差被认为是"训练分布外的事故",模型不会修正,反而**继续传播**。
#### (b) Self-Augmentation Training — 用"自己生成的"代替"ground-truth"
每次自回归训练步,以概率 $p_{\text{aug}} = 0.7$:
1. 用干净 GT 编码历史隐变量 $z_0^{\text{hist}} = \mathcal{E}(x^{\text{hist}})$
2. 抽 $t \sim \mathcal{U}(0, 0.5)$,按 flow-matching schedule 加噪:
$$z_t^{\text{hist}} = (1-t) z_0^{\text{hist}} + t \epsilon$$
3. 让 DiT 做**一步**去噪,得到带误差的"伪自生成历史":
$$\tilde z_0^{\text{hist}} = z_t^{\text{hist}} - t \cdot v_\theta(z_t^{\text{hist}}, t, c)$$
4. 用 $\tilde z_0^{\text{hist}}$ **替换** $z_0^{\text{hist}}$ 作为条件;但 supervision target $z_0^{\text{cur}}$ **仍用干净 GT 帧编码**
5. flow-matching 损失监督:"**给定带瑕疵的历史,你也要去噪到干净的当前**"
> **关键效果**:开销仅 **一次额外 DiT forward**,远比 Self-Forcing(每步全多步去噪)轻,**专为 bi-directional 模型设计**。
#### (c) FramePack 做温和支撑
FramePack 提供"近密远疏"的时间压缩(锚 + f₁k₁ + f₂k₂ + f₁k₁ + f₁₆k₄),把长历史压进固定 token 预算。但 Lyra 2.0 强调:**FramePack 缓解但不解决 train-test 偏置,真正解决要靠 self-augmentation**。
---
### 3.4 模块 3:前馈 3D Gaussian Splatting — § 4.4
视频拿到后,用 **Depth Anything v3 (DAv3)** 一次性预测每像素的 3DGS 属性,但做了两个修改:
1. **DPT 头 k=2 下采样**:每像素一个 Gaussian 会爆,降 4× 数量得到流式可渲染的体量
2. **在生成数据上微调 DAv3**:用 3,000 段一分钟视频(来自 DL3DV)做 10,000 iter / lr=5e-5 / bs=8 微调,让 DAv3 学会容忍生成视频特有的小不一致
mesh 抽取:**OpenVDB 分层稀疏栅格** + 视角近用细格、远景用粗格;由 Gaussian 中值深度算 SDF,marching cubes 出 mesh 后跨层级拼接 + 简化。
---
### 3.5 加速版 — DMD 蒸馏 — § 4.5
-**Distribution Matching Distillation** 把 teacher (35 steps + CFG) 蒸成 student (**4 steps, no CFG**)
- 蒸馏期间**保留 self-augmentation**,确保 student 也抗漂移
- 速度 **13×** 加速,质量(LPIPS/FID)几乎不掉
---
## 4. 实验结果
### 4.1 长视频生成对比(§ 5.2, DL3DV + Tanks-and-Temples)
7 个 baseline:**Yume-1.5、GEN3C、CaM、VMem、SPMem、HY-WorldPlay、GenWarp**。
| 指标 | 含义 | Ours | 第二好 |
|---|---|---:|---|
| **SSIM ↑** | 局部结构相似 | **0.388 / 0.384** | SPMem 0.383 / 0.383 |
| **LPIPS ↓** | 感知距离 | **0.498 / 0.552** | SPMem 0.522 / 0.571 |
| **FID ↓** | Fréchet 距离 | **43.43 / 51.33** | CaM 50.43 / 59.20 |
| **Subjective Quality ↑** | WorldScore 人评 | **44.54 / 43.35** | SPMem 38.32 / 34.41 |
| **Style Consistency ↑** | 首帧 vs 末帧风格 | **87.46 / 85.07** | SPMem 82.79 / 79.68 |
| **Camera Ctrl ↑** | 相机姿态准确 | 64.67 / 63.87 | GEN3C 69.54 / 70.91 |
| **Reprojection Err ↓** | SLAM 验证 3D 一致 | 0.076 / 0.069 | VMem 0.068 / 0.054 |
> 解读:**所有"感知与一致性"指标都最好**(SSIM/LPIPS/FID/Subj/Style)。Camera Ctrl 略输 GEN3C(GEN3C 用刚性 depth warping,精度高但**严重损害生成质量**)。
### 4.2 3D 场景生成对比(§ 5.3)
把所有视频 baseline 都过 **DAv3** 出 3DGS,再渲染评测:
| 方法 | DL3DV LPIPS-G ↓ | DL3DV FID ↓ | T&T LPIPS-G ↓ | T&T Subj ↑ |
|---|---:|---:|---:|---:|
| GEN3C + DAv3 | 0.649 | 99.83 | 0.694 | 5.38 |
| CaM + DAv3 | 0.668 | 94.04 | 0.693 | 9.79 |
| SPMem + DAv3 | 0.625 | 93.56 | 0.666 | 9.95 |
| Ours + DAv3 | 0.603 | 74.39 | 0.648 | 14.42 |
| **Ours Full(微调 DAv3)** | **0.579** | **65.94** | **0.629** | **18.80** |
> **Ours Full > Ours + DAv3** 验证了"在生成数据上微调 DAv3"的必要性。
### 4.3 消融(§ 5.4)— 每个模块都掉一组分
| 配置 | SSIM | Style ↑ | Camera ↑ | Reproj ↓ |
|---|---:|---:|---:|---:|
| **Ours full** | **0.384** | **85.07** | **63.87** | **0.069** |
| w/ Global Point Cloud(融成单一全局) | 0.368 | 82.42 | 49.86 | 0.067 |
| w/ Explicit Corr. Fusion(硬几何融合) | 0.370 | 83.28 | 57.29 | 0.071 |
| w/o FramePack(无时间压缩) | 0.362 | 80.61 | 62.62 | 0.079 |
| w/o Self-Augmentation | 0.363 | **77.98** | **53.92** | 0.066 |
> **去掉 Self-Augmentation** → Style Consistency 暴跌 7 分,Camera Ctrl 暴跌 10 分:**这是论文最关键的单一创新**。
> **融成全局点云** → Camera Ctrl 暴跌 14 分,证实"per-frame 独立"的设计判断正确。
---
## 5. 应用(§ 5.5)
| 应用 | 价值 |
|---|---|
| **交互式 GUI** | 用户在 3D cache 点云上画相机轨迹,实时生成新视角并扩张场景 |
| **野外图像** | 室内/室外/街景任意输入图,都能扩张为大尺度可走的 3D |
| **Embodied AI 仿真** | 导出的 3DGS + mesh **直接进 NVIDIA Isaac Sim**,做物理仿真和机器人训练 |
---
## 6. 关键实现细节(附录 A)
| 项 | 配置 |
|---|---|
| 基模型 | Wan 2.1-14B DiT |
| VAE | Wan 2.1,8× 空间 / 4× 时间下采样,C=16 |
| 分辨率 | 832 × 480 |
| 训练数据 | DL3DV (10K clips) — 用 ViPE 估姿态,DAv3 估深度,Qwen3-VL-8B 写 caption |
| Optimizer | AdamW, lr=3e-5, wd=0.1, bf16 |
| 训练规模 | 64 GB200 GPUs, batch=64, **7,000 iter** |
| Flow Matching | rectified flow + logit-normal t 采样 |
| Inference | FlowUniPC 多步,35 steps + CFG=5.0 |
| 空间记忆参数 | $N_s = 5$, $d = 8$, $\delta = 0.1$ |
| 自增强 | $p_{\text{aug}} = 0.7$, $t \sim \mathcal{U}(0, 0.5)$ |
| 单步时间(80 帧/步) | **194 s** 全模型 / **15 s** DMD 蒸馏版 |
| 3DGS 头下采样 | $k = 2$,Gaussian 数减少 4× |
| 微调 DAv3 | 3,000 段 1 分钟视频,10K iter,lr=5e-5,bs=8 |
---
## 7. 局限性(论文承认)
1. **静态场景** — 不建模动态(人、车、风吹窗帘)。dynamic scene 是明确的 future work
2. **照度不一致** — DL3DV 训练数据帧间曝光不稳,模型继承这一缺陷,会污染 3DGS。建议:用 PPISP 这类网络做照度补偿,或换合成游戏引擎数据
---
## 8. 与 PRISM 的关系(本仓库视角)
### 8.1 共同点
- 都关心"长时空间记忆"
- 都把 3D 表征做成"信息源"而非最终目标(PRISM 的 L2 / Lyra 的 3D cache 都是中间件)
- 都用 3DGS 作为最终稠密表征
### 8.2 根本差异
| 维度 | PRISM | Lyra 2.0 |
|---|---|---|
| 输入 | **真实传感器** (iPhone + ZED) | **单张图像**(可虚构) |
| 输出 | 机器人可查询的 SpatialMemory + 4 层场景图 | 可被 Isaac Sim 加载的 3DGS + mesh |
| 几何源 | RoomPlan / ZED 双目 SLAM 真实测量 | DAv3 单目深度估计 |
| 关注问题 | **lifelong** 一致性、差异检测、巩固 | **生成期**的空间/时间漂移 |
| 是否生成 | ❌ 只重建/记忆 | ✅ 生成(从扩散先验) |
| 适用场景 | 真实部署的机器人 | 仿真训练 / VR / 资产生成 |
### 8.3 互补合作机会
| Lyra 2.0 → PRISM | 用 Lyra 生成的 3DGS 场景**给 PRISM 当训练/仿真环境**;不需要扫真实酒店即可造出 100 间不同布局的酒店房间用于 PRISM 评测 |
|---|---|
| **PRISM → Lyra 2.0** | PRISM 提供"真实 RoomPlan 几何先验",作为 Lyra 起始条件,可能减轻生成式 3D 缺乏物理一致性的问题 |
| **联合** | "真实采集 + 生成式扩展"=PRISM 给出真实房间核心 +Lyra 在房间之外补全走廊、电梯、相邻房间,形成跨房间的整楼层 spatial memory |
### 8.4 对 PRISM 的具体借鉴
1. **"几何只用做路由,不用做合成"** — PRISM 的 L2 ↔ L3 ↔ L4 写入逻辑可借鉴:**L2 几何精度低没关系,只要能挑出"哪个 L3 节点该被更新"即可,真正的 L3 内容来自 L1 高质量原始观测**
2. **Per-frame 独立 vs 全局融合** — PRISM 的 TSDF / OctoMap 是融合的,**易累积漂移**。可考虑保留 keyframe-级独立深度作为"翻案证据"
3. **Self-Augmentation 思路** — 在 PRISM 的"巩固期"(Pipeline D)可借鉴:**让模型用自己之前的不完美 L3 写回,学会自我纠错**
---
## 9. 评分(Lyra 2.0 自己,非 PRISM)
| 维度 | 满分 | Lyra 2.0 | 注 |
|---|---:|---:|---|
| 算法原创性 | 20 | **17** | "几何路由 + canonical coord + self-aug"是清晰的新组合 |
| 工程完整度 | 15 | **15** | GUI + DMD + Isaac Sim 全栈 |
| 真机/真用验证 | 15 | **9** | 演示+对比丰富,但用户研究和落地数据少 |
| 评测严谨度 | 15 | **14** | 7 个 baseline + 4 套指标 + 严格消融 |
| 理论深度 | 10 | **5** | Flow matching + flow-warping 是工程级数学,没新定理 |
| 影响力潜力 | 15 | **12** | NVIDIA 出品 + 接 Isaac Sim,有从研究到产品的明确路径 |
| 计算成本 | 10 | **4** | 64 张 GB200 训练 + 推理 194 s / 段全模型 (DMD 后 15 s),家用消费级不可行 |
| **合计** | **100** | **76** | 高质量基础研究,**显著高于 PRISM 的 62 分** |
---
## 10. 评分坐标:把 Lyra 2.0 与 PRISM 同档比较一次
| 项目 | 技术难度评分 | 行业贡献评分 | 主要差异 |
|---|---:|---:|---|
| **PRISM** (蓝图) | 62 | 48 | 工程模板 + 多模块集成,无真机/无论文/无算法新点 |
| **Lyra 2.0** (NVIDIA 2026) | **76** | **65** (预估) | 有算法新点 + 顶会 + NVIDIA 背书,但**非真实数据生成** |
| OK-Robot (FAIR 2024) | 72 | 70 | 真机大规模部署是杀手锏 |
| ConceptGraphs (CMU 2023) | 67 | 52 | 真机 + ICRA,但无 lifelong |
| HOV-SG (Freiburg 2024) | 64 | 50 | RSS + 分层场景图 |
| Clio (MIT-SPARK 2024) | 70 | 55 | 理论 + 工具链组合 |
> Lyra 2.0 在**视频生成 / 内容创建**赛道处于**当前 SOTA**,这与 PRISM 的"真实空间记忆"赛道**正交但互补**。
---
## 11. 一句话评价
> **"Lyra 2.0 把'生成式 3D'从短片段 demo 推进到'任意长度可走通的世界',核心武器是'几何只用作路由 + 自增强训练'这一对工程哲学。它会成为 2026 年 explorable world generation 这条赛道的事实基线之一。"**
---
## 12. 配套资源
- **PDF 原文**:[`research/lyra2_paper.pdf`](lyra2_paper.pdf) — 13 MB
- **TXT 提取**:[`research/lyra2_paper.txt`](lyra2_paper.txt) — pdftotext -layout 输出,1413 行
- **项目主页**:<https://research.nvidia.com/labs/sil/lyra2/>
- **arXiv**:<https://arxiv.org/abs/2604.13036>
- **相关项目**:Lyra 1 (ICLR 2026), Wan 2.1, Depth Anything v3, FramePack, NVIDIA Isaac Sim
---
**译读版本**:v1.0
**译读日期**:2026-05-16
**译读者**:Code Assistant (基于 PDF 全文 + 公开论文知识)
**配套文件**:
- [`plans/PRISM/comparison.md`](../plans/PRISM/comparison.md) — 同档项目对比综述
- [`plans/PRISM/rate.md`](../plans/PRISM/rate.md) — PRISM 技术难度评分
- [`plans/PRISM/rate_industry.md`](../plans/PRISM/rate_industry.md) — PRISM 行业贡献评分
@@ -0,0 +1,91 @@
---
title: "面向“理解”与“构建”物理世界的AI世界模型:技术综述"
date: 2026-05-20
draft: false
tags: ["调研", "论文综述", "机器人", "综述", "arXiv", "物理"]
categories: ["research"]
---
# 面向“理解”与“构建”物理世界的AI世界模型:技术综述
## 摘要
随着人工智能技术的演进,AI的目标已从文本和二维图像的生成,扩展到了对三维物理规律的掌握。世界模型(World Models)在此过程中扮演了核心角色。本综述基于arXiv上的最新学术论文及GitHub上的前沿开源项目,聚焦于“理解物理世界”与“构建物理世界”两个核心维度,系统梳理国际顶尖研究与中国力量在这一领域的突破与挑战。
---
## 1. 引言
世界模型旨在赋予AI系统对环境动态变化的预测能力。当我们将其置于“物理世界”的语境下,世界模型的研究可以被划分为两大核心命题:
1. **理解物理世界 (Understanding)**:偏向于认知科学与强化学习,关注AI能否抽取出环境中的因果关系、物体持久性、碰撞规律及动力学方程,而不被表象的像素噪音所干扰。
2. **构建物理世界 (Constructing)**:偏向于生成式AI与计算机视觉,关注AI能否作为一种“神经物理引擎”,根据条件(文本、动作、图像)合成出符合物理规律的、高保真的连续时空序列(视频或3D环境)。
---
## 2. 理解物理世界:从表象到因果
理解物理世界要求模型具备对时间动态、空间几何和物理规则的内部表征能力。
### 2.1 隐空间预测与联合嵌入架构 (JEPA)
Yann LeCun 提出的 **JEPAJoint Embedding Predictive Architecture** 是当前“理解物理世界”最具代表性的路线。
* **核心思想**:真实世界包含海量不可预测的细节(如树叶的随机摆动)。JEPA(如 **V-JEPA**)放弃了在像素层面的重建,转而在抽象的隐空间中预测视频的未来状态或缺失部分。
* **物理意义**:这种设计强迫模型学习高级语义和宏观物理规律(如重力、物体运动轨迹),是AI走向常识理解的关键。
* **开源生态**Meta FAIR 在 GitHub 上的 `facebookresearch/jepa` 项目是目前该领域的基石。
### 2.2 具身智能与基于动作的物理理解
在强化学习和机器人领域,理解物理世界的最佳方式是“交互”。
* **Dreamer 系列 (DreamerV3)**Danijar Hafner 团队在 arXiv 上发表的多篇论文确立了基于模型的强化学习(MBRL)范式。Dreamer在内部构建一个“想象的世界模型”,在这个世界中推演动作导致的物理后果,从而以极高的样本效率学习复杂的物理控制。
* **自动驾驶的物理认知 (Wayve LINGO-1)**Wayve 等公司不仅让模型生成视频,还让模型用语言解释为什么某辆车会停下、前方的物理障碍是什么,实现了对物理场景的可解释性理解。
---
## 3. 构建物理世界:神经物理引擎的崛起
构建物理世界通常通过大规模视频生成(Video Generation)或3D场景生成来实现。
### 3.1 扩散与Transformer的结合 (DiT)
OpenAI 的 **Sora** 证明了,当扩散模型结合Transformer(DiT)并扩大规模时,模型能够“涌现”出令人惊叹的构建物理世界的能力。
* **涌现的物理属性**:保持3D一致性(相机移动时物体结构不变)、物体持久性(被遮挡后再次出现)以及简单的流体和固体交互。
* **技术实质**:Sora 本质上是通过海量数据“拟合”了视觉上的物理规律(Visual Physics),它在构建视觉逼真的世界方面取得了空前成功。
### 3.2 中国力量在物理世界构建中的突破
中国科研机构与企业在“构建物理世界”方向(即对标Sora)上表现出了极强的爆发力,并在解决物理一致性上提出了独特的中国方案:
* **可灵 (Kling) 的 3D VAE 架构**:快手团队通过自研的3D时空联合注意力机制,更好地处理了时间轴上的物理连续性,其生成的物理互(如吃面条、流体倾倒)在视觉上表现出了高度的真实感。
* **Vidu 与 U-ViT**:生数科技联合清华大学基于U-ViT架构构建的世界模型,在单次生成长视频及多镜头语言的物理连贯性上具有独特优势。
* **CogVideoX 的 3D Causal VAE**:智谱AI在arXiv上开源的CogVideoX,通过因果卷积和专家并行DiT设计,大幅降低了构建三维连续物理世界的算力门槛。
### 3.3 GitHub 开源复现与生态
中国开源社区极大推动了构建物理世界技术的普及:
* **Open-Sora** (`hpcaitech/Open-Sora`):潞晨科技提供了全面的DiT模型训练方案,专注于长时空一致性的突破。
* **Open-Sora-Plan** (`PKU-YuanGroup/Open-Sora-Plan`):北京大学团队深度开源了从数据清洗到物理运动表征控制的全套代码,成为研究如何让模型更好地“构建物理规律”的核心阵地。
---
## 4. 核心对比:“理解”与“构建”的碰撞
在当前 arXiv 的研究趋势中,“理解”与“构建”存在显著的路线差异与融合趋势:
| 维度 | 理解物理世界 (如 JEPA, Dreamer) | 构建物理世界 (如 Sora, Kling, Open-Sora) |
| :--- | :--- | :--- |
| **主要目标** | 提取因果规律、特征表示、策略规划 | 生成高保真视觉内容、模拟视觉现象 |
| **工空间** | 抽象的隐空间 (Latent Space) | 像素空间或浅层压缩空间 (Pixel / Low-dim Latent) |
| **对噪音的容忍度** | 高(主动过滤细节噪音) | 低(必须生成所有细节,算力开销大) |
| **物理规律真实性**| 侧重逻辑和动力学的正确性 | 侧重视觉的合理性(易产生物理幻觉) |
| **主要应用** | 机器人、具身智能、自动驾驶决策 | 影视生成、多媒体创作、游戏引擎预渲染 |
---
## 5. 挑战与未来方向
根据 arXiv 上对 Sora 等模型的逆向工程和批评分析,当前领域存在以下严峻挑战:
1. **“视觉物理”与“真实物理”的鸿沟 (Hallucination of Physics)**
当前的生成式世界模型(如Sora)经常会产生违背常理的物理幻觉(如椅子凭空变形、水倒流)。这是因为它们是纯数据驱动的模式匹配,尚未真正掌握牛顿力学或流体动力学方程。
2. **结合物理引擎的混合世界模型**
未来的发展趋势是结合传统物理引擎(如 Unreal Engine, Unity)与神经网络。通过引入物理先验(Physical Priors),强制生成过程服从质量守恒、动量守恒等硬性规则。
3. **闭环系统:从构建到理解的统一**
AI不仅需要生成(构建)一段视频,还需要从视频中推断(理解)背后的受情况,最终形成既能输出控制策略、又能输出视觉模拟的统一通用世界模型 (Universal World Model)。
---
## 6. 结论
AI 世界模型正处于从单纯的数据拟合向物理规律认知进阶的拐点。在**“理解物理世界”**方面,以LeCun的JEPA为代表的隐空间路线为AI提供了高效的认知框架;在**“构建物理世界”**方面,基于DiT架构的生成式模型(如Sora、Kling)展现了令人震撼的“视觉物理引擎”潜力。中国团队不仅在商业产品上紧跟前沿,更通过如 `Open-Sora` 等项目繁荣了GitHub开源生态。未来,将强化学习的因果推理能力与扩散模型的高维构建能力相融合,真正打通“理解”与“构建”的壁垒,将是实现具身智能和AGI的终极路径。
@@ -0,0 +1,74 @@
---
title: "AI世界模型(World Models)技术综述"
date: 2026-05-20
draft: false
tags: ["调研", "论文综述", "综述", "arXiv", "物理", "规划"]
categories: ["research"]
---
# AI世界模型(World Models)技术综述
## 1. 引言
“世界模型”(World Model)这一概念最初在认知科学和强化学习中被提出,近年来随着生成式AI的爆发,它成为了迈向通用人工智能(AGI)的核心路径之一。世界模型旨在让AI不仅能生成文本或像素,更能“理解”和“模拟”现实世界的物理规律、因果关系和时空一致性。
本综述基于arXiv上的最新学术论文以及GitHub上的开源项目动态,对当前国际与中国在AI世界模型领域的发展进行系统梳理和对比分析。
## 2. 国际主流研究与开源进展
国际顶尖机构在世界模型的探索上呈现出多模态、大模型与强化学习深度结合的趋势。
### 2.1 理论基础与联合嵌入预测架构 (JEPA)
Yann LeCun 提出了基于目标驱动的AI架构(Objective-Driven AI),其中的核心就是世界模型。其团队(Meta FAIR)在GitHub上开源了 **I-JEPA****V-JEPA**。这类架构通过在隐空间(Latent Space)中预测缺失的视频或图像片段,让模型学习世界的高级语义和动态规律,而过滤掉不必要的像素级噪音。
* **相关项目**: `facebookresearch/jepa`, `facebookresearch/v-jepa`
### 2.2 视频生成与物理世界模拟
OpenAI的 **Sora** 是生成式世界模型的一个里程碑。Sora采用Diffusion Transformer (DiT) 架构,证明了当模型规模(Scaling Law)足够大时,AI能够在一定程度上涌现出对3D一致性、物体持久性和基础物理规律的模拟能力。此外,Runway的Gen-2、Pika等产品也在商业和应用层面对现实世界模拟进行了探索。
* **技术关键词**: DiT (Diffusion Transformer), Space-Time Latent Patches.
### 2.3 具身智能与自动驾驶世界模型
在自动驾驶和具身智能(Embodied AI)领域,英国自动驾驶公司Wayve提出了 **GAIA-1****LINGO-1**,这是一个生成式自动驾驶世界模型,能够根据文本、视频和动作条件生成未来的驾驶场景。而在强化学习领域,Danijar Hafner等人提出的 **Dreamer** 系列(目前演进到DreamerV3)通过在想象的隐空间世界模型中进行策略训练,极大地提高了样本效率。
* **相关项目**: `danijar/dreamerv3`
## 3. 中国在世界模型领域的研究与发展
中国科研机构和科技企业在世界模型,尤其是基于视频生成的物理世界模拟和开源生态建设上,展现出了极强的追赶和创新能力。
### 3.1 视频生成商业与技术双轮驱动
中国业在视频生成方向推出了多个对标Sora的重磅产品,这些模型不仅在生成时长和分辨率上取得了突破,更在物理规律的遵循上进行了深度优化。
* **Vidu** (生数科技 & 清华大学): 采用U-ViT架构,强调一键生成长视频及多镜头语言的理解。
* **Kling (可灵)** (快手): 采用了3D时空联合注意力机制(3D VAE),能较好地模拟复杂物理动作和材质变化。
* **CogVideoX** (智谱AI): 开源了多尺寸版本,通过结合3D Causal VAE和专家DiT结构,大幅降低了推理和训练成本,相关论文在arXiv上引起广泛关注。
### 3.2 繁荣的GitHub开源生态
相比于OpenAI的闭源,中国的高校和社区在开源世界模型复现上做出了巨大贡献。
* **Open-Sora** (`hpcaitech/Open-Sora`): 潞晨科技开源的Sora全面复现方案,大幅降低了DiT模型的训练门槛。
* **Open-Sora-Plan** (`PKU-YuanGroup/Open-Sora-Plan`): 北京大学袁粒团队牵头的开源项目,提供了详细的数据清洗、模型架构和训练代码,成为GitHub上极具影响力的世界模型社区资源。
## 4. 核心技术路径对比
当前世界模型的发展主要存在两条并行的技术路径:
1. **基于生成的全像素模拟 (Generative World Models)**
* **代表**: Sora, Open-Sora, CogVideoX
* **方法**: 主要基于Diffusion或Autoregressive模型,直接在像素或低维像素潜空间(Latent Space)进行未来帧的生成。
* **优势**: 直观,可解释性强(所见即所得),能直接用于影视和多媒体创作。
* **劣势**: 极其消耗算力,难以保证长时间的严格物理规律(常出现穿模、反直觉物理现象)。
2. **基于隐状态预测的抽象模型 (Latent Predictive World Models)**
* **代表**: JEPA系列, Dreamer系列
* **方法**: 不重建具体像素,而是预测未来状态的抽象表征。
* **优势**: 计算效率高,更容易学习到核心因果关系和动作条件(Action-conditioned),非常适合具身智能和机器人。
* **劣势**: 难以直接生成高保真视觉结果以供人类检查。
## 5. 挑战与未来展望
综合arXiv上的最新研究,世界模型在迈向成熟的道路上仍面临以下挑战:
* **物理因果律的幻觉 (Hallucination of Physics)**: 当前模型更多是在“拟合”物理规律的外观,而非“理解”物理方程。玻璃破碎、流体动力学等复杂场景依然容易出错。
* **长时一致性 (Long-horizon Consistency)**: 生成或预测跨度超过几分钟的事件时,实体特征和环境状态容易发生偏移。
* **高质量数据集缺乏**: 带有丰富物理交互(如碰撞、形变)的高质量视频数据以及带有高质量文本标注的数据极其稀缺。
未来,结合3D引擎(如Unreal Engine)渲染的合成数据,以及结合隐空间预测(JEPA路线)与像素生成(Diffusion路线)的混合架构,将是世界模型发展的重要趋势。
## 6. 结论
从国际视角来看,世界模型正从单纯的视觉生成向“行动条件预测”和“具身智能”演进。Meta、OpenAI和Wayve等分别从预测架构、视觉生成和自动驾驶三个维度定义了世界模型。而在中国,学术界与产业界深度结合,凭借Vidu、Kling等惊艳的商业产品,以及Open-Sora等蓬勃发展的GitHub开源生态,正迅速缩小差距甚至在某些垂直领域实现超越。世界模型不仅是视频生成的底层引擎,更是通往拥有常识与推理能力的AGI的关键踏板。