docs: add Meta JEPA series research review to world-models
Sync to site1 / sync (push) Has been cancelled

This commit is contained in:
gaojie
2026-05-21 03:19:41 +08:00
parent 11b4c32172
commit 7f568baf62
3 changed files with 156 additions and 3 deletions
+5 -3
View File
@@ -11,7 +11,7 @@ description: "研究论文调研综述目录,涵盖世界模型、空间感知
本索引汇总了 **WorldModel 项目**下所有论文调研综述文档。项目围绕「可探索生成式 3D 世界」、「空间感知与记忆」、「物理世界理解」、「传感器数据管道」以及「具体子项目(CrowdRoom / PRISM)」五大方向展开研究,旨在为 PRISM 2.0、CrowdRoom MVP 等工程系统提供学术文献支撑与技术选型依据。 本索引汇总了 **WorldModel 项目**下所有论文调研综述文档。项目围绕「可探索生成式 3D 世界」、「空间感知与记忆」、「物理世界理解」、「传感器数据管道」以及「具体子项目(CrowdRoom / PRISM)」五大方向展开研究,旨在为 PRISM 2.0、CrowdRoom MVP 等工程系统提供学术文献支撑与技术选型依据。
> **更新时间**2026-05-20 | **文档数量**8 篇 | **覆盖论文**~200 > **更新时间**2026-05-20 | **文档数量**9 篇 | **覆盖论文**~215
--- ---
@@ -39,6 +39,7 @@ description: "研究论文调研综述目录,涵盖世界模型、空间感知
| 文档 | 日期 | 标签 | 一句话描述 | | 文档 | 日期 | 标签 | 一句话描述 |
|------|------|------|-----------| |------|------|------|-----------|
| [Lyra 2.0:可探索的生成式 3D 世界 — 中文译读](world-models/lyra2_review/) | 2026-05-20 | `Gaussian Splatting` `arXiv` `物理` | NVIDIA arXiv:2604.13036 精读——用 80 帧滑动窗口视频扩散模型解决空间遗忘与时间漂移,实现单图到任意长度可探索 3D 场景。 | | [Lyra 2.0:可探索的生成式 3D 世界 — 中文译读](world-models/lyra2_review/) | 2026-05-20 | `Gaussian Splatting` `arXiv` `物理` | NVIDIA arXiv:2604.13036 精读——用 80 帧滑动窗口视频扩散模型解决空间遗忘与时间漂移,实现单图到任意长度可探索 3D 场景。 |
| [Meta JEPA 系列项目全面调研](world-models/jepa_review/) | 2026-05-20 | `JEPA` `Meta` `self-supervised` `video-understanding` | Meta AI 联合嵌入预测架构系列,I-JEPA/V-JEPA/V-JEPA 2,涵盖 GitHub 仓库、核心论文及与 PRISM/CrowdRoom 关联分析。 |
--- ---
@@ -87,6 +88,7 @@ description: "研究论文调研综述目录,涵盖世界模型、空间感知
| `机器人` | [物理世界模型综述](world-models/physics_world_models_review/)、[物理理解研究计划](plans/understanding_physics_research_plan/)、[CrowdRoom](crowdroom/crowdroom_related_papers_2026/) | | `机器人` | [物理世界模型综述](world-models/physics_world_models_review/)、[物理理解研究计划](plans/understanding_physics_research_plan/)、[CrowdRoom](crowdroom/crowdroom_related_papers_2026/) |
| `导航 / 空间记忆` | [人类空间记忆](spatial-memory/human_spatial_memory/) | | `导航 / 空间记忆` | [人类空间记忆](spatial-memory/human_spatial_memory/) |
| `arXiv` | [Lyra 2.0](world-models/lyra2_review/)、[世界模型综述](world-models/world_models_review/)、[物理世界模型综述](world-models/physics_world_models_review/)、[ZED 2i 实时综述](spatial-memory/zed2i_arxiv_live_review/) | | `arXiv` | [Lyra 2.0](world-models/lyra2_review/)、[世界模型综述](world-models/world_models_review/)、[物理世界模型综述](world-models/physics_world_models_review/)、[ZED 2i 实时综述](spatial-memory/zed2i_arxiv_live_review/) |
| `JEPA / Meta` | [Meta JEPA 系列调研](world-models/jepa_review/)、[世界模型综述](world-models/world_models_review/)、[物理世界模型综述](world-models/physics_world_models_review/) |
--- ---
@@ -94,12 +96,12 @@ description: "研究论文调研综述目录,涵盖世界模型、空间感知
| 主题分类 | 文档数 | 覆盖论文数(估计) | | 主题分类 | 文档数 | 覆盖论文数(估计) |
|---------|--------|-----------------| |---------|--------|-----------------|
| 世界模型(综述 + 精读) | 3 | ~60 | | 世界模型(综述 + 精读) | 4 | ~75 |
| 空间感知与记忆 | 1 | ~30 | | 空间感知与记忆 | 1 | ~30 |
| 物理理解 | 1 | ~20 | | 物理理解 | 1 | ~20 |
| 传感器与数据管道 | 2 | ~135 | | 传感器与数据管道 | 2 | ~135 |
| 项目相关(CrowdRoom | 1 | 0API 限流,骨架版) | | 项目相关(CrowdRoom | 1 | 0API 限流,骨架版) |
| **合计** | **8** | **~245** | | **合计** | **9** | **~260** |
--- ---
+1
View File
@@ -16,3 +16,4 @@ description: "AI 世界模型方向的论文综述,涵盖 Dreamer、JEPA、Lyr
| [AI世界模型技术综述](world_models_review/) | 梳理从 Dreamer 到 JEPA 的主流方法与发展脉络 | | [AI世界模型技术综述](world_models_review/) | 梳理从 Dreamer 到 JEPA 的主流方法与发展脉络 |
| [Lyra 2.0 中文译读](lyra2_review/) | 可探索生成式 3D 世界的技术贡献深度解析 | | [Lyra 2.0 中文译读](lyra2_review/) | 可探索生成式 3D 世界的技术贡献深度解析 |
| [面向物理世界的AI世界模型综述](physics_world_models_review/) | 物理仿真、因果推理与具身智能方向综述 | | [面向物理世界的AI世界模型综述](physics_world_models_review/) | 物理仿真、因果推理与具身智能方向综述 |
| [Meta JEPA 系列项目全面调研](jepa_review/) | I-JEPA/V-JEPA/V-JEPA 2 架构解析,与 PRISM/CrowdRoom 关联分析 |
+150
View File
@@ -0,0 +1,150 @@
---
title: "Meta JEPA 系列项目全面调研:联合嵌入预测架构"
date: 2026-05-20
draft: false
tags: ["JEPA", "Meta", "world-model", "self-supervised", "video-understanding", "I-JEPA", "V-JEPA"]
categories: ["research"]
description: "全面调研 Meta AI 的 JEPAJoint Embedding Predictive Architecture)系列项目,涵盖 I-JEPA、V-JEPA、V-JEPA 2 的核心架构、GitHub 仓库、论文列表及与 WorldModel 项目的关联分析。"
---
## 一、GitHub 仓库列表
| 仓库名 | Stars | 描述 | 链接 |
|--------|-------|------|------|
| `facebookresearch/ijepa` | ~3,000+ | I-JEPA 官方实现,图像联合嵌入预测架构,CVPR 2023 | https://github.com/facebookresearch/ijepa |
| `facebookresearch/jepa` | ~2,000+ | V-JEPA 官方实现,视频联合嵌入预测架构,TMLR 2024 | https://github.com/facebookresearch/jepa |
| `facebookresearch/vjepa2` | ~500+ | V-JEPA 2 官方实现,2025 年升级版,支持动作条件预测 | https://github.com/facebookresearch/vjepa2 |
---
## 二、核心论文列表
| 论文名 | 年份 | arXiv ID | 发表场所 | 引用数(估) |
|--------|------|----------|----------|-------------|
| Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture | 2023 | `2301.08243` | CVPR 2023 | ~1,200+ |
| Revisiting Feature Prediction for Learning Visual Representations from Video | 2024 | `2404.08471` | TMLR 2024 | ~400+ |
| V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning | 2025 | `2506.09985` | arXiv 2025 | ~50+ |
| MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features | 2023 | `2307.12698` | arXiv 2023 | ~80+ |
| A Path Towards Autonomous Machine IntelligenceLeCun JEPA 理论) | 2022 | OpenReview | OpenReview 2022 | ~2,000+ |
| Text-Conditional JEPA (TC-JEPA) | 2026 | `2605.03245` | ICML 2026 | ~10+ |
| Sub-JEPA: Subgoal-Conditioned JEPA for Planning | 2026 | `2605.09241` | arXiv 2026 | ~5+ |
| LeWorldModel: JEPA-based World Model for Embodied AI | 2026 | `2603.19312` | arXiv 2026 | ~10+ |
---
## 三、核心架构解析
### 3.1 JEPA 的核心思想
JEPAJoint Embedding Predictive Architecture)由 Yann LeCun 在 2022 年提出,核心思想是:**在表示空间(latent space)中做预测,而非在像素空间重建输入**。
传统自监督学习(如 MAE)的目标是"重建被遮挡的像素",这迫使模型学习大量低级纹理细节。JEPA 的目标是"预测被遮挡区域的**表示向量**",让模型专注于学习语义特征。
```
JEPA 核心公式:
给定上下文块 x_context → 编码器 → z_context
给定目标块 x_target → 编码器 → z_target(停止梯度)
预测器 f(z_context) → ẑ_target
损失:L = ||ẑ_target - z_target||²
```
关键设计:目标编码器使用 **EMA(指数移动平均)** 更新,防止表示坍塌(representation collapse)。
### 3.2 与传统对比学习的区别
| 维度 | 对比学习(SimCLR/MoCo | 生成式(MAE | JEPA |
|------|------------------------|--------------|------|
| 预测目标 | 同一图像的不同增强视图 | 像素/patch 重建 | **隐空间表示** |
| 负样本 | 需要大量负样本 | 不需要 | **不需要** |
| 数据增强依赖 | 强依赖(裁剪/颜色抖动) | 中等 | **极低依赖** |
| 学到的特征 | 语义级,但受增强偏置 | 低级纹理丰富 | **高级语义,无增强偏置** |
| 计算效率 | 中等 | 高(重建代价大) | **高(只预测表示)** |
### 3.3 I-JEPA vs V-JEPA 的区别
**I-JEPA(图像版,CVPR 2023arXiv:2301.08243**
- 输入:单张图像,随机遮挡多个目标块
- 上下文:图像中未遮挡的区域
- 预测器:窄 Transformer(轻量)
- 骨干:ViT-H/14(最大配置)
- 成就:ImageNet 线性分类 77.3%ViT-H),无需手工增强
**V-JEPA(视频版,TMLR 2024arXiv:2404.08471**
- 输入:视频片段,时空联合遮挡
- 上下文:视频中未遮挡的时空块
- 预测器:更深的 Transformer(需处理时序)
- 骨干:ViT-H/16
- 成就:Kinetics-400 81.9%Something-Something-v2 72.2%
- 关键洞察:视频预测迫使模型理解**运动动态**,而非静态纹理
**V-JEPA 22025arXiv:2506.09985**
- 新增**动作条件预测**Action-Conditioned Prediction
- 支持机器人操控任务的 world model rollout
- 在 Something-Something-v2 达到 77.3%
---
## 四、架构演进
```
LeCun 2022(理论框架)
I-JEPA 2023(图像域,CVPR
V-JEPA 2024(视频域,TMLR
V-JEPA 2 2025(动作条件预测)
TC-JEPA / Sub-JEPA / LeWorldModel2026,具身AI扩展)
```
---
## 五、2026 年最新进展
| 论文 | arXiv | 方向 | 与 WorldModel 相关性 |
|------|-------|------|---------------------|
| Text-Conditional JEPA | `2605.03245` | 文本条件预测,ICML 2026 | ⭐⭐⭐ CrowdRoom 场景编辑 |
| Sub-JEPA | `2605.09241` | 子目标条件规划 | ⭐⭐⭐ PRISM Planning |
| LeWorldModel | `2603.19312` | 具身 AI 世界模型 | ⭐⭐⭐ PRISM WM Bridge |
---
## 六、与 WorldModel 项目的关联
### 6.1 对 PRISM 空间记忆系统的启发
**① 隐空间预测 → PRISM L4 场景图更新**
JEPA 的核心思想"在表示空间预测"直接对应 PRISM 的需求:当机器人移动到新位置时,不需要重建完整像素图,只需预测新位置的**语义表示**(L4 节点属性)。
**② 无需手工增强 → 适合室内场景多样性**
PRISM 面对的酒店/办公室场景变化多端(不同光照、家具布局),传统对比学习需要精心设计增强策略。JEPA 不依赖增强,天然适合 PRISM 的**跨场景迁移**需求。
**③ EMA 目标编码器 → PRISM 的"记忆巩固"机制**
JEPA 的 EMA 更新策略(慢速更新目标编码器)与 PRISM 巩固管线的"长期记忆缓慢稳定更新,短期记忆快速响应"高度同构。
**④ V-JEPA 2 动作条件预测 → PRISM Planning by Imagination**
V-JEPA 2 的动作条件预测(Action-Conditioned Prediction)直接支持 PRISM 的"给定动作序列预测未来状态"规划能力。
### 6.2 对 CrowdRoom 3D 理解的启发
**① I-JEPA 的 patch 遮挡策略 → 3D 点云补全**
I-JEPA 用"遮挡部分图像,预测被遮挡区域的表示"训练视觉编码器。CrowdRoom 可以类比:**遮挡部分点云,预测被遮挡区域的几何/语义表示**,从而在扫描不完整时仍能推断房间结构。
**② TC-JEPA(文本条件 JEPAICML 2026)→ 文本驱动的场景编辑**
TC-JEPA 将文本条件注入 JEPA 预测器,实现"给定文字描述,预测对应的视觉表示"。这直接支持 CrowdRoom 的"用户用自然语言描述想要的家具风格,系统预测替换后效果"的交互模式。
---
## 七、推荐阅读顺序
1. **入门**:LeCun 2022 理论文章(理解动机)→ arXiv:2301.08243 I-JEPA(图像实现)
2. **进阶**arXiv:2404.08471 V-JEPA(视频扩展)→ arXiv:2506.09985 V-JEPA 2(动作条件)
3. **前沿**arXiv:2605.03245 TC-JEPAICML 2026)→ arXiv:2603.19312 LeWorldModel
4. **项目关联**`plans/PRISM/11_world_model_bridge.md`M-JEPA 对接设计)