diff --git a/research/index.md b/research/index.md index e1d6349..1bde34a 100644 --- a/research/index.md +++ b/research/index.md @@ -11,7 +11,7 @@ description: "研究论文调研综述目录,涵盖世界模型、空间感知 本索引汇总了 **WorldModel 项目**下所有论文调研综述文档。项目围绕「可探索生成式 3D 世界」、「空间感知与记忆」、「物理世界理解」、「传感器数据管道」以及「具体子项目(CrowdRoom / PRISM)」五大方向展开研究,旨在为 PRISM 2.0、CrowdRoom MVP 等工程系统提供学术文献支撑与技术选型依据。 -> **更新时间**:2026-05-20 | **文档数量**:8 篇 | **覆盖论文**:~200 篇 +> **更新时间**:2026-05-20 | **文档数量**:9 篇 | **覆盖论文**:~215 篇 --- @@ -39,6 +39,7 @@ description: "研究论文调研综述目录,涵盖世界模型、空间感知 | 文档 | 日期 | 标签 | 一句话描述 | |------|------|------|-----------| | [Lyra 2.0:可探索的生成式 3D 世界 — 中文译读](world-models/lyra2_review/) | 2026-05-20 | `Gaussian Splatting` `arXiv` `物理` | NVIDIA arXiv:2604.13036 精读——用 80 帧滑动窗口视频扩散模型解决空间遗忘与时间漂移,实现单图到任意长度可探索 3D 场景。 | +| [Meta JEPA 系列项目全面调研](world-models/jepa_review/) | 2026-05-20 | `JEPA` `Meta` `self-supervised` `video-understanding` | Meta AI 联合嵌入预测架构系列,I-JEPA/V-JEPA/V-JEPA 2,涵盖 GitHub 仓库、核心论文及与 PRISM/CrowdRoom 关联分析。 | --- @@ -87,6 +88,7 @@ description: "研究论文调研综述目录,涵盖世界模型、空间感知 | `机器人` | [物理世界模型综述](world-models/physics_world_models_review/)、[物理理解研究计划](plans/understanding_physics_research_plan/)、[CrowdRoom](crowdroom/crowdroom_related_papers_2026/) | | `导航 / 空间记忆` | [人类空间记忆](spatial-memory/human_spatial_memory/) | | `arXiv` | [Lyra 2.0](world-models/lyra2_review/)、[世界模型综述](world-models/world_models_review/)、[物理世界模型综述](world-models/physics_world_models_review/)、[ZED 2i 实时综述](spatial-memory/zed2i_arxiv_live_review/) | +| `JEPA / Meta` | [Meta JEPA 系列调研](world-models/jepa_review/)、[世界模型综述](world-models/world_models_review/)、[物理世界模型综述](world-models/physics_world_models_review/) | --- @@ -94,12 +96,12 @@ description: "研究论文调研综述目录,涵盖世界模型、空间感知 | 主题分类 | 文档数 | 覆盖论文数(估计) | |---------|--------|-----------------| -| 世界模型(综述 + 精读) | 3 | ~60 | +| 世界模型(综述 + 精读) | 4 | ~75 | | 空间感知与记忆 | 1 | ~30 | | 物理理解 | 1 | ~20 | | 传感器与数据管道 | 2 | ~135 | | 项目相关(CrowdRoom) | 1 | 0(API 限流,骨架版) | -| **合计** | **8** | **~245** | +| **合计** | **9** | **~260** | --- diff --git a/research/world-models/index.md b/research/world-models/index.md index 3d7b1d3..aaf99c1 100644 --- a/research/world-models/index.md +++ b/research/world-models/index.md @@ -16,3 +16,4 @@ description: "AI 世界模型方向的论文综述,涵盖 Dreamer、JEPA、Lyr | [AI世界模型技术综述](world_models_review/) | 梳理从 Dreamer 到 JEPA 的主流方法与发展脉络 | | [Lyra 2.0 中文译读](lyra2_review/) | 可探索生成式 3D 世界的技术贡献深度解析 | | [面向物理世界的AI世界模型综述](physics_world_models_review/) | 物理仿真、因果推理与具身智能方向综述 | +| [Meta JEPA 系列项目全面调研](jepa_review/) | I-JEPA/V-JEPA/V-JEPA 2 架构解析,与 PRISM/CrowdRoom 关联分析 | diff --git a/research/world-models/jepa_review.md b/research/world-models/jepa_review.md new file mode 100644 index 0000000..e6746dd --- /dev/null +++ b/research/world-models/jepa_review.md @@ -0,0 +1,150 @@ +--- +title: "Meta JEPA 系列项目全面调研:联合嵌入预测架构" +date: 2026-05-20 +draft: false +tags: ["JEPA", "Meta", "world-model", "self-supervised", "video-understanding", "I-JEPA", "V-JEPA"] +categories: ["research"] +description: "全面调研 Meta AI 的 JEPA(Joint Embedding Predictive Architecture)系列项目,涵盖 I-JEPA、V-JEPA、V-JEPA 2 的核心架构、GitHub 仓库、论文列表及与 WorldModel 项目的关联分析。" +--- + +## 一、GitHub 仓库列表 + +| 仓库名 | Stars | 描述 | 链接 | +|--------|-------|------|------| +| `facebookresearch/ijepa` | ~3,000+ | I-JEPA 官方实现,图像联合嵌入预测架构,CVPR 2023 | https://github.com/facebookresearch/ijepa | +| `facebookresearch/jepa` | ~2,000+ | V-JEPA 官方实现,视频联合嵌入预测架构,TMLR 2024 | https://github.com/facebookresearch/jepa | +| `facebookresearch/vjepa2` | ~500+ | V-JEPA 2 官方实现,2025 年升级版,支持动作条件预测 | https://github.com/facebookresearch/vjepa2 | + +--- + +## 二、核心论文列表 + +| 论文名 | 年份 | arXiv ID | 发表场所 | 引用数(估) | +|--------|------|----------|----------|-------------| +| Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture | 2023 | `2301.08243` | CVPR 2023 | ~1,200+ | +| Revisiting Feature Prediction for Learning Visual Representations from Video | 2024 | `2404.08471` | TMLR 2024 | ~400+ | +| V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning | 2025 | `2506.09985` | arXiv 2025 | ~50+ | +| MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features | 2023 | `2307.12698` | arXiv 2023 | ~80+ | +| A Path Towards Autonomous Machine Intelligence(LeCun JEPA 理论) | 2022 | OpenReview | OpenReview 2022 | ~2,000+ | +| Text-Conditional JEPA (TC-JEPA) | 2026 | `2605.03245` | ICML 2026 | ~10+ | +| Sub-JEPA: Subgoal-Conditioned JEPA for Planning | 2026 | `2605.09241` | arXiv 2026 | ~5+ | +| LeWorldModel: JEPA-based World Model for Embodied AI | 2026 | `2603.19312` | arXiv 2026 | ~10+ | + +--- + +## 三、核心架构解析 + +### 3.1 JEPA 的核心思想 + +JEPA(Joint Embedding Predictive Architecture)由 Yann LeCun 在 2022 年提出,核心思想是:**在表示空间(latent space)中做预测,而非在像素空间重建输入**。 + +传统自监督学习(如 MAE)的目标是"重建被遮挡的像素",这迫使模型学习大量低级纹理细节。JEPA 的目标是"预测被遮挡区域的**表示向量**",让模型专注于学习语义特征。 + +``` +JEPA 核心公式: + 给定上下文块 x_context → 编码器 → z_context + 给定目标块 x_target → 编码器 → z_target(停止梯度) + 预测器 f(z_context) → ẑ_target + 损失:L = ||ẑ_target - z_target||² +``` + +关键设计:目标编码器使用 **EMA(指数移动平均)** 更新,防止表示坍塌(representation collapse)。 + +### 3.2 与传统对比学习的区别 + +| 维度 | 对比学习(SimCLR/MoCo) | 生成式(MAE) | JEPA | +|------|------------------------|--------------|------| +| 预测目标 | 同一图像的不同增强视图 | 像素/patch 重建 | **隐空间表示** | +| 负样本 | 需要大量负样本 | 不需要 | **不需要** | +| 数据增强依赖 | 强依赖(裁剪/颜色抖动) | 中等 | **极低依赖** | +| 学到的特征 | 语义级,但受增强偏置 | 低级纹理丰富 | **高级语义,无增强偏置** | +| 计算效率 | 中等 | 高(重建代价大) | **高(只预测表示)** | + +### 3.3 I-JEPA vs V-JEPA 的区别 + +**I-JEPA(图像版,CVPR 2023,arXiv:2301.08243)**: +- 输入:单张图像,随机遮挡多个目标块 +- 上下文:图像中未遮挡的区域 +- 预测器:窄 Transformer(轻量) +- 骨干:ViT-H/14(最大配置) +- 成就:ImageNet 线性分类 77.3%(ViT-H),无需手工增强 + +**V-JEPA(视频版,TMLR 2024,arXiv:2404.08471)**: +- 输入:视频片段,时空联合遮挡 +- 上下文:视频中未遮挡的时空块 +- 预测器:更深的 Transformer(需处理时序) +- 骨干:ViT-H/16 +- 成就:Kinetics-400 81.9%,Something-Something-v2 72.2% +- 关键洞察:视频预测迫使模型理解**运动动态**,而非静态纹理 + +**V-JEPA 2(2025,arXiv:2506.09985)**: +- 新增**动作条件预测**(Action-Conditioned Prediction) +- 支持机器人操控任务的 world model rollout +- 在 Something-Something-v2 达到 77.3% + +--- + +## 四、架构演进 + +``` +LeCun 2022(理论框架) + ↓ +I-JEPA 2023(图像域,CVPR) + ↓ +V-JEPA 2024(视频域,TMLR) + ↓ +V-JEPA 2 2025(动作条件预测) + ↓ +TC-JEPA / Sub-JEPA / LeWorldModel(2026,具身AI扩展) +``` + +--- + +## 五、2026 年最新进展 + +| 论文 | arXiv | 方向 | 与 WorldModel 相关性 | +|------|-------|------|---------------------| +| Text-Conditional JEPA | `2605.03245` | 文本条件预测,ICML 2026 | ⭐⭐⭐ CrowdRoom 场景编辑 | +| Sub-JEPA | `2605.09241` | 子目标条件规划 | ⭐⭐⭐ PRISM Planning | +| LeWorldModel | `2603.19312` | 具身 AI 世界模型 | ⭐⭐⭐ PRISM WM Bridge | + +--- + +## 六、与 WorldModel 项目的关联 + +### 6.1 对 PRISM 空间记忆系统的启发 + +**① 隐空间预测 → PRISM L4 场景图更新** + +JEPA 的核心思想"在表示空间预测"直接对应 PRISM 的需求:当机器人移动到新位置时,不需要重建完整像素图,只需预测新位置的**语义表示**(L4 节点属性)。 + +**② 无需手工增强 → 适合室内场景多样性** + +PRISM 面对的酒店/办公室场景变化多端(不同光照、家具布局),传统对比学习需要精心设计增强策略。JEPA 不依赖增强,天然适合 PRISM 的**跨场景迁移**需求。 + +**③ EMA 目标编码器 → PRISM 的"记忆巩固"机制** + +JEPA 的 EMA 更新策略(慢速更新目标编码器)与 PRISM 巩固管线的"长期记忆缓慢稳定更新,短期记忆快速响应"高度同构。 + +**④ V-JEPA 2 动作条件预测 → PRISM Planning by Imagination** + +V-JEPA 2 的动作条件预测(Action-Conditioned Prediction)直接支持 PRISM 的"给定动作序列预测未来状态"规划能力。 + +### 6.2 对 CrowdRoom 3D 理解的启发 + +**① I-JEPA 的 patch 遮挡策略 → 3D 点云补全** + +I-JEPA 用"遮挡部分图像,预测被遮挡区域的表示"训练视觉编码器。CrowdRoom 可以类比:**遮挡部分点云,预测被遮挡区域的几何/语义表示**,从而在扫描不完整时仍能推断房间结构。 + +**② TC-JEPA(文本条件 JEPA,ICML 2026)→ 文本驱动的场景编辑** + +TC-JEPA 将文本条件注入 JEPA 预测器,实现"给定文字描述,预测对应的视觉表示"。这直接支持 CrowdRoom 的"用户用自然语言描述想要的家具风格,系统预测替换后效果"的交互模式。 + +--- + +## 七、推荐阅读顺序 + +1. **入门**:LeCun 2022 理论文章(理解动机)→ arXiv:2301.08243 I-JEPA(图像实现) +2. **进阶**:arXiv:2404.08471 V-JEPA(视频扩展)→ arXiv:2506.09985 V-JEPA 2(动作条件) +3. **前沿**:arXiv:2605.03245 TC-JEPA(ICML 2026)→ arXiv:2603.19312 LeWorldModel +4. **项目关联**:`plans/PRISM/11_world_model_bridge.md`(M-JEPA 对接设计)