Remove outdated research documents and add new index files for research plans, spatial memory, and world models. Update the CrowdRoom related papers section and consolidate research summaries for better navigation and accessibility.
Sync to site1 / sync (push) Has been cancelled
Sync to site1 / sync (push) Has been cancelled
This commit is contained in:
@@ -1,150 +0,0 @@
|
||||
---
|
||||
title: "Meta JEPA 系列项目全面调研:联合嵌入预测架构"
|
||||
date: 2026-05-20
|
||||
draft: false
|
||||
tags: ["JEPA", "Meta", "world-model", "self-supervised", "video-understanding", "I-JEPA", "V-JEPA"]
|
||||
categories: ["research"]
|
||||
description: "全面调研 Meta AI 的 JEPA(Joint Embedding Predictive Architecture)系列项目,涵盖 I-JEPA、V-JEPA、V-JEPA 2 的核心架构、GitHub 仓库、论文列表及与 WorldModel 项目的关联分析。"
|
||||
---
|
||||
|
||||
## 一、GitHub 仓库列表
|
||||
|
||||
| 仓库名 | Stars | 描述 | 链接 |
|
||||
|--------|-------|------|------|
|
||||
| `facebookresearch/ijepa` | ~3,000+ | I-JEPA 官方实现,图像联合嵌入预测架构,CVPR 2023 | https://github.com/facebookresearch/ijepa |
|
||||
| `facebookresearch/jepa` | ~2,000+ | V-JEPA 官方实现,视频联合嵌入预测架构,TMLR 2024 | https://github.com/facebookresearch/jepa |
|
||||
| `facebookresearch/vjepa2` | ~500+ | V-JEPA 2 官方实现,2025 年升级版,支持动作条件预测 | https://github.com/facebookresearch/vjepa2 |
|
||||
|
||||
---
|
||||
|
||||
## 二、核心论文列表
|
||||
|
||||
| 论文名 | 年份 | arXiv ID | 发表场所 | 引用数(估) |
|
||||
|--------|------|----------|----------|-------------|
|
||||
| Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture | 2023 | `2301.08243` | CVPR 2023 | ~1,200+ |
|
||||
| Revisiting Feature Prediction for Learning Visual Representations from Video | 2024 | `2404.08471` | TMLR 2024 | ~400+ |
|
||||
| V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning | 2025 | `2506.09985` | arXiv 2025 | ~50+ |
|
||||
| MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features | 2023 | `2307.12698` | arXiv 2023 | ~80+ |
|
||||
| A Path Towards Autonomous Machine Intelligence(LeCun JEPA 理论) | 2022 | OpenReview | OpenReview 2022 | ~2,000+ |
|
||||
| Text-Conditional JEPA (TC-JEPA) | 2026 | `2605.03245` | ICML 2026 | ~10+ |
|
||||
| Sub-JEPA: Subgoal-Conditioned JEPA for Planning | 2026 | `2605.09241` | arXiv 2026 | ~5+ |
|
||||
| LeWorldModel: JEPA-based World Model for Embodied AI | 2026 | `2603.19312` | arXiv 2026 | ~10+ |
|
||||
|
||||
---
|
||||
|
||||
## 三、核心架构解析
|
||||
|
||||
### 3.1 JEPA 的核心思想
|
||||
|
||||
JEPA(Joint Embedding Predictive Architecture)由 Yann LeCun 在 2022 年提出,核心思想是:**在表示空间(latent space)中做预测,而非在像素空间重建输入**。
|
||||
|
||||
传统自监督学习(如 MAE)的目标是"重建被遮挡的像素",这迫使模型学习大量低级纹理细节。JEPA 的目标是"预测被遮挡区域的**表示向量**",让模型专注于学习语义特征。
|
||||
|
||||
```
|
||||
JEPA 核心公式:
|
||||
给定上下文块 x_context → 编码器 → z_context
|
||||
给定目标块 x_target → 编码器 → z_target(停止梯度)
|
||||
预测器 f(z_context) → ẑ_target
|
||||
损失:L = ||ẑ_target - z_target||²
|
||||
```
|
||||
|
||||
关键设计:目标编码器使用 **EMA(指数移动平均)** 更新,防止表示坍塌(representation collapse)。
|
||||
|
||||
### 3.2 与传统对比学习的区别
|
||||
|
||||
| 维度 | 对比学习(SimCLR/MoCo) | 生成式(MAE) | JEPA |
|
||||
|------|------------------------|--------------|------|
|
||||
| 预测目标 | 同一图像的不同增强视图 | 像素/patch 重建 | **隐空间表示** |
|
||||
| 负样本 | 需要大量负样本 | 不需要 | **不需要** |
|
||||
| 数据增强依赖 | 强依赖(裁剪/颜色抖动) | 中等 | **极低依赖** |
|
||||
| 学到的特征 | 语义级,但受增强偏置 | 低级纹理丰富 | **高级语义,无增强偏置** |
|
||||
| 计算效率 | 中等 | 高(重建代价大) | **高(只预测表示)** |
|
||||
|
||||
### 3.3 I-JEPA vs V-JEPA 的区别
|
||||
|
||||
**I-JEPA(图像版,CVPR 2023,arXiv:2301.08243)**:
|
||||
- 输入:单张图像,随机遮挡多个目标块
|
||||
- 上下文:图像中未遮挡的区域
|
||||
- 预测器:窄 Transformer(轻量)
|
||||
- 骨干:ViT-H/14(最大配置)
|
||||
- 成就:ImageNet 线性分类 77.3%(ViT-H),无需手工增强
|
||||
|
||||
**V-JEPA(视频版,TMLR 2024,arXiv:2404.08471)**:
|
||||
- 输入:视频片段,时空联合遮挡
|
||||
- 上下文:视频中未遮挡的时空块
|
||||
- 预测器:更深的 Transformer(需处理时序)
|
||||
- 骨干:ViT-H/16
|
||||
- 成就:Kinetics-400 81.9%,Something-Something-v2 72.2%
|
||||
- 关键洞察:视频预测迫使模型理解**运动动态**,而非静态纹理
|
||||
|
||||
**V-JEPA 2(2025,arXiv:2506.09985)**:
|
||||
- 新增**动作条件预测**(Action-Conditioned Prediction)
|
||||
- 支持机器人操控任务的 world model rollout
|
||||
- 在 Something-Something-v2 达到 77.3%
|
||||
|
||||
---
|
||||
|
||||
## 四、架构演进
|
||||
|
||||
```
|
||||
LeCun 2022(理论框架)
|
||||
↓
|
||||
I-JEPA 2023(图像域,CVPR)
|
||||
↓
|
||||
V-JEPA 2024(视频域,TMLR)
|
||||
↓
|
||||
V-JEPA 2 2025(动作条件预测)
|
||||
↓
|
||||
TC-JEPA / Sub-JEPA / LeWorldModel(2026,具身AI扩展)
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## 五、2026 年最新进展
|
||||
|
||||
| 论文 | arXiv | 方向 | 与 WorldModel 相关性 |
|
||||
|------|-------|------|---------------------|
|
||||
| Text-Conditional JEPA | `2605.03245` | 文本条件预测,ICML 2026 | ⭐⭐⭐ CrowdRoom 场景编辑 |
|
||||
| Sub-JEPA | `2605.09241` | 子目标条件规划 | ⭐⭐⭐ PRISM Planning |
|
||||
| LeWorldModel | `2603.19312` | 具身 AI 世界模型 | ⭐⭐⭐ PRISM WM Bridge |
|
||||
|
||||
---
|
||||
|
||||
## 六、与 WorldModel 项目的关联
|
||||
|
||||
### 6.1 对 PRISM 空间记忆系统的启发
|
||||
|
||||
**① 隐空间预测 → PRISM L4 场景图更新**
|
||||
|
||||
JEPA 的核心思想"在表示空间预测"直接对应 PRISM 的需求:当机器人移动到新位置时,不需要重建完整像素图,只需预测新位置的**语义表示**(L4 节点属性)。
|
||||
|
||||
**② 无需手工增强 → 适合室内场景多样性**
|
||||
|
||||
PRISM 面对的酒店/办公室场景变化多端(不同光照、家具布局),传统对比学习需要精心设计增强策略。JEPA 不依赖增强,天然适合 PRISM 的**跨场景迁移**需求。
|
||||
|
||||
**③ EMA 目标编码器 → PRISM 的"记忆巩固"机制**
|
||||
|
||||
JEPA 的 EMA 更新策略(慢速更新目标编码器)与 PRISM 巩固管线的"长期记忆缓慢稳定更新,短期记忆快速响应"高度同构。
|
||||
|
||||
**④ V-JEPA 2 动作条件预测 → PRISM Planning by Imagination**
|
||||
|
||||
V-JEPA 2 的动作条件预测(Action-Conditioned Prediction)直接支持 PRISM 的"给定动作序列预测未来状态"规划能力。
|
||||
|
||||
### 6.2 对 CrowdRoom 3D 理解的启发
|
||||
|
||||
**① I-JEPA 的 patch 遮挡策略 → 3D 点云补全**
|
||||
|
||||
I-JEPA 用"遮挡部分图像,预测被遮挡区域的表示"训练视觉编码器。CrowdRoom 可以类比:**遮挡部分点云,预测被遮挡区域的几何/语义表示**,从而在扫描不完整时仍能推断房间结构。
|
||||
|
||||
**② TC-JEPA(文本条件 JEPA,ICML 2026)→ 文本驱动的场景编辑**
|
||||
|
||||
TC-JEPA 将文本条件注入 JEPA 预测器,实现"给定文字描述,预测对应的视觉表示"。这直接支持 CrowdRoom 的"用户用自然语言描述想要的家具风格,系统预测替换后效果"的交互模式。
|
||||
|
||||
---
|
||||
|
||||
## 七、推荐阅读顺序
|
||||
|
||||
1. **入门**:LeCun 2022 理论文章(理解动机)→ arXiv:2301.08243 I-JEPA(图像实现)
|
||||
2. **进阶**:arXiv:2404.08471 V-JEPA(视频扩展)→ arXiv:2506.09985 V-JEPA 2(动作条件)
|
||||
3. **前沿**:arXiv:2605.03245 TC-JEPA(ICML 2026)→ arXiv:2603.19312 LeWorldModel
|
||||
4. **项目关联**:`plans/PRISM/11_world_model_bridge.md`(M-JEPA 对接设计)
|
||||
Reference in New Issue
Block a user