--- title: "Meta JEPA 系列项目全面调研:联合嵌入预测架构" date: 2026-05-20 draft: false tags: ["JEPA", "Meta", "world-model", "self-supervised", "video-understanding", "I-JEPA", "V-JEPA"] categories: ["research"] description: "全面调研 Meta AI 的 JEPA(Joint Embedding Predictive Architecture)系列项目,涵盖 I-JEPA、V-JEPA、V-JEPA 2 的核心架构、GitHub 仓库、论文列表及与 WorldModel 项目的关联分析。" --- ## 一、GitHub 仓库列表 | 仓库名 | Stars | 描述 | 链接 | |--------|-------|------|------| | `facebookresearch/ijepa` | ~3,000+ | I-JEPA 官方实现,图像联合嵌入预测架构,CVPR 2023 | https://github.com/facebookresearch/ijepa | | `facebookresearch/jepa` | ~2,000+ | V-JEPA 官方实现,视频联合嵌入预测架构,TMLR 2024 | https://github.com/facebookresearch/jepa | | `facebookresearch/vjepa2` | ~500+ | V-JEPA 2 官方实现,2025 年升级版,支持动作条件预测 | https://github.com/facebookresearch/vjepa2 | --- ## 二、核心论文列表 | 论文名 | 年份 | arXiv ID | 发表场所 | 引用数(估) | |--------|------|----------|----------|-------------| | Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture | 2023 | `2301.08243` | CVPR 2023 | ~1,200+ | | Revisiting Feature Prediction for Learning Visual Representations from Video | 2024 | `2404.08471` | TMLR 2024 | ~400+ | | V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning | 2025 | `2506.09985` | arXiv 2025 | ~50+ | | MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features | 2023 | `2307.12698` | arXiv 2023 | ~80+ | | A Path Towards Autonomous Machine Intelligence(LeCun JEPA 理论) | 2022 | OpenReview | OpenReview 2022 | ~2,000+ | | Text-Conditional JEPA (TC-JEPA) | 2026 | `2605.03245` | ICML 2026 | ~10+ | | Sub-JEPA: Subgoal-Conditioned JEPA for Planning | 2026 | `2605.09241` | arXiv 2026 | ~5+ | | LeWorldModel: JEPA-based World Model for Embodied AI | 2026 | `2603.19312` | arXiv 2026 | ~10+ | --- ## 三、核心架构解析 ### 3.1 JEPA 的核心思想 JEPA(Joint Embedding Predictive Architecture)由 Yann LeCun 在 2022 年提出,核心思想是:**在表示空间(latent space)中做预测,而非在像素空间重建输入**。 传统自监督学习(如 MAE)的目标是"重建被遮挡的像素",这迫使模型学习大量低级纹理细节。JEPA 的目标是"预测被遮挡区域的**表示向量**",让模型专注于学习语义特征。 ``` JEPA 核心公式: 给定上下文块 x_context → 编码器 → z_context 给定目标块 x_target → 编码器 → z_target(停止梯度) 预测器 f(z_context) → ẑ_target 损失:L = ||ẑ_target - z_target||² ``` 关键设计:目标编码器使用 **EMA(指数移动平均)** 更新,防止表示坍塌(representation collapse)。 ### 3.2 与传统对比学习的区别 | 维度 | 对比学习(SimCLR/MoCo) | 生成式(MAE) | JEPA | |------|------------------------|--------------|------| | 预测目标 | 同一图像的不同增强视图 | 像素/patch 重建 | **隐空间表示** | | 负样本 | 需要大量负样本 | 不需要 | **不需要** | | 数据增强依赖 | 强依赖(裁剪/颜色抖动) | 中等 | **极低依赖** | | 学到的特征 | 语义级,但受增强偏置 | 低级纹理丰富 | **高级语义,无增强偏置** | | 计算效率 | 中等 | 高(重建代价大) | **高(只预测表示)** | ### 3.3 I-JEPA vs V-JEPA 的区别 **I-JEPA(图像版,CVPR 2023,arXiv:2301.08243)**: - 输入:单张图像,随机遮挡多个目标块 - 上下文:图像中未遮挡的区域 - 预测器:窄 Transformer(轻量) - 骨干:ViT-H/14(最大配置) - 成就:ImageNet 线性分类 77.3%(ViT-H),无需手工增强 **V-JEPA(视频版,TMLR 2024,arXiv:2404.08471)**: - 输入:视频片段,时空联合遮挡 - 上下文:视频中未遮挡的时空块 - 预测器:更深的 Transformer(需处理时序) - 骨干:ViT-H/16 - 成就:Kinetics-400 81.9%,Something-Something-v2 72.2% - 关键洞察:视频预测迫使模型理解**运动动态**,而非静态纹理 **V-JEPA 2(2025,arXiv:2506.09985)**: - 新增**动作条件预测**(Action-Conditioned Prediction) - 支持机器人操控任务的 world model rollout - 在 Something-Something-v2 达到 77.3% --- ## 四、架构演进 ``` LeCun 2022(理论框架) ↓ I-JEPA 2023(图像域,CVPR) ↓ V-JEPA 2024(视频域,TMLR) ↓ V-JEPA 2 2025(动作条件预测) ↓ TC-JEPA / Sub-JEPA / LeWorldModel(2026,具身AI扩展) ``` --- ## 五、2026 年最新进展 | 论文 | arXiv | 方向 | 与 WorldModel 相关性 | |------|-------|------|---------------------| | Text-Conditional JEPA | `2605.03245` | 文本条件预测,ICML 2026 | ⭐⭐⭐ CrowdRoom 场景编辑 | | Sub-JEPA | `2605.09241` | 子目标条件规划 | ⭐⭐⭐ PRISM Planning | | LeWorldModel | `2603.19312` | 具身 AI 世界模型 | ⭐⭐⭐ PRISM WM Bridge | --- ## 六、与 WorldModel 项目的关联 ### 6.1 对 PRISM 空间记忆系统的启发 **① 隐空间预测 → PRISM L4 场景图更新** JEPA 的核心思想"在表示空间预测"直接对应 PRISM 的需求:当机器人移动到新位置时,不需要重建完整像素图,只需预测新位置的**语义表示**(L4 节点属性)。 **② 无需手工增强 → 适合室内场景多样性** PRISM 面对的酒店/办公室场景变化多端(不同光照、家具布局),传统对比学习需要精心设计增强策略。JEPA 不依赖增强,天然适合 PRISM 的**跨场景迁移**需求。 **③ EMA 目标编码器 → PRISM 的"记忆巩固"机制** JEPA 的 EMA 更新策略(慢速更新目标编码器)与 PRISM 巩固管线的"长期记忆缓慢稳定更新,短期记忆快速响应"高度同构。 **④ V-JEPA 2 动作条件预测 → PRISM Planning by Imagination** V-JEPA 2 的动作条件预测(Action-Conditioned Prediction)直接支持 PRISM 的"给定动作序列预测未来状态"规划能力。 ### 6.2 对 CrowdRoom 3D 理解的启发 **① I-JEPA 的 patch 遮挡策略 → 3D 点云补全** I-JEPA 用"遮挡部分图像,预测被遮挡区域的表示"训练视觉编码器。CrowdRoom 可以类比:**遮挡部分点云,预测被遮挡区域的几何/语义表示**,从而在扫描不完整时仍能推断房间结构。 **② TC-JEPA(文本条件 JEPA,ICML 2026)→ 文本驱动的场景编辑** TC-JEPA 将文本条件注入 JEPA 预测器,实现"给定文字描述,预测对应的视觉表示"。这直接支持 CrowdRoom 的"用户用自然语言描述想要的家具风格,系统预测替换后效果"的交互模式。 --- ## 七、推荐阅读顺序 1. **入门**:LeCun 2022 理论文章(理解动机)→ arXiv:2301.08243 I-JEPA(图像实现) 2. **进阶**:arXiv:2404.08471 V-JEPA(视频扩展)→ arXiv:2506.09985 V-JEPA 2(动作条件) 3. **前沿**:arXiv:2605.03245 TC-JEPA(ICML 2026)→ arXiv:2603.19312 LeWorldModel 4. **项目关联**:`plans/PRISM/11_world_model_bridge.md`(M-JEPA 对接设计)