7.1 KiB
title, date, draft, tags, categories, description
| title | date | draft | tags | categories | description | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Meta JEPA 系列项目全面调研:联合嵌入预测架构 | 2026-05-20 | false |
|
|
全面调研 Meta AI 的 JEPA(Joint Embedding Predictive Architecture)系列项目,涵盖 I-JEPA、V-JEPA、V-JEPA 2 的核心架构、GitHub 仓库、论文列表及与 WorldModel 项目的关联分析。 |
一、GitHub 仓库列表
| 仓库名 | Stars | 描述 | 链接 |
|---|---|---|---|
facebookresearch/ijepa |
~3,000+ | I-JEPA 官方实现,图像联合嵌入预测架构,CVPR 2023 | https://github.com/facebookresearch/ijepa |
facebookresearch/jepa |
~2,000+ | V-JEPA 官方实现,视频联合嵌入预测架构,TMLR 2024 | https://github.com/facebookresearch/jepa |
facebookresearch/vjepa2 |
~500+ | V-JEPA 2 官方实现,2025 年升级版,支持动作条件预测 | https://github.com/facebookresearch/vjepa2 |
二、核心论文列表
| 论文名 | 年份 | arXiv ID | 发表场所 | 引用数(估) |
|---|---|---|---|---|
| Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture | 2023 | 2301.08243 |
CVPR 2023 | ~1,200+ |
| Revisiting Feature Prediction for Learning Visual Representations from Video | 2024 | 2404.08471 |
TMLR 2024 | ~400+ |
| V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning | 2025 | 2506.09985 |
arXiv 2025 | ~50+ |
| MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features | 2023 | 2307.12698 |
arXiv 2023 | ~80+ |
| A Path Towards Autonomous Machine Intelligence(LeCun JEPA 理论) | 2022 | OpenReview | OpenReview 2022 | ~2,000+ |
| Text-Conditional JEPA (TC-JEPA) | 2026 | 2605.03245 |
ICML 2026 | ~10+ |
| Sub-JEPA: Subgoal-Conditioned JEPA for Planning | 2026 | 2605.09241 |
arXiv 2026 | ~5+ |
| LeWorldModel: JEPA-based World Model for Embodied AI | 2026 | 2603.19312 |
arXiv 2026 | ~10+ |
三、核心架构解析
3.1 JEPA 的核心思想
JEPA(Joint Embedding Predictive Architecture)由 Yann LeCun 在 2022 年提出,核心思想是:在表示空间(latent space)中做预测,而非在像素空间重建输入。
传统自监督学习(如 MAE)的目标是"重建被遮挡的像素",这迫使模型学习大量低级纹理细节。JEPA 的目标是"预测被遮挡区域的表示向量",让模型专注于学习语义特征。
JEPA 核心公式:
给定上下文块 x_context → 编码器 → z_context
给定目标块 x_target → 编码器 → z_target(停止梯度)
预测器 f(z_context) → ẑ_target
损失:L = ||ẑ_target - z_target||²
关键设计:目标编码器使用 EMA(指数移动平均) 更新,防止表示坍塌(representation collapse)。
3.2 与传统对比学习的区别
| 维度 | 对比学习(SimCLR/MoCo) | 生成式(MAE) | JEPA |
|---|---|---|---|
| 预测目标 | 同一图像的不同增强视图 | 像素/patch 重建 | 隐空间表示 |
| 负样本 | 需要大量负样本 | 不需要 | 不需要 |
| 数据增强依赖 | 强依赖(裁剪/颜色抖动) | 中等 | 极低依赖 |
| 学到的特征 | 语义级,但受增强偏置 | 低级纹理丰富 | 高级语义,无增强偏置 |
| 计算效率 | 中等 | 高(重建代价大) | 高(只预测表示) |
3.3 I-JEPA vs V-JEPA 的区别
I-JEPA(图像版,CVPR 2023,arXiv:2301.08243):
- 输入:单张图像,随机遮挡多个目标块
- 上下文:图像中未遮挡的区域
- 预测器:窄 Transformer(轻量)
- 骨干:ViT-H/14(最大配置)
- 成就:ImageNet 线性分类 77.3%(ViT-H),无需手工增强
V-JEPA(视频版,TMLR 2024,arXiv:2404.08471):
- 输入:视频片段,时空联合遮挡
- 上下文:视频中未遮挡的时空块
- 预测器:更深的 Transformer(需处理时序)
- 骨干:ViT-H/16
- 成就:Kinetics-400 81.9%,Something-Something-v2 72.2%
- 关键洞察:视频预测迫使模型理解运动动态,而非静态纹理
V-JEPA 2(2025,arXiv:2506.09985):
- 新增动作条件预测(Action-Conditioned Prediction)
- 支持机器人操控任务的 world model rollout
- 在 Something-Something-v2 达到 77.3%
四、架构演进
LeCun 2022(理论框架)
↓
I-JEPA 2023(图像域,CVPR)
↓
V-JEPA 2024(视频域,TMLR)
↓
V-JEPA 2 2025(动作条件预测)
↓
TC-JEPA / Sub-JEPA / LeWorldModel(2026,具身AI扩展)
五、2026 年最新进展
| 论文 | arXiv | 方向 | 与 WorldModel 相关性 |
|---|---|---|---|
| Text-Conditional JEPA | 2605.03245 |
文本条件预测,ICML 2026 | ⭐⭐⭐ CrowdRoom 场景编辑 |
| Sub-JEPA | 2605.09241 |
子目标条件规划 | ⭐⭐⭐ PRISM Planning |
| LeWorldModel | 2603.19312 |
具身 AI 世界模型 | ⭐⭐⭐ PRISM WM Bridge |
六、与 WorldModel 项目的关联
6.1 对 PRISM 空间记忆系统的启发
① 隐空间预测 → PRISM L4 场景图更新
JEPA 的核心思想"在表示空间预测"直接对应 PRISM 的需求:当机器人移动到新位置时,不需要重建完整像素图,只需预测新位置的语义表示(L4 节点属性)。
② 无需手工增强 → 适合室内场景多样性
PRISM 面对的酒店/办公室场景变化多端(不同光照、家具布局),传统对比学习需要精心设计增强策略。JEPA 不依赖增强,天然适合 PRISM 的跨场景迁移需求。
③ EMA 目标编码器 → PRISM 的"记忆巩固"机制
JEPA 的 EMA 更新策略(慢速更新目标编码器)与 PRISM 巩固管线的"长期记忆缓慢稳定更新,短期记忆快速响应"高度同构。
④ V-JEPA 2 动作条件预测 → PRISM Planning by Imagination
V-JEPA 2 的动作条件预测(Action-Conditioned Prediction)直接支持 PRISM 的"给定动作序列预测未来状态"规划能力。
6.2 对 CrowdRoom 3D 理解的启发
① I-JEPA 的 patch 遮挡策略 → 3D 点云补全
I-JEPA 用"遮挡部分图像,预测被遮挡区域的表示"训练视觉编码器。CrowdRoom 可以类比:遮挡部分点云,预测被遮挡区域的几何/语义表示,从而在扫描不完整时仍能推断房间结构。
② TC-JEPA(文本条件 JEPA,ICML 2026)→ 文本驱动的场景编辑
TC-JEPA 将文本条件注入 JEPA 预测器,实现"给定文字描述,预测对应的视觉表示"。这直接支持 CrowdRoom 的"用户用自然语言描述想要的家具风格,系统预测替换后效果"的交互模式。
七、推荐阅读顺序
- 入门:LeCun 2022 理论文章(理解动机)→ arXiv:2301.08243 I-JEPA(图像实现)
- 进阶:arXiv:2404.08471 V-JEPA(视频扩展)→ arXiv:2506.09985 V-JEPA 2(动作条件)
- 前沿:arXiv:2605.03245 TC-JEPA(ICML 2026)→ arXiv:2603.19312 LeWorldModel
- 项目关联:
plans/PRISM/11_world_model_bridge.md(M-JEPA 对接设计)