Files
worldmodel/research/world-models/jepa/index.md
T

7.1 KiB
Raw Blame History

title, date, draft, tags, categories, description
title date draft tags categories description
Meta JEPA 系列项目全面调研:联合嵌入预测架构 2026-05-20 false
JEPA
Meta
world-model
self-supervised
video-understanding
I-JEPA
V-JEPA
research
全面调研 Meta AI 的 JEPAJoint Embedding Predictive Architecture)系列项目,涵盖 I-JEPA、V-JEPA、V-JEPA 2 的核心架构、GitHub 仓库、论文列表及与 WorldModel 项目的关联分析。

一、GitHub 仓库列表

仓库名 Stars 描述 链接
facebookresearch/ijepa ~3,000+ I-JEPA 官方实现,图像联合嵌入预测架构,CVPR 2023 https://github.com/facebookresearch/ijepa
facebookresearch/jepa ~2,000+ V-JEPA 官方实现,视频联合嵌入预测架构,TMLR 2024 https://github.com/facebookresearch/jepa
facebookresearch/vjepa2 ~500+ V-JEPA 2 官方实现,2025 年升级版,支持动作条件预测 https://github.com/facebookresearch/vjepa2

二、核心论文列表

论文名 年份 arXiv ID 发表场所 引用数(估)
Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture 2023 2301.08243 CVPR 2023 ~1,200+
Revisiting Feature Prediction for Learning Visual Representations from Video 2024 2404.08471 TMLR 2024 ~400+
V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning 2025 2506.09985 arXiv 2025 ~50+
MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features 2023 2307.12698 arXiv 2023 ~80+
A Path Towards Autonomous Machine IntelligenceLeCun JEPA 理论) 2022 OpenReview OpenReview 2022 ~2,000+
Text-Conditional JEPA (TC-JEPA) 2026 2605.03245 ICML 2026 ~10+
Sub-JEPA: Subgoal-Conditioned JEPA for Planning 2026 2605.09241 arXiv 2026 ~5+
LeWorldModel: JEPA-based World Model for Embodied AI 2026 2603.19312 arXiv 2026 ~10+

三、核心架构解析

3.1 JEPA 的核心思想

JEPAJoint Embedding Predictive Architecture)由 Yann LeCun 在 2022 年提出,核心思想是:在表示空间(latent space)中做预测,而非在像素空间重建输入

传统自监督学习(如 MAE)的目标是"重建被遮挡的像素",这迫使模型学习大量低级纹理细节。JEPA 的目标是"预测被遮挡区域的表示向量",让模型专注于学习语义特征。

JEPA 核心公式:
  给定上下文块 x_context → 编码器 → z_context
  给定目标块 x_target  → 编码器 → z_target(停止梯度)
  预测器 f(z_context) → ẑ_target
  损失:L = ||ẑ_target - z_target||²

关键设计:目标编码器使用 EMA(指数移动平均) 更新,防止表示坍塌(representation collapse)。

3.2 与传统对比学习的区别

维度 对比学习(SimCLR/MoCo 生成式(MAE JEPA
预测目标 同一图像的不同增强视图 像素/patch 重建 隐空间表示
负样本 需要大量负样本 不需要 不需要
数据增强依赖 强依赖(裁剪/颜色抖动) 中等 极低依赖
学到的特征 语义级,但受增强偏置 低级纹理丰富 高级语义,无增强偏置
计算效率 中等 高(重建代价大) 高(只预测表示)

3.3 I-JEPA vs V-JEPA 的区别

I-JEPA(图像版,CVPR 2023arXiv:2301.08243

  • 输入:单张图像,随机遮挡多个目标块
  • 上下文:图像中未遮挡的区域
  • 预测器:窄 Transformer(轻量)
  • 骨干:ViT-H/14(最大配置)
  • 成就:ImageNet 线性分类 77.3%ViT-H),无需手工增强

V-JEPA(视频版,TMLR 2024arXiv:2404.08471

  • 输入:视频片段,时空联合遮挡
  • 上下文:视频中未遮挡的时空块
  • 预测器:更深的 Transformer(需处理时序)
  • 骨干:ViT-H/16
  • 成就:Kinetics-400 81.9%Something-Something-v2 72.2%
  • 关键洞察:视频预测迫使模型理解运动动态,而非静态纹理

V-JEPA 22025arXiv:2506.09985

  • 新增动作条件预测Action-Conditioned Prediction
  • 支持机器人操控任务的 world model rollout
  • 在 Something-Something-v2 达到 77.3%

四、架构演进

LeCun 2022(理论框架)
    ↓
I-JEPA 2023(图像域,CVPR
    ↓
V-JEPA 2024(视频域,TMLR
    ↓
V-JEPA 2 2025(动作条件预测)
    ↓
TC-JEPA / Sub-JEPA / LeWorldModel2026,具身AI扩展)

五、2026 年最新进展

论文 arXiv 方向 与 WorldModel 相关性
Text-Conditional JEPA 2605.03245 文本条件预测,ICML 2026 CrowdRoom 场景编辑
Sub-JEPA 2605.09241 子目标条件规划 PRISM Planning
LeWorldModel 2603.19312 具身 AI 世界模型 PRISM WM Bridge

六、与 WorldModel 项目的关联

6.1 对 PRISM 空间记忆系统的启发

① 隐空间预测 → PRISM L4 场景图更新

JEPA 的核心思想"在表示空间预测"直接对应 PRISM 的需求:当机器人移动到新位置时,不需要重建完整像素图,只需预测新位置的语义表示L4 节点属性)。

② 无需手工增强 → 适合室内场景多样性

PRISM 面对的酒店/办公室场景变化多端(不同光照、家具布局),传统对比学习需要精心设计增强策略。JEPA 不依赖增强,天然适合 PRISM 的跨场景迁移需求。

③ EMA 目标编码器 → PRISM 的"记忆巩固"机制

JEPA 的 EMA 更新策略(慢速更新目标编码器)与 PRISM 巩固管线的"长期记忆缓慢稳定更新,短期记忆快速响应"高度同构。

④ V-JEPA 2 动作条件预测 → PRISM Planning by Imagination

V-JEPA 2 的动作条件预测(Action-Conditioned Prediction)直接支持 PRISM 的"给定动作序列预测未来状态"规划能力。

6.2 对 CrowdRoom 3D 理解的启发

① I-JEPA 的 patch 遮挡策略 → 3D 点云补全

I-JEPA 用"遮挡部分图像,预测被遮挡区域的表示"训练视觉编码器。CrowdRoom 可以类比:遮挡部分点云,预测被遮挡区域的几何/语义表示,从而在扫描不完整时仍能推断房间结构。

② TC-JEPA(文本条件 JEPAICML 2026)→ 文本驱动的场景编辑

TC-JEPA 将文本条件注入 JEPA 预测器,实现"给定文字描述,预测对应的视觉表示"。这直接支持 CrowdRoom 的"用户用自然语言描述想要的家具风格,系统预测替换后效果"的交互模式。


七、推荐阅读顺序

  1. 入门:LeCun 2022 理论文章(理解动机)→ arXiv:2301.08243 I-JEPA(图像实现)
  2. 进阶arXiv:2404.08471 V-JEPA(视频扩展)→ arXiv:2506.09985 V-JEPA 2(动作条件)
  3. 前沿arXiv:2605.03245 TC-JEPAICML 2026)→ arXiv:2603.19312 LeWorldModel
  4. 项目关联plans/PRISM/11_world_model_bridge.mdM-JEPA 对接设计)