Files
worldmodel/research/understanding_physics_research_plan.md
T
gaojie dbcbdbb59e chore: 为所有 md 文件添加 Hugo front matter
- 处理: 74 个 .md 文件
- 跳过: 0 个(无已存在的 front matter)
- 异常: 3 个(H1 缺失,用文件名兜底)
  - plans/PRISM/.research/readmes/3d-llm.md
  - plans/PRISM/.research/readmes/openmask3d.md
  - plans/PRISM/.research/readmes/openscene.md
2026-05-20 22:42:22 +08:00

42 KiB
Raw Blame History

title, date, draft, tags, categories
title date draft tags categories
物理世界理解(Understanding the Physical World)方向科研计划书 2026-05-20 false
调研
论文综述
机器人
物理
酒店场景
规划
worldmodel

物理世界理解(Understanding the Physical World)方向科研计划书

版本说明与更新日志 (Version History & Changelog)

版本号 更新日期 更新内容摘要
v1.3 2026-05-16 新增第7章“酒店场景下的室内建模与物理验证落地实施方案”,专门针对酒店公共区域、客房以及卫生间(高反光区域)提出定制化的SLAM与建图路线;全文章节编号顺延。
v1.2 2026-05-16 在第6章系统集成规划中补充了“视觉与 YOLO 技术框架的深度结合方案,增强动态目标检测与开放词表泛化能力。
v1.1 2026-05-16 新增“室内复杂交互场景的系统集成与验证规划”章节,细化了基于Habitat 3.0/RoboCasa的具身验证、Gaussian-SLAM几何建图以及PartNet-Mobility/Ditto铰接物体操作先验;优化并顺延了全文后续章节编号。
v1.0 2026-05-15 初始版本建立,提出基于M-JEPA与因果图预的物理世界模型架构,涵盖物理属性解耦、反事实预测、具身智能平台验证等核心研究计划。

1. 项目名称

面向动态物理环境的因果表征学习与预测型世界模型研究 (Research on Causal Representation Learning and Predictive World Models for Dynamic Physical Environments)


2. 研究背景与意义

近年来,以Sora、Kling为代表的生成式世界模型在“构建物理世界”(视觉生成)上取得了巨大突破。然而,这些模型本质上是数据驱动的像素拟合引擎,缺乏对底层物理因果律(如质量、摩擦力、动量守恒)的真正“理解”。当面临反事实(Counterfactual)场景或需要长时多步决策时,纯生成式模型极易产生物理幻觉。 相比之下,Yann LeCun提出的联合嵌入预测架构(JEPA)和Danijar Hafner的Dreamer系列证明了,在隐空间(Latent Space)进行抽象特征的预测,能够主动过滤像素级噪音,是实现“物理世界理解”的更优路径。 本项目旨在深入探究如何让AI从纯视觉或多模态信号中自主抽取出符合经典物理定律的内部表征,并将其应用于具身智能(Embodied AI)系统的复杂交互之中。这对于推动AI从“视觉模拟器”走向“物理推理机”具有重大科学意义。


3. 核心科学问题

  1. 隐状态与物理量的映射机制:如何使世界模型在隐空间学习到的抽象表征(Latent Representations)与现实中的真实物理变量(如质量、速度、受力)产生可解释的对齐?
  2. 时空因果关系的提取与反事实推理:在没有人类显式标注物理公式的情况下,模型如何从动态视频或多感官交互数据中自监督地发现物理因果图(Causal Graphs),并预测“如果改变某一条件,物理后果会如何”?

4. 研究内容与子课题

子课题 1:基于多模态对齐的物理属性解耦与表征学习

  • 目标:打破纯视觉的局限,结合视觉、触觉/力觉数据,提取物体的隐式物理属性。
  • 方法
    • 引入带有碰撞力和材质信息的物理仿真数据集(如Physion的扩展版或构建基于Isaac Sim的新数据集)。
    • 设计改进型多模态JEPA架构(M-JEPA),在目标函数中引入互信息最大化(Mutual Information Maximization),强制模型将视频的运动轨迹与物体的质量、摩擦力等隐变量进行解耦。

子课题 2:内嵌物理先验的因果世界模型(Causal World Model)设计

  • 目标:在神经网络的预测模块中注入显式的物理先验,防止物理幻觉。
  • 方法
    • 在时序预测模块(如Transformer或状态空间模型Mamba)中,引入图神经网络(GNN)或结构因果模型(SCM)。
    • 训练模型不仅预测下一步的隐状态 $s_{t+1}$,还要输出动作 a_t 与环境之间因果作用的有向无环图(DAG),确保预测过程严格遵循局部能量守恒与动力学约束。

子课题 3:具身智能平台上的零样本/少样本物理交互验证

  • 目标:验证模型对物理世界“理解”的泛化能力。
  • 方法
    • 将预训练好的因果世界模型作为具身智能体(如机械臂或四足机器人)的“大脑”。
    • 设计涉及复杂物理推理的任务(如工具使用、流体容器搬运、多物体堆叠),评估系统在面对未见过的物理材质或重心结构时的Zero-shot适应能力和强化学习的样本效率。

5. 技术路线与实施方案

  1. 数据构建阶段:利用Unreal Engine 5和NVIDIA Isaac Sim生成数十万段包含明确物理参数标注(但不喂给模型,仅供评估)的碰撞、形变、流体交互视频。
  2. 模型训练阶段
    • Baseline:复现 V-JEPA 与 DreamerV3。
    • 采用自监督对比学习(Contrastive Learning)和掩码预测(Masked Prediction)在隐空间进行特征预训练。
    • 引入反事实预测损失(Counterfactual Prediction Loss):输入修改后的物理量表征,强制模型输出相应的未来轨迹隐状态。
  3. 测试评估体系(Benchmark:建立专门针对“物理理解度”的评估基准,包括物理常识违背检测(Violation of Expectation)、长时轨迹预测准确率(MSE on Latent Dynamics)和强化学习奖励收敛速度。

6. 室内复杂交互场景的系统集成与验证规划

针对日常物理环境中最为典型的室内场景,本项目将设计一套完整的从几何建图到物理因果推断的集成流水线,具体规划如下:

6.1 室内交互平台选型

  • 优先平台:全面接入 Habitat 3.0RoboCasaHSSD (Habitat Synthetic Scene Dataset) 作为核心室内交互仿真器。
    • Habitat 3.0 / HSSD:提供超大规模、高保真的室内空间拓扑与丰富的静态几何布局,用于训练模型对房间结构的导航与全局空间理解。
    • RoboCasa:提供高度细化的日常活动(特别是厨房场景)交互环境,支持物体抓取、放置等精细化操作。

6.2 几何端在线建图与表示

  • 方法:引入 Gaussian-SLAMMonoGS 算法作为机器人的前端视觉知模块。
  • 作用:在机器人移动与交互过程中,实时构建环境的 3D Gaussian Splatting (3DGS) 辐射场或神经隐式表面。这不仅为后续操作提供精确的“几何 1:1”数字底座,还可通过渲染生成多视角的新视角图像(Novel View Synthesis),作为 M-JEPA 世界模型强大的自监督预测目标。

6.3 铰接物体操作与先验注入

  • 痛点:日常室内环境充满了门、抽屉、冰箱等具有运动学约束的“铰接物体”(Articulated Objects),纯刚体物理无法涵盖这些交互。
  • 技术路线
    • 引入 PartNet-Mobility 数据库作为离线训练先验,让模型预先学习各类家具部件的关节轴方向(prismatic/revolute)及运动学限制。
    • 结合 Ditto 等部件级几何感知算法,在机器人面对未知的室内铰接物体时,实时估计其运动学关节结构。
  • 物理扩展:通过将上述几何与运动学先验注入到因果世界模型中,使模型不仅能理解物体掉落、碰撞的“刚体物理”,更能准确预测“开门、拉抽屉、倒水”这类涉及复杂接触力与约束运动的物理反应,真正实现室内日常任务的闭环。

6.4 视觉与 YOLO 技术框架的深度结合方案

  • 痛点:在动态交互过程中,场景中往往存在快速移动的物体,传统的全场景建图(如 3DGS)和隐空间特征提取对高频动态目标的精准锁定与语义关联能力存在不足。
  • 技术路线
    • 实时目标检测与实例分割:在前端视觉流中引入 YOLO (You Only Look Once) 系列最新框架(如 YOLOv9 / YOLO-World)。利用其极高的推理帧率与轻量化优势,实时输出交互场景中关键物理对象(如杯、工具、门把手)的 2D 边界框(Bounding Box)和实例掩码。
    • 动静分离与物体级因果锚点:将 YOLO 输出的 2D 语义与深度信息结合反投影至 3D 空间。一方面,为建图模块提供动态物体 Mask,避免运动对象污染静态场景的 3D 辐射场;另一方面,将提取出的“物体级(Object-centric)”视觉特征输入给 M-JEPA,作为推断质量、速度、受力等因果变量的结构化锚点,大幅降低无约束隐空间学习的难度。
    • 开放词表(Open-Vocabulary)支持:结合 YOLO-World 等视觉-语言联合检测器,使系统具备通过自然语言指令即时定位未见过实体(Zero-shot Detection)的能力,进一步提升具身模型在泛化场景下的指令跟随与物理交互表现。

7. 酒店场景下的室内建模与物理验证落地实施方案

酒店环境作为具身智能落地的典型真实场景,兼具开阔公共空间与高度复杂的私密空间,对三维建模、SLAM建图及物理世界理解提出了严苛挑战。本项目将针对酒店场景设计分级建图与建模方案:

7.1 酒店公共区域(大堂、走廊)的大规模SLAM建图

  • 场景痛点:空间跨度大、纹理单一(长走廊)、动态干扰多(行人、行李车频繁移动)。
  • 技术路线
    • 多模传感器融合:采用激光雷达-视觉-惯性紧耦合SLAM(如 FAST-LIO2 或 R3LIVE),利用 LiDAR 提供远距离精确尺度与抗无纹理能力,结合视觉提供语义与色彩。
    • 动态滤除与大场景渲染:结合前述 YOLO 框架实时滤除行人与动态物体,生成静态纯净的点云底座。随后在点云基础上训练大规模建筑级 3DGS(如 Hierarchical 3DGS),实现整个大堂和公共走廊的高保真、实时渲染。

7.2 客房内部的高保真稠密重建与语义理解

  • 场景痛点:空间紧凑、家具密集、存在强烈的空间结构先验(如曼哈顿假设)。
  • 技术路线
    • 语义与几何联合建图:在客房内使用 RGB-D 传感器,部署 Gaussian-SLAM 或 Co-SLAM 实现高精度稠密重建。结合 3D 场景图(3D Scene Graph)技术,将重建的几何网格抽象为“床-桌子-电视-衣柜”的层级语义节点。
    • 布局与 CAD 替身替换:对于标准化的客房家具,利用算法提取 CAD 模型替身(如通过 SceneCAD 框架),提升仿真验证与物理交互(如机器人整理桌面、铺床)时的碰撞检测与动力学精确度。

7.3 卫生间(核心难点)的特殊建模与复杂物理推断

  • 场景痛点:存在大量高反光表面(大面镜子、玻璃淋浴房、金属水龙头)和无纹理区域(白色浴缸、马桶),传统视觉SLAM与深度相机会在此严重失效(出现“重影”或深度穿透错误)。
  • 建图与建模路线
    • 抗高反光神经渲染:引入专门处理镜面反射的神经辐射场或高斯技术(如 Ref-NeRF、Specular 3DGS),分离场景的漫反射成分(Diffuse)与依赖视角的镜面反射成分(Specular),从而精确恢复玻璃与镜子的真实表面几何,避免“穿墙”幻觉。
    • 多模态主动感知:在数据采集端引入偏振相机(Polarization Camera)或利用特定波段的固态雷达(如 具有抗反射能力的 ToF 模组)辅助消除高光与反射干扰,获取卫生间真实的深度真值。
  • 物理交互与推断验证
    • 结合 M-JEPA 世界模型,在卫生间场景重点验证具有挑战性的物理推断。例如,结合 PartNet-Mobility 感知水龙头旋钮和淋浴房门的旋转/平移关节(Revolute/Prismatic Joints),并控制机械臂进行“拧开水龙头”、“推开玻璃门”、“拾取光滑洗漱用品”等需要高精度物理预测与触觉反馈的操作验证。

8. 预期成果

  1. 学术论文:在国际顶级AI会议(NeurIPS, ICLR, ICML)发表2-3篇质量学术论文。
  2. 开源资源:在GitHub上开源新型“因果物理世界模型”(Causal-Physics-JEPA)的代码库、预训练权重,以及大规模物理交互评测数据集。
  3. 应用原型:构建一套基于该世界模型的具身智能控制原型系统,在至少两项复杂物理交互任务上超越现有强化学习基线(Baseline)的样本效率。

9. 研究时间规划(周期:12个月)

  • 第 1 - 3 个月(准备与基线构建)
    • 深入调研arXiv关于隐空间预测与因果推断的最新进展。
    • 完成仿真数据集搭建,复现JEPA及Dreamer系列基线模型。
  • 第 4 - 7 个月(算法攻坚与模型开发)
    • 完成 M-JEPA 及因果图结构预测模块的编码与调试。
    • 在超算平台上完成第一阶段的大规模自监督预训练。
  • 第 8 - 10 个月(物理实验与具身验证)
    • 在机械臂仿真环境及真机上部署模型,进行复杂物理交互任务的策略训练与微调。
    • 调整因果模块参数,解决长序列累积误差问题。
  • 第 11 - 12 个月(成果总结与开源)
    • 完成实验数据的统计分析,撰写并投递高水平学术论文。
    • 整理代码和数据集,在GitHub/HuggingFace上发布开源库。

10. arXiv和GitHub上的相关工作与参与者分析

10.1 国际主要研究者与实验室

在“理解物理世界”方向,尤其是隐空间预测、因果推理和具身智能领域,以下实验室和研究人员有显著影响力:

  • Meta AI (FAIR):
    • 代表人物: Yann LeCun (JEPA架构的提出者), Jean-Baptiste Alayrac (V-JEPA主要贡献者), Antoine Bordes。
    • 研究方向: 联合嵌入预测架构 (JEPA) 及其在多模态、视频理解中的应用,旨在学习世界的高级语义和因果关系。其GitHub项目如 facebookresearch/jepafacebookresearch/v-jepa 是核心开源资源。
  • DeepMind (Google DeepMind):
    • 代表人物: Danijar Hafner (Dreamer系列主要贡献者), Matthew Botvinick, Timothy Lillicrap。
    • 研究方向: 基于模型的强化学习 (Model-Based Reinforcement Learning, MBRL),特别是Dreamer系列。他们通过在学习到的世界模型中规划和训练策略,极大地提升了样本效率和对复杂物理环境的理解能力。相关论文常见于NeurIPS, ICLR。
  • MIT (麻省理工学院):
    • 代表人物: Joshua B. Tenenbaum (认知科学与物理直觉的AI建模先驱), Tejas D. Kulkarni。
    • 研究方向: 专注于通过程序式推理、因果图学习和物理引擎(或“直觉物理引擎”)来模拟人类的物理认知。他们的工作通常结合贝叶斯推断和深度学习,探索AI如何从少量数据中学习物理常识。
  • Stanford University (斯坦福大学):
    • 代表人物: Fei-Fei Li (部分工作涉及具身智能与物理交互), Chelsea Finn。
    • 研究方向: 机器人学习、具身智能中的物理理解与操作。例如,通过学习物体属性(刚度、摩擦力)来进行灵巧操作,或预测机器人与环境交互的物理后果。

10.2 中国主要研究者与实验室

中国在“理解物理世界”方向的研究虽然在理论基础提出上相对国际稍晚,但在应用和追赶上表现出强劲势头,尤其在与机器人、自动驾驶等具身智能结合的场景:

  • 清华大学:
    • 代表人物: 孙茂松 (自然语言处理与认知智能), 朱军 (机器学习,部分涉及表示学习)。
    • 研究方向: 在具身智能、多模态学习、以及AI如何理解和表达物理世界常识方面有布局,与生数科技合作的Vidu项目也体现了对物理一致性的关注。
  • 北京大学:
    • 代表人物: 袁粒 (主导 Open-Sora-Plan 等大型开源项目), 林宙辰。
    • 研究方向: 机器学习基础理论、具身感知与规划,尤其在将视觉信息转化为物理世界的结构化理解,并应用于机器人控制和自主导航方面有深入探索。其团队的开源项目 PKU-YuanGroup/Open-Sora-Plan 也包含了对物理运动和场景理解的模块。
  • 浙江大学:
    • 代表人物: 潘纲 (机器人与智能系统)。
    • 研究方向: 具身感知、机器人操作、多模态融合,其研究往往关注如何让机器人更好地理解和应对物理世界中的不确定性。
  • 中国科学院自动化研究所:
    • 代表人物: 乔红 (机器人视觉与控制)。
    • 研究方向: 专注于机器人视觉、具身智能和跨模态感知,探索如何让机器人在复杂的物理环境中进行有效的感知、理解和决策。

10.3 GitHub 开源生态的贡献

虽然“理解物理世界”相比“构建物理世界”(视频生成)的开源项目更侧重研究框架而非直接应用,但仍有许多关键库和框架促进了该领域发展:

  • DreamerV3 (danijar/dreamerv3): DeepMind 的 Danijar Hafner 团队开源的项目,是基于模型强化学习的标杆,其代码实现和框架设计对理解模型内部的物理动态预测机制提供了直接参考。
  • JEPA 相关实现: 虽然Meta FAIR的官方JEPA项目主要聚焦视觉表示学习,但其核心思想和自监督范式被广泛复现和扩展,尤其是在各种 pytorch-jepatensorflow-jepa 的非官方实现中,用于探索如何更有效地学习物理世界的隐式表征。
  • MuJoCo / Isaac Sim: 这些物理仿真环境(NVIDIA的Isaac Sim)本身就是开源或免费使用的,它们提供了高度逼真的物理交互平台,是所有“理解物理世界”研究的数据生成和验证不可或缺的基础设施。

这些实验室和开源项目共同构成了“理解物理世界”研究的核心力量,通过理论创新和实践验证,推动AI向更深层次的物理认知迈进。


11. 国内外研究现状综述

11.1 生成式世界模型路线

以 SoraOpenAI, 2024)、Kling(快手, 2024)、VeoGoogle DeepMind, 2024)为代表的视频扩散模型,通过在像素空间拟合海量数据,在视觉真实感上达到了前所未有的水平。近期开源的 LingBot-World (Robbyant Team, 2026) 进一步引入了相机与动作的连续控制,实现了分钟级的长时一致性与亚秒级实时交互。然而 Kang et al. (2024) 在 How Far is Video Generation from World Model 中发现,传统 SOTA 视频生成模型在分布外(OOD)物理场景下的违例率超过 60%。虽然 LingBot-World 极大提升了动态可控性,但这种纯生成式路径是否能完全内化隐藏因果律(如质量差异导致的受力反馈变化)仍是亟待补充的科学空白。

11.2 隐空间预测路线(JEPA 家族)

LeCun (2022) 在 A Path Towards Autonomous Machine Intelligence 中提出 JEPA,主张在抽象表征层面进行预测以过滤不可预测的像素噪声。后续工作 I-JEPA (Assran et al., 2023)、V-JEPA (Bardes et al., 2024) 在图像与视频自监督学习中验证了该范式的有效性。V-JEPA 2 (Meta, 2025) 进一步将该架构扩展到具身规划场景,但其物理因果性仍依赖隐式涌现,缺乏可解释的物理量对齐。

11.3 基于模型的强化学习路线(Dreamer 家族)

Hafner et al. 的 DreamerV1V3 (20192023) 通过 RSSMRecurrent State Space Model)在隐空间预测奖励与状态转移,在 Atari、DMC、Minecraft 等基准上实现高样本效率。DayDreamer (Wu et al., 2022) 将其迁移到真实机器人。然而 Dreamer 的隐状态是任务驱动的,难以泛化到未训练任务的物理推理。

11.4 直觉物理与可微仿真路线

Tenenbaum 团队的 Galileo (Wu et al., 2015)、Physion (Bear et al., 2021) 等基准强调物理常识评测。可微物理引擎(如 Brax、Warp、NVIDIA Newton)使梯度可穿透物理求解器,与神经网络协同优化。该路线与 JEPA 路线的融合尚处于早期。

11.5 因果表征学习

Schölkopf 等人 (2021) 在 Toward Causal Representation Learning 中系统阐述了将因果发现引入表征学习的必要性。CITRIS (Lippe et al., 2022)、BISCUIT (Lippe et al., 2023) 等工作在合成动态环境中验证了从动作干预中识别因果变量的可行性,但尚未扩展至高维视频与真实物理交互。

11.6 几何重建路线(视觉/激光雷达驱动的 1:1 真实世界数字孪生)

这一流派的核心目标不是"预测物理后果",而是先把现实世界以毫米—厘米级精度搬进计算机,再在其上叠加物理与语义。它构成"理解物理世界"的几何底座,常与世界模型形成上下游关系。代表性技术分支包括:

  • 传统多视图几何与 SLAMStructure-from-MotionCOLMAP, arXiv:1604.01093)、Visual-Inertial SLAMORB-SLAM3, arXiv:2007.11898)、LiDAR SLAMLOAM、LIO-SAM、FAST-LIO2, arXiv:2107.06829)提供稀疏点云与位姿;激光-视觉-惯性紧耦合(如 R3LIVE, arXiv:2109.07982)进一步提升尺度准确性。
  • 神经辐射场与 3D 高斯泼溅(3DGS)NeRFarXiv:2003.08934)、Instant-NGParXiv:2201.05989)、Mip-NeRF 360arXiv:2111.12077)实现照片级隐式重建;3D Gaussian SplattingarXiv:2308.04079)将渲染速度推至实时,已成为数字孪生主流表征。后续 PhysGaussianarXiv:2311.12198)、Spring-Gaus 等工作把高斯基元接入物理求解器,实现"可重建即可仿真"。
  • 大规模城市级与场景级重建Block-NeRFarXiv:2202.05263)、Google Immersive View、Hierarchical 3DGSarXiv:2406.12080)面向街区/城市级别;NVIDIA Omniverse、CARLA、Cosmos-DriveNVIDIA, 2025)将重建结果转换为可仿真、可交互的 OpenUSD 数字孪生。
  • 自动驾驶占据栅格与 BEVTesla Occupancy Network、OccWorldarXiv:2311.16038)、OCC3D-nuScenes、UniScene 等以 3D 体素或 BEV 网格预测周围空间占据与语义,是 LiDAR + 多目视觉融合的工业落地范式。
  • 大规模重建数据与基准Waymo Open官网)、nuScenesarXiv:1903.11027)、KITTI-360arXiv:2109.13410)、Argoverse 2、Matterport3D、ScanNet++ 提供多模态传感器对齐数据。
  • 物理可交互的孪生Gaussian Splatting + MPM/FEMPhysGaussian、PIE-NeRF, arXiv:2311.13099)、Genesis官网)、Real2Sim2Real 流水线(如 RoboCasa, arXiv:2406.02523)把"几何 1:1"延伸为"物理 1:1"。

与本项目的关系:几何重建路线提供精确空间锚点,但本身并不学习"为什么会这样"的因果机制。本项目可在三个层面与该路线协同:

  1. 数据生成:用 3DGS/NeRF 重建的真实场景替代部分纯仿真数据,缩小 Sim2Real Gap
  2. 隐空间监督:将重建得到的真值几何(深度、占据、姿态)作为 M-JEPA 隐变量的可选弱监督锚点,加速物理量解耦;
  3. 闭环验证:在 PhysGaussian 类"可仿真孪生"中进行反事实物理推理评测,使得"理解"的检验不再局限于合成场景。

11.6.1 室内空间重建子方向

室内场景具有"尺度小、纹理弱、结构强、遮挡多、动态人/物频繁"等特点,催生出一批专门的研究方向:

  • 稠密深度与 TSDF 融合:以 KinectFusionISMAR'11)、BundleFusionarXiv:1604.01093v2)、Voxblox、AtlasarXiv:2003.10432)、NeuralReconarXiv:2104.00681)为代表,利用 RGB-D 或多视图实时融合 TSDF 体素,重建表面网格。

  • 室内 NeRF / 3DGSNeRF in the Wild、NICE-SLAMarXiv:2112.12130)、Co-SLAMarXiv:2304.14377)、Point-SLAM、Gaussian-SLAMarXiv:2312.10070)、SplaTAMarXiv:2312.02126)、MonoGSarXiv:2312.06741)把神经隐式/高斯表征与 SLAM 融合,实现单目/RGB-D 实时建图。

  • 结构化布局与 CAD 抽象HorizonNet、LayoutNet、PanoContext、RoomFormerarXiv:2210.12058)、SceneCADarXiv:2003.12622)、Mask3D / ODIN 等从全景或点云中提取墙-地-天花板的曼哈顿结构和家具的 CAD 替身,便于编辑与仿真。

  • 语义/实例/全景 3D 分割ScanNetarXiv:1702.04405)、ScanNet++arXiv:2308.11417)、ReplicaarXiv:1906.05797)、Matterport3DarXiv:1709.06158)、ARKitScenesarXiv:2111.08897)提供大规模标注;MinkowskiNet、Mask3D、OpenScene、ConceptGraphsarXiv:2309.16650)实现从点云到开放词表语义。

  • 可交互场景与具身仿真平台(细化):本类平台不仅提供"几何 1:1 的房间",更要回答"AI 能否理解空间布局、物体形状、物理特性与功能可供性(affordance)"四个层面的问题。下面按能力维度展开:

    • A. 空间结构理解(Spatial Layout

      • 平台Habitat 3.0arXiv:2310.13724)、HM3D-SemanticsarXiv:2210.05633)、Matterport3DarXiv:1709.06158)、Gibson EnvCVPR'18)、ProcTHORarXiv:2206.06994)。
      • 关注能力:房间-门-走廊拓扑、可通行区域、家具占据、视野遮挡、空间记忆(episodic map)。
      • 典型任务ObjectNav、ImageNav、Multi-Object Navigation、Room RearrangementarXiv:2011.01975)、SPOCarXiv:2312.02976)。
      • 评测指标SPL、Success-weighted by Path Length、Coverage、Map Completion。
    • B. 物体几何理解(Object Shape & Geometry

      • 平台SAPIEN / PartNet-MobilityarXiv:2003.08515)、Objaverse-XLarXiv:2307.05663)、GAPartNetarXiv:2211.05272)、ShapeNet-Sem、AKB-48arXiv:2202.08432)、GraspNet-1BillionCVPR'20)。
      • 关注能力:精细网格/SDF/凸分解、薄壁与镂空、关节轴方向(prismatic/revolute)、点云-视觉对齐、6D 位姿与尺寸。
      • 典型任务6-DoF 抓取、铰接预测(Ditto、arXiv:2202.08227)、Part Segmentation、Shape Completion、Articulation Estimation。
    • C. 物理特性理解(Physical Properties

      • 平台Isaac Lab / Isaac Sim文档)、ManiSkill 3arXiv:2410.00425)、RoboCasaarXiv:2406.02523)、Genesis官网)、SoftGymarXiv:2011.07215)、PlasticineLabarXiv:2104.03311)、FluidLabarXiv:2303.02346)、ThreeDWorld / TDWarXiv:2007.04954)。
      • 关注能力:质量、惯性张量、摩擦系数、恢复系数、刚柔耦合、布料/液体/颗粒、热与声学(TDW 提供 PyImpact 音频,可用于"听-碰撞"多模态)。
      • 典型任务:物体属性估计(mass/friction inference)、Cloth Folding、Liquid Pouring、Dough Manipulation、Pile Sorting、Tool Use。
      • 评测指标:物理量回归误差(MSE on mass/μ)、任务成功率、能量守恒违例率、长时滚动误差。
    • D. 功能可供性与作用理解(Affordance & Function

      • 平台BEHAVIOR-1K / OmniGibsonarXiv:2403.09227)、ALFREDarXiv:1912.01734)、ALFWorld、ARNOLDarXiv:2304.04321)、CALVINarXiv:2112.03227)、RoboTHOR、RLBencharXiv:1909.12271)。
      • 关注能力:物体的"可被打开/拿起/倒入/坐上"等动作可供性、语言-动作-物体三元绑定、长时任务分解、状态变化(cooked、sliced、filled、stained)。
      • 典型任务Language-conditioned Manipulation、Long-horizon Household Tasks"煮一杯咖啡")、Tool Substitution、Counterfactual Affordance"如果杯子破了,能否盛水?")。
    • E. 多智能体与人-机器人共存

      • 平台Habitat 3.0 Social RearrangementarXiv:2310.13724)、OVMMarXiv:2306.11565)、iGibson Social、Overcooked-AI。
      • 关注能力:人类轨迹预测、协作意图推理、避让与让行、物体共享。
    • F. 仿真器选型权衡(与本项目相关)

平台 渲染 物理 铰接 柔体/流体 大规模场景 主要语言/接口
Habitat 3.0 高速 PBR Bullet HSSD/HM3D Python/C++
Isaac Lab RTX PhysX 5 中(PBD Python/USD
ManiSkill 3 SAPIEN 强(Warp Python
RoboCasa MuJoCo 厨房 Python
Genesis 多后端 强(MPM/SPH Python
TDW 影视级 Flex/Unity Python

与本项目子课题 3 的具体映射

  1. 空间理解评测:在 HSSD/HM3D 上跑 ObjectNav 与 Rearrangement,验证 M-JEPA 隐空间是否编码了房间拓扑(探针:从隐状态线性回归占据栅格)。
  2. 几何与铰接评测:在 PartNet-Mobility/GAPartNet 上做关节轴预测与开门/拉抽屉操作,验证模型对"零件级几何 + 运动学约束"的内化。
  3. 物理量对齐:在 ManiSkill 3 + Genesis 上做"看视频估质量/摩擦"探针任务,定量评估隐变量与真值物理量的相关系数(Pearson ρ)。
  4. 可供性与反事实:在 BEHAVIOR-1K / ARNOLD 上设计反事实任务(更换材质、改变重力、移除物体),考查 CPL 损失是否真正提升了 OOD 物理推理。
  • 场景图与可编辑数字孪生3D Scene GrapharXiv:1910.02527)、KimeraarXiv:1910.02490)、SceneGraphFusion、ConceptGraphs 将几何重建抽象为"房间-物体-关系"的图结构,支持语言查询与重排。
  • 动态与人-物交互重建BEHAVEarXiv:2204.06950)、CHAIRS、HumanISR、Neural Human Performer 处理人与家具的接触/动态;Dynamic-NeRF、D-3DGS 用于动态室内场景。
  • 铰接物体与可操作部件PartNet-Mobility / SAPIENarXiv:2003.08515)、DittoarXiv:2202.08227)、Real2Code、CARTO 重建抽屉、门、把手等关节,为具身操作提供"可动"几何。
  • 房间布局生成与程序化合成ATISSarXiv:2110.03675)、DiffuScene、LEGO-Net、HolodeckarXiv:2312.09067)、Infinigen IndoorsarXiv:2406.11824)通过扩散/LLM 程序化生成多样化室内场景,作为重建之外的"无限数据"补充。
  • 少量/单图重建与基础模型驱动RoomNet、PERF、One-2-3-45、LRMarXiv:2311.04400)、ZeroNVS、CAT3D、DUSt3RarXiv:2312.14132)、MASt3R、Spann3R 把单图/稀疏图重建推进到秒级,对室内"快速建模"友好。

与本项目的接口:本项目子课题 3(具身验证)将优先选用 Habitat 3.0 / RoboCasa / HSSD 作为室内交互平台;几何端可采用 Gaussian-SLAM/MonoGS 在线建图,并以 PartNet-Mobility / Ditto 提供铰接物体先验,使因果世界模型既学习刚体物理,也覆盖"开门、拉抽屉、倒水"这类室内常见的接触-铰接交互。

11.7 研究空白与本项目的切入点

现有工作呈现明显分裂:(i)生成式模型重视觉而轻因果;(ii)JEPA/Dreamer 重预测而轻可解释物理对齐;(iii)因果学习重理论而轻具身验证。本项目主张在 JEPA 隐空间 + 因果图结构 + 可微物理先验 + 具身验证 四要素融合处建立新的研究坐标,填补"可解释的物理因果世界模型"这一空白。


12. 创新点

  1. 方法创新——M-JEPA + 因果图联合架构:首次将多模态(视-触-力)JEPA 与结构因果模型(SCM)耦合,并通过互信息正则项强制隐变量解耦至质量、摩擦力等可解释物理维度。
  2. 目标函数创新——反事实预测损失(CPL):在自监督预训练阶段引入隐空间干预(do-操作),要求模型在反事实物理参数下输出一致的因果后果,从根本上抑制物理幻觉。
  3. 评测体系创新——Physics-Understanding Benchmark (PUB):构建包含 VoEViolation-of-Expectation)、反事实预测、长时轨迹外推、Zero-shot 操作四维评测协议,弥补现有物理评测多集中于"识别违例"而忽视"主动预测"的不足。
  4. 闭环验证创新——仿真到真机的物理对齐迁移:通过 Isaac Sim 到真实机械臂的 Sim2Real 双向校准,量化隐空间物理量与真实测量值的相关性,提供可解释性证据。

13. 可行性分析

13.1 理论可行性

JEPA、Dreamer、SCM 三条技术线均已在各自领域取得里程碑成果,本项目的融合在数学上有清晰的目标函数表达(最大化预测互信息 + 最小化因果违背项),不存在原理性障碍。

13.2 数据可行性

NVIDIA Isaac Sim、MuJoCo MJX、Genesis、Unreal Engine 5 Chaos 物理引擎均可提供高保真物理交互数据,并可批量导出隐藏的真值物理参数用于评测对齐。我们预估 30 万条 5–10 秒视频可在 2 周内于 8×A100 集群上生成。

13.3 算力可行性

项目主要预训练规模在 1B 参数以内,参考 V-JEPA-L (0.3B) 的训练成本(约 16K A100·hours),本项目主体训练可在 64×A100/H100 集群上 3–4 周内完成,与课题组现有/可申请算力规模匹配。

13.4 团队可行性

课题组已有 JEPA 自监督学习、机器人操作、可微仿真三个方向的前期积累,并具备 Isaac Sim/Genesis 部署经验,工程基础具备。


14. 风险分析与应对

风险类别 描述 影响等级 应对策略
表征坍缩 JEPA 类自监督训练易出现 collapse 引入 VICReg/Barlow-Twins 正则;多模态对比学习互锁
因果识别不可识别性 无干预下隐式因果发现的非唯一性 利用主动干预(机器人动作)与已知物理对称性作弱监督
Sim2Real Gap 仿真训练模型在真机上失效 域随机化 + 真机微调;保留 5% 真机数据做对齐评测
长序列误差累积 自回归预测漂移 采用层级化时间抽象(HRSSM)与教师强制退火
算力受限 顶会前算力高峰排队 提前预约共享集群;采用 LoRA/QLoRA 微调降级路线
数据集偏差 仿真物理与真实物理分布不一致 引入真实视频数据集(Something-Something v2, Ego4D)辅助预训练

15. 团队组成与分工建议

  • 项目负责人(PI1 名):总体把控、论文撰写、对外合作。
  • 博士后/高级研究员(12 名):负责 M-JEPA 架构与因果模块核心算法实现。
  • 博士生(23 名):分别承担数据构建、预训练 pipeline、具身验证。
  • 硕士生(2 名):协助评测基准建设、可视化分析、消融实验。
  • 工程师/RA1 名):负责仿真平台搭建、集群运维、开源代码工程化。
  • 外部合作:与机器人实验室共享真机平台;与认知科学团队合作设计 VoE 评测。

16. 经费预算概览(参考,单位:万元 RMB,周期 12 个月)

科目 预算 用途说明
算力与云服务 80 A100/H100 集群租用、对象存储、推理服务
仿真与硬件 40 Isaac Sim 工作站、机械臂/夹爪、力觉传感器
数据采集与标注 15 真实视频采集、人工 VoE 标签校验
国际会议与差旅 12 NeurIPS/ICLR/ICML/RSS 注册与差旅
论文发表与开源运维 5 OA 费、GitHub/HuggingFace 维护
人员补助 30 学生津贴、合作访问学者
机动与其他 8 风险储备
合计 190

17. 伦理、合规与开源策略

  1. 数据合规:仅使用公开发布或自采且已脱敏的视频数据;真实人物出镜数据需获得书面同意。
  2. 机器人安全:所有真机实验设置物理限位与急停;高速运动实验在隔离围栏内进行。
  3. 算法风险评估:在公开模型权重前进行误用风险评估,明确禁止用于自主武器等场景。
  4. 开源许可:代码采用 Apache-2.0;数据集采用 CC BY-NC 4.0;预训练权重采用 LLaMA-style 研究使用协议。
  5. 可复现性:随论文发布种子、训练日志(W&B)、Docker 镜像与一键复现脚本。

18. 主要参考文献(选列)

  1. LeCun, Y. (2022). A Path Towards Autonomous Machine Intelligence. Open Review. [PDF]
  2. Assran, M. et al. (2023). Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture (I-JEPA). CVPR. [arXiv:2301.08243]
  3. Bardes, A. et al. (2024). V-JEPA: Latent Video Prediction for Visual Representation Learning. Meta AI. [Paper]
  4. Hafner, D. et al. (2023). Mastering Diverse Domains through World Models (DreamerV3). [arXiv:2301.04104]
  5. Wu, J., Tenenbaum, J. B. et al. (2015). Galileo: Perceiving Physical Object Properties by Integrating a Physics Engine with Deep Learning. NeurIPS. [PDF]
  6. Bear, D. et al. (2021). Physion: Evaluating Physical Prediction from Vision in Humans and Machines. NeurIPS Datasets & Benchmarks. [arXiv:2106.08261]
  7. Schölkopf, B. et al. (2021). Toward Causal Representation Learning. Proceedings of the IEEE. [arXiv:2102.11107]
  8. Lippe, P. et al. (2022). CITRIS: Causal Identifiability from Temporal Intervened Sequences. ICML. [arXiv:2202.03169]
  9. Lippe, P. et al. (2023). BISCUIT: Causal Representation Learning from Binary Interactions. UAI. [arXiv:2306.09643]
  10. Kang, B. et al. (2024). How Far is Video Generation from World Model: A Physical Law Perspective. [arXiv:2411.02385]
  11. Wu, P. et al. (2022). DayDreamer: World Models for Physical Robot Learning. CoRL. [arXiv:2206.14176]
  12. Brohan, A. et al. (2023). RT-2: Vision-Language-Action Models. Google DeepMind. [arXiv:2307.15818]
  13. Makoviychuk, V. et al. (2021). Isaac Gym: High Performance GPU-Based Physics Simulation for Robot Learning. NeurIPS. [arXiv:2108.10470]
  14. Robbyant Team, Gao, Z., Wang, Q., et al. (2026). Advancing Open-source World Models (LingBot-World). [arXiv:2601.20540]

19. 里程碑与可交付物(Deliverables

时间节点 里程碑 可交付物
M3 基线复现完成 V-JEPA / DreamerV3 复现报告 + 仿真数据集 v0.1
M6 M-JEPA 架构跑通 预训练权重 v0.5 + 内部技术报告
M8 因果模块集成 Causal-Physics-JEPA v1.0 + 评测基准 PUB v1.0
M10 具身实验完成 机械臂操作视频 + 真机/仿真对照评测结果
M12 项目结题 2–3 篇顶会投稿 + 开源代码/权重/数据集发布