Files
worldmodel/plans/hotel_model.md
T
gaojie 7d46c0443e
Sync to site1 / sync (push) Has been cancelled
chore: update plans/ root categories to HotelScene
2026-05-21 02:46:44 +08:00

8.6 KiB
Raw Blame History

title, date, draft, tags, categories
title date draft tags categories
酒店场景下的室内建模与物理验证落地实施方案 2026-05-20 false
规划
酒店场景
点云
Gaussian Splatting
机器人
iOS
HotelScene

酒店场景下的室内建模与物理验证落地实施方案

酒店环境作为具身智能落地的典型真实场景,兼具开阔公共空间与高度复杂的私密空间,对三维建模、SLAM建图及物理世界理解提出了严苛挑战。本项目将针对酒店场景设计分级建图与建模方案:

1. 酒店公共区域(大堂、走廊)的大规模SLAM建图

  • 场景痛点:空间跨度大、纹理单一(长走廊)、动态干扰多(行人、行李车频繁移动)。
  • 技术路线
    • 多模传感器融合:采用激光雷达-视觉-惯性紧耦合SLAM(如 FAST-LIO2 或 R3LIVE),利用 LiDAR 提供远距离精确尺度与抗无纹理能力,结合视觉提供语义与色彩。
    • 动态滤除与大场景渲染:结合前述 YOLO 框架实时滤除行人与动态物体,生成静态纯净的点云底座。随后在点云基础上训练大规模建筑级 3DGS(如 Hierarchical 3DGS),实现整个大堂和公共走廊的高保真、实时渲染。

2. 客房内部的高保真稠密重建与语义理解

本模块旨在对客房内部环境进行毫米级的高保真三维几何重建,并在此基础上赋予细粒度的语义信息,构建出物理准确且具备丰富语义的“数字客房”底座。总体架构分为三个核心层级:多源数据采集与对齐层高保真几何物理重建层多模态语义与实例理解层

2.1 多源数据采集与位姿估计 (Data Acquisition & Pose Estimation)

客房环境具有空间受限、遮挡严重等特点,需要采用多模态传感器融合的方式获取原始数据。

  • 硬件设备与采集策略:使用具备RGB-D(深度相机/LiDAR)与高分辨率RGB相机的便携式设备(如iPhone Pro或专用扫描仪)进行环绕式及多角度局部扫描,确保覆盖床底、柜体背面等死角。
  • 多传感器联合标定与时间同步:确保RGB图像与深度图在时间和空间上的严格对齐。
  • 鲁棒的相机位姿解算
    • 首先使用传统的SLAM/SfM(如COLMAP)系统提取稀疏点云和初始相机位姿。
    • 针对弱纹理区(如白墙、床单):引入深度先验(Depth Prior),利用预训练的单目深度估计大模型(如Depth Anything)或实际采集的物理深度(LiDAR点云)进行几何约束,联合优化相机外参,避免漂移(Drift)。

2.2 基于3DGS与隐式场的高保真稠密重建 (High-Fidelity Dense Reconstruction)

在获取准确的相机位姿后,采用以 3D Gaussian Splatting (3DGS) 为核心的显隐式结合重建技术,以平衡渲染质量与训练推理速度。

  • 混合表达的高效重建:使用3DGS来表达场景,相较于传统的NeRF,它能够保留明确的几何边界,并支持实时渲染。通过初始化SfM生成的稀疏点云,对高斯球的位置、颜色、不透明度、缩放和旋转等属性进行优化。
  • 客房特殊材质处理(高反光与透明材质)
    • 客房内常见的镜子、玻璃、电视屏幕和金属门把手会导致严重的视角相关(View-dependent)伪影。
    • 技术方案:引入基于物理的渲染(PBR)材质解耦技术,将颜色分解为漫反射(Diffuse)和镜面反射(Specular)成分。通过表面法线约束和环境光照贴图(Environment Map)联合优化,显式地对镜面反射进行建模,从而恢复真实的物体表面几何而非反射的虚像。
  • 几何正则化与拓扑优化:为了使生成的几何(如Mesh)可以直接用于后续的物理仿真,提取3DGS的表面时,利用SDF(符号距离场)进行正则化(如SuGaR或NeuS的方法),确保提取出的客房内家具和墙面的网格模型(Mesh)水密且平滑,无悬浮伪影。

2.3 开放词汇的2D-3D联合语义理解 (Open-Vocabulary Semantic Understanding)

仅仅获得几何是不够的,系统需要知道“这是床”、“那是空调控制器”或“水杯”。

  • 2D基础模型的零样本特征提取
    • 利用视觉基础模型(如SAM - Segment Anything Model)对二维RGB帧进行高质量的类不可知(Class-agnostic)的实例掩码提取。
    • 使用多模态大模型(如CLIP、DINOv2)提取掩码对应区域的高维语义特征。
  • 3D特征场融合与多视角一致性
    • 将提取的2D高维语义特征(如CLIP特征)注入到3DGS或NeRF的优化过程中,生成“语义特征场”(Semantic Feature Field)。
    • 在三维空间中进行特征聚类,解决不同视角下由于遮挡和光照变化导致的2D语义不一致问题,实现准确的3D实例分割。
  • 基于大语言模型(LLM)的自然语言查询
    • 由于构建了连续的3D语义特征场,系统支持“Open-Vocabulary”(开放词汇)查询。用户或机器人可以直接输入自然语言指令(如“找到放在床头柜上的白色水杯”),系统通过计算语言CLIP特征与3D空间特征的余弦相似度,精确定位目标物体。

2.4 场景图构建与可供性分析 (Scene Graph & Affordance Parsing)

为支持后续的具身智能或物理交互,需将离散的语义物体组织成结构化的场景图。

  • 3D场景图(3D Scene Graph)构建
    • 节点(Nodes:提取出的独立实例(如床、台灯、窗帘),包含属性(类别、包围盒、尺寸、材质估算、6DoF位姿)。
    • 边(Edges:分析物体间的空间拓扑关系(如 Supported-by 台灯在床头柜上, Inside 衣服在衣柜里, Next-to 椅子在桌子旁)。
  • 可供性(Affordance)与交互属性推理
    • 结合大视觉语言模型(VLM,如GPT-4V),对截取的物体多视角图片进行分析,推理出其操作属性和运动学结构。例如:识别出柜门是“平开的(Revolute Joint)”、抽屉是“可抽拉的(Prismatic Joint)”,并将这些关节参数(轴向、运动范围)编码到场景图中,为机器人操作提供直接指导。

2.5 难点与应对策略

  1. 难点:无纹理区域(大面积白墙、床单)重建不完整
    • 对策:引入深度扩散模型(Depth Diffusion Models)提供强先验,结合主动光(LiDAR)补偿点云缺失。
  2. 难点:微小物品(如遥控器、笔)的语义分割丢失
    • 对策:采用多尺度特征融合机制,针对微小物体设计局部的超分辨率注意力网络,在3D特征投影时进行局部特征增强。
  3. 难点:大规模数据训练效率低
    • 对策:采用分块(Block-wise)重建与动态LOD(多细节层次)策略,将客房划分为多个子区域并行训练,最后进行边界融合配准。

2.6 预期输出成果

  • 客房的高精度全景3D网格(Mesh)模型,带高清物理材质贴图。
  • 支持任意视角高质量实时渲染的3DGS表示文件。
  • 结构化的客房3D语义场景图(JSON/XML格式),包含所有家具与物品的空间位置、实例ID、语义标签以及交互属性。

3. 卫生间(核心难点)的特殊建模与复杂物理推断

  • 场景痛点:存在大量高反光表面(大面镜子、玻璃淋浴房、金属水龙头)和无纹理区域(白色浴缸、马桶),传统视觉SLAM与深度相机会在此严重失效(出现“重影”或深度穿透错误)。
  • 建图与建模路线
    • 抗高反光神经渲染:引入专门处理镜面反射的神经辐射场或高斯技术(如 Ref-NeRF、Specular 3DGS),分离场景的漫反射成分(Diffuse)与依赖视角的镜面反射成分(Specular),从而精确恢复玻璃与镜子的真实表面几何,避免“穿墙”幻觉。
    • 多模态主动感知:在数据采集端引入偏振相机(Polarization Camera)或利用特定波段的固态雷达(如 具有抗反射能力的 ToF 模组)辅助消除高光与反射干扰,获取卫生间真实的深度真值。
  • 物理交互与推断验证
    • 结合 M-JEPA 世界模型,在卫生间场景重点验证具有挑战性的物理推断。例如,结合 PartNet-Mobility 感知水龙头旋钮和淋浴房门的旋转/平移关节(Revolute/Prismatic Joints),并控制机械臂进行“拧开水龙头”、“推开玻璃门”、“拾取光滑洗漱用品”等需要高精度物理预测与触觉反馈的操作验证。