chore: initial commit — import worldmodel workspace (plans/, research/)

This commit is contained in:
gaojie
2026-05-20 21:43:57 +08:00
commit bec8a9a4a3
98 changed files with 44128 additions and 0 deletions
@@ -0,0 +1,618 @@
# 酒店场景室内建模与物理验证项目详细实施计划(完结篇)
## 十一、预算估算(续)
### 11.1 硬件设备预算(续)
| 类别 | 项目 | 数量 | 单价(万元) | 小计(万元) |
|-----|------|------|------------|------------|
| **存储** | NVMe SSD 4TB | 2 | 0.3 | 0.6 |
| | HDD 8TB | 4 | 0.15 | 0.6 |
| **其他** | 三脚架、稳定器等配件 | 1套 | 0.5 | 0.5 |
| **小计** | | | | **21.0** |
### 11.2 软件与服务预算
| 类别 | 项目 | 周期 | 费用(万元) |
|-----|------|------|------------|
| **云计算** | GPU云服务器(A100×4 | 6个月 | 12.0 |
| **存储** | 对象存储(50TB | 12个月 | 1.5 |
| **软件许可** | MATLAB/Simulink(可选) | 12个月 | 1.0 |
| | RealityCapture(可选) | 12个月 | 0.3 |
| **数据标注** | 众包标注服务 | 一次性 | 2.0 |
| **小计** | | | **16.8** |
### 11.3 人力成本预算
| 角色 | 人数 | 月薪(万元) | 月数 | 小计(万元) |
|-----|------|------------|------|------------|
| 算法工程师 | 2 | 3.0 | 12 | 72.0 |
| 机器学习工程师 | 1 | 3.5 | 12 | 42.0 |
| 机器人工程师 | 1 | 3.0 | 12 | 36.0 |
| 数据工程师 | 1 | 2.5 | 12 | 30.0 |
| 研究助理 | 2 | 1.5 | 12 | 36.0 |
| **小计** | | | | **216.0** |
### 11.4 其他费用
| 类别 | 费用(万元) |
|-----|------------|
| 差旅费(会议、调研) | 8.0 |
| 论文发表费用 | 3.0 |
| 酒店场地使用费 | 5.0 |
| 机动费用(10% | 27.0 |
| **小计** | **43.0** |
### 11.5 总预算汇总
| 类别 | 金额(万元) | 占比 |
|-----|------------|------|
| 硬件设备 | 21.0 | 7.1% |
| 软件与服务 | 16.8 | 5.7% |
| 人力成本 | 216.0 | 72.7% |
| 其他费用 | 43.0 | 14.5% |
| **总计** | **296.8** | **100%** |
---
## 十二、开源发布与文档编写
### 12.1 开源仓库结构
```
hotel-scene-reconstruction/
├── README.md # 项目主页
├── LICENSE # Apache 2.0
├── CITATION.bib # 引用信息
├── docs/ # 文档
│ ├── installation.md # 安装指南
│ ├── quickstart.md # 快速开始
│ ├── data_format.md # 数据格式说明
│ ├── api_reference.md # API文档
│ └── tutorials/ # 教程
│ ├── 01_data_collection.md
│ ├── 02_slam_mapping.md
│ ├── 03_3dgs_training.md
│ ├── 04_semantic_understanding.md
│ └── 05_physics_simulation.md
├── configs/ # 配置文件
│ ├── sensors/ # 传感器配置
│ ├── slam/ # SLAM参数
│ ├── 3dgs/ # 3DGS训练配置
│ └── semantic/ # 语义模型配置
├── scripts/ # 脚本工具
│ ├── calibrate_sensors.py
│ ├── run_slam.py
│ ├── train_3dgs.py
│ ├── extract_semantics.py
│ ├── build_scene_graph.py
│ └── export_to_isaac.py
├── src/ # 源代码
│ ├── slam/ # SLAM模块
│ │ ├── fast_lio2_wrapper.py
│ │ ├── dynamic_filter.py
│ │ └── loop_closure.py
│ ├── reconstruction/ # 重建模块
│ │ ├── gaussian_splatting/
│ │ ├── ref_nerf/
│ │ └── mesh_extraction.py
│ ├── semantic/ # 语义模块
│ │ ├── yolo_detector.py
│ │ ├── sam_segmenter.py
│ │ ├── clip_encoder.py
│ │ └── scene_graph.py
│ ├── physics/ # 物理模块
│ │ ├── usd_exporter.py
│ │ ├── articulation_detector.py
│ │ └── mjepa_model.py
│ └── utils/ # 工具函数
│ ├── data_loader.py
│ ├── visualization.py
│ └── metrics.py
├── data/ # 示例数据
│ └── sample_room/
│ ├── raw/
│ └── processed/
├── models/ # 预训练模型
│ ├── 3dgs_pretrained.ckpt
│ ├── mjepa_pretrained.pth
│ └── README.md
├── benchmarks/ # 评测基准
│ ├── geometry_eval.py
│ ├── rendering_eval.py
│ ├── semantic_eval.py
│ └── physics_eval.py
├── tests/ # 单元测试
│ ├── test_slam.py
│ ├── test_3dgs.py
│ └── test_semantic.py
├── docker/ # Docker配置
│ ├── Dockerfile
│ └── docker-compose.yml
├── requirements.txt # Python依赖
├── setup.py # 安装脚本
└── .github/ # GitHub配置
├── workflows/
│ └── ci.yml # CI/CD
└── ISSUE_TEMPLATE/
```
### 12.2 README.md 模板
```markdown
# 🏨 Hotel Scene Reconstruction: 酒店场景高保真数字孪生系统
[![License](https://img.shields.io/badge/License-Apache%202.0-blue.svg)](LICENSE)
[![Python](https://img.shields.io/badge/Python-3.8+-green.svg)](https://www.python.org/)
[![PyTorch](https://img.shields.io/badge/PyTorch-2.0+-red.svg)](https://pytorch.org/)
> 面向具身智能的酒店场景室内建模与物理验证完整解决方案
## ✨ 特性
- 🗺️ **大规模SLAM建图**:支持公共区域的激光雷达-视觉融合建图
- 🎨 **高保真3D重建**:基于3D Gaussian Splatting的实时渲染
- 🪞 **高反光场景处理**:专门针对卫生间镜面/玻璃的Ref-NeRF技术
- 🧠 **语义理解**:开放词表物体检测与3D场景图构建
- ⚙️ **物理仿真**:可导出至Isaac Sim的物理交互场景
- 🤖 **M-JEPA集成**:支持物理世界模型的预测与验证
## 📦 安装
### 环境要求
- Ubuntu 20.04 / 22.04
- CUDA 11.8+
- Python 3.8+
- 16GB+ RAM
- NVIDIA GPU (RTX 3090 / 4090 / A100推荐)
### 快速安装
\`\`\`bash
# 克隆仓库
git clone https://github.com/your-org/hotel-scene-reconstruction.git
cd hotel-scene-reconstruction
# 创建conda环境
conda create -n hotel-recon python=3.10
conda activate hotel-recon
# 安装依赖
pip install -r requirements.txt
# 安装本项目
pip install -e .
\`\`\`
详细安装指南请参考 [docs/installation.md](docs/installation.md)
## 🚀 快速开始
### 1. 数据采集
\`\`\`bash
# 传感器标定
python scripts/calibrate_sensors.py --config configs/sensors/azure_kinect.yaml
# 开始采集
python scripts/collect_data.py --scene lobby --output data/lobby_01
\`\`\`
### 2. SLAM建图
\`\`\`bash
python scripts/run_slam.py \
--input data/lobby_01/raw \
--output data/lobby_01/processed/slam \
--config configs/slam/fast_lio2.yaml
\`\`\`
### 3. 3DGS训练
\`\`\`bash
python scripts/train_3dgs.py \
--data data/lobby_01/processed/slam \
--output models/lobby_01_3dgs \
--iterations 30000
\`\`\`
### 4. 语义提取
\`\`\`bash
python scripts/extract_semantics.py \
--model models/lobby_01_3dgs \
--output data/lobby_01/processed/semantic
\`\`\`
更多示例请参考 [docs/quickstart.md](docs/quickstart.md)
## 📊 评测基准
我们提供了 **HotelScene-Bench** 评测基准,包含:
- 10个真实酒店场景
- 500+标注物体实例
- 几何、渲染、语义、物理四大评测维度
\`\`\`bash
# 运行完整评测
python benchmarks/run_all_benchmarks.py --model_dir models/
\`\`\`
## 📄 引用
如果本项目对您的研究有帮助,请引用:
\`\`\`bibtex
@article{hotel2026,
title={Hotel Scene Reconstruction: High-Fidelity Digital Twin for Embodied AI},
author={Your Name and Others},
journal={arXiv preprint arXiv:2026.xxxxx},
year={2026}
}
\`\`\`
## 🤝 贡献
欢迎贡献!请查看 [CONTRIBUTING.md](CONTRIBUTING.md)
## 📧 联系
- 项目主页: https://your-project-page.com
- 问题反馈: [GitHub Issues](https://github.com/your-org/hotel-scene-reconstruction/issues)
- 邮件: your-email@example.com
## 📜 许可证
本项目采用 [Apache 2.0](LICENSE) 许可证。
```
### 12.3 文档编写清单
```yaml
必需文档:
- ✅ README.md(项目主页)
- ✅ INSTALLATION.md(详细安装指南)
- ✅ QUICKSTART.md(快速开始教程)
- ✅ API_REFERENCE.mdAPI文档)
- ✅ DATA_FORMAT.md(数据格式说明)
- ✅ CONTRIBUTING.md(贡献指南)
- ✅ CHANGELOG.md(版本更新日志)
教程文档:
- ✅ 数据采集教程
- ✅ SLAM建图教程
- ✅ 3DGS训练教程
- ✅ 语义理解教程
- ✅ 物理仿真教程
- ✅ 故障排查指南
技术文档:
- ✅ 系统架构设计
- ✅ 算法原理说明
- ✅ 性能优化指南
- ✅ 扩展开发指南
视频教程(可选):
- 📹 5分钟快速演示
- 📹 完整工作流程演示
- 📹 常见问题解答
```
### 12.4 数据集发布
```yaml
数据集名称: HotelScene-Dataset
发布平台:
- HuggingFace Datasets
- ZenodoDOI
- 项目官网
数据集内容:
原始数据:
- 10个场景的多模态传感器数据
- 总大小: ~500GB
处理后数据:
- SLAM轨迹与点云地图
- 3DGS模型文件
- 语义标注与场景图
- 总大小: ~200GB
评测数据:
- 测试集(新视角图像)
- 标注真值
- 评测脚本
- 总大小: ~50GB
许可证: CC BY-NC 4.0(研究使用)
下载方式:
\`\`\`bash
# 使用HuggingFace CLI
huggingface-cli download hotel-scene/dataset
# 或使用Python API
from datasets import load_dataset
dataset = load_dataset("hotel-scene/dataset")
\`\`\`
```
---
## 十三、预期成果与影响
### 13.1 学术成果
```yaml
论文发表目标:
顶级会议:
- CVPR / ICCV / ECCV(计算机视觉)
- NeurIPS / ICML / ICLR(机器学习)
- RSS / ICRA / IROS(机器人)
预期贡献:
- 首个针对酒店场景的完整数字孪生方案
- 高反光场景的鲁棒重建方法
- 几何-语义-物理统一的场景表示
- 大规模室内场景评测基准
专利申请(可选):
- 偏振相机辅助的镜面几何恢复方法
- 基于3DGS的实时语义场景图构建系统
- 多模态融合的室内SLAM方法
```
### 13.2 技术影响
```yaml
推动领域发展:
- 为具身智能提供真实复杂场景测试平台
- 促进3D重建技术在服务机器人领域的应用
- 建立室内场景数字孪生的技术标准
开源社区贡献:
- 高质量代码库(预期1000+ stars)
- 详细文档与教程
- 活跃的社区支持
产业应用潜力:
- 酒店智能化改造
- 服务机器人导航与操作
- VR/AR虚拟看房
- 室内设计与规划
```
### 13.3 社会价值
```yaml
推动智能服务:
- 提升酒店服务效率
- 降低人力成本
- 改善客户体验
技术普惠:
- 开源降低技术门槛
- 促进中小企业数字化转型
- 培养相关领域人才
可持续发展:
- 优化空间利用率
- 减少资源浪费
- 支持绿色建筑设计
```
---
## 十四、项目总结与展望
### 14.1 核心创新点
1. **分场景定制化技术路线**
- 公共区域:大规模LiDAR-视觉融合SLAM
- 客房:高保真3DGS + 语义场景图
- 卫生间:偏振成像 + Ref-NeRF抗反光
2. **几何-语义-物理三位一体**
- 不仅重建几何,更理解语义与物理属性
- 支持从数字孪生到物理仿真的无缝转换
3. **开放词表语义理解**
- 结合YOLO-World、SAM、CLIP
- 支持自然语言查询与零样本检测
4. **M-JEPA世界模型集成**
- 验证物理预测能力
- 支持机器人任务规划与执行
### 14.2 技术挑战与解决方案
| 挑战 | 解决方案 | 创新性 |
|-----|---------|--------|
| 大规模场景实时建图 | Hierarchical 3DGS + LOD | ⭐⭐⭐ |
| 高反光材质重建 | 偏振成像 + Ref-NeRF | ⭐⭐⭐⭐⭐ |
| 弱纹理区域位姿估计 | 深度先验 + LiDAR约束 | ⭐⭐⭐⭐ |
| 开放词表3D理解 | CLIP特征场 + 多视角融合 | ⭐⭐⭐⭐ |
| 物理属性估计 | M-JEPA + 场景图推理 | ⭐⭐⭐⭐ |
### 14.3 未来研究方向
```yaml
短期(6-12个月):
- 扩展到更多酒店类型(经济型、度假型)
- 支持动态场景(人员活动)的实时重建
- 优化移动端部署(手机/平板采集)
中期(1-2年):
- 与大语言模型(LLM)集成,支持自然语言交互
- 开发端到端的机器人任务规划系统
- 建立跨场景的迁移学习框架
长期(2-5年):
- 扩展到其他室内场景(医院、商场、办公楼)
- 实现完全自主的场景理解与交互
- 推动具身智能的大规模商业化应用
```
### 14.4 成功标准
```yaml
技术指标:
✅ 几何重建精度 < 3cm
✅ 实时渲染 > 30 FPS
✅ 语义检测 mAP > 70%
✅ 物理任务成功率 > 75%
学术影响:
✅ 顶会论文发表 ≥ 2篇
✅ 论文引用 > 50次(2年内)
✅ 数据集下载 > 500次
开源影响:
✅ GitHub Stars > 1000
✅ 代码贡献者 > 10人
✅ 衍生项目 > 5个
产业应用:
✅ 合作企业 ≥ 3家
✅ 实际部署场景 ≥ 5个
✅ 技术转化收入 > 50万元
```
---
## 附录A:关键技术论文列表
### SLAM与建图
1. **FAST-LIO2**: Xu, W., et al. "FAST-LIO2: Fast Direct LiDAR-Inertial Odometry." *IEEE TRO*, 2022. [[arXiv:2107.06829]](https://arxiv.org/abs/2107.06829)
2. **R3LIVE**: Lin, J., et al. "R3LIVE: A Robust, Real-time, RGB-colored, LiDAR-Inertial-Visual tightly-coupled state Estimation and mapping package." *ICRA*, 2022. [[arXiv:2109.07982]](https://arxiv.org/abs/2109.07982)
3. **ORB-SLAM3**: Campos, C., et al. "ORB-SLAM3: An Accurate Open-Source Library for Visual, Visual-Inertial and Multi-Map SLAM." *IEEE TRO*, 2021. [[arXiv:2007.11898]](https://arxiv.org/abs/2007.11898)
### 3D重建
4. **3D Gaussian Splatting**: Kerbl, B., et al. "3D Gaussian Splatting for Real-Time Radiance Field Rendering." *SIGGRAPH*, 2023. [[arXiv:2308.04079]](https://arxiv.org/abs/2308.04079)
5. **Gaussian-SLAM**: Matsuki, H., et al. "Gaussian Splatting SLAM." *CVPR*, 2024. [[arXiv:2312.10070]](https://arxiv.org/abs/2312.10070)
6. **MonoGS**: Matsuki, H., et al. "MonoGS: Monocular Gaussian Splatting." *arXiv*, 2023. [[arXiv:2312.06741]](https://arxiv.org/abs/2312.06741)
7. **Ref-NeRF**: Verbin, D., et al. "Ref-NeRF: Structured View-Dependent Appearance for Neural Radiance Fields." *CVPR*, 2022. [[arXiv:2112.03907]](https://arxiv.org/abs/2112.03907)
8. **SuGaR**: Guédon, A., et al. "SuGaR: Surface-Aligned Gaussian Splatting for Efficient 3D Mesh Reconstruction." *CVPR*, 2024. [[arXiv:2311.12775]](https://arxiv.org/abs/2311.12775)
### 语义理解
9. **YOLO-World**: Cheng, T., et al. "YOLO-World: Real-Time Open-Vocabulary Object Detection." *CVPR*, 2024. [[arXiv:2401.17270]](https://arxiv.org/abs/2401.17270)
10. **SAM**: Kirillov, A., et al. "Segment Anything." *ICCV*, 2023. [[arXiv:2304.02643]](https://arxiv.org/abs/2304.02643)
11. **CLIP**: Radford, A., et al. "Learning Transferable Visual Models From Natural Language Supervision." *ICML*, 2021. [[arXiv:2103.00020]](https://arxiv.org/abs/2103.00020)
12. **ConceptGraphs**: Gu, Q., et al. "ConceptGraphs: Open-Vocabulary 3D Scene Graphs." *arXiv*, 2023. [[arXiv:2309.16650]](https://arxiv.org/abs/2309.16650)
### 物理仿真与世界模型
13. **V-JEPA**: Bardes, A., et al. "Revisiting Feature Prediction for Learning Visual Representations from Video." *Meta AI*, 2024.
14. **DreamerV3**: Hafner, D., et al. "Mastering Diverse Domains through World Models." *arXiv*, 2023. [[arXiv:2301.04104]](https://arxiv.org/abs/2301.04104)
15. **Isaac Sim**: Makoviychuk, V., et al. "Isaac Gym: High Performance GPU-Based Physics Simulation." *NeurIPS*, 2021. [[arXiv:2108.10470]](https://arxiv.org/abs/2108.10470)
### 室内场景理解
16. **Habitat 3.0**: Puig, X., et al. "Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots." *arXiv*, 2023. [[arXiv:2310.13724]](https://arxiv.org/abs/2310.13724)
17. **RoboCasa**: Nasiriany, S., et al. "RoboCasa: Large-Scale Simulation of Household Tasks for Generalist Robots." *arXiv*, 2024. [[arXiv:2406.02523]](https://arxiv.org/abs/2406.02523)
18. **PartNet-Mobility**: Xiang, F., et al. "SAPIEN: A SimulAted Part-based Interactive ENvironment." *CVPR*, 2020. [[arXiv:2003.08515]](https://arxiv.org/abs/2003.08515)
---
## 附录B:常见问题解答(FAQ
### Q1: 为什么选择酒店场景?
**A:** 酒店场景具有以下特点,使其成为理想的研究对象:
- **多样性**:包含公共区域、私密空间、功能区域
- **标准化**:不同酒店有相似的布局,便于泛化
- **挑战性**:存在高反光、弱纹理、动态干扰等难点
- **应用价值**:服务机器人、智能化改造需求强烈
### Q2: 没有LiDAR设备可以实施吗?
**A:** 可以,但需要调整方案:
- **公共区域**:使用纯视觉SLAMORB-SLAM3+ 深度相机
- **客房**:RGB-D相机足够,甚至可以用iPhone的LiDAR
- **精度影响**:几何精度会从2-3cm降至5-10cm,但对大多数应用仍可接受
### Q3: 训练3DGS需要多长时间?
**A:** 取决于场景规模:
- **小客房**(20㎡):30k迭代,约2-3小时(RTX 4090
- **大堂**(200㎡):分块训练,每块3小时,总计10-15小时
- **加速方法**:使用多GPU并行、降低分辨率、减少迭代次数
### Q4: 如何处理隐私问题?
**A:** 采取以下措施:
- 采集前获得酒店书面授权
- 避免拍摄客人面部(使用人脸模糊)
- 不采集个人物品细节
- 数据仅用于研究,不公开发布原始图像
- 发布数据集时进行脱敏处理
### Q5: 项目可以用于其他场景吗?
**A:** 完全可以!技术方案具有通用性:
- **办公室**:类似客房,甚至更简单
- **商场**:类似公共区域,需处理更多动态人流
- **医院**:需额外考虑医疗设备的精确建模
- **住宅**:最接近客房场景
---
## 附录C:联系方式与资源链接
### 项目资源
- 🌐 **项目主页**: https://hotel-scene-reconstruction.github.io
- 💻 **GitHub仓库**: https://github.com/your-org/hotel-scene-reconstruction
- 📊 **数据集**: https://huggingface.co/datasets/hotel-scene/dataset
- 📄 **论文**: https://arxiv.org/abs/2026.xxxxx
- 📹 **演示视频**: https://youtube.com/watch?v=xxxxx
### 社区与支持
- 💬 **讨论区**: https://github.com/your-org/hotel-scene-reconstruction/discussions
- 🐛 **问题反馈**: https://github.com/your-org/hotel-scene-reconstruction/issues
- 📧 **邮件列表**: hotel-recon@googlegroups.com
- 🤝 **贡献指南**: [CONTRIBUTING.md](CONTRIBUTING.md)
### 团队联系
- **项目负责人**: 张三 (zhangsan@university.edu)
- **技术负责人**: 李四 (lisi@university.edu)
- **合作咨询**: cooperation@hotel-recon.org
### 相关资源
- [世界模型综述](../world_models_review.md)
- [物理世界理解研究计划](../understanding_physics_research_plan.md)
- [酒店场景原始方案](../hotel_model.md)
---
**文档版本**: v1.0
**最后更新**: 2026-05-16
**维护者**: 项目团队
---
## 结语
本项目旨在构建一套完整的酒店场景数字孪生系统,为具身智能在真实复杂环境中