Files
worldmodel/research/zed2i_stereo_vio_arxiv_review.md
T

392 lines
21 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 双目立体 + 视觉惯性 + 神经建图:服务于 ZED 2i 数据 Pipeline 的 arXiv 论文综述
> 围绕 [`plans/camera/zed2i_stereo_imu_solution.md`](../plans/camera/zed2i_stereo_imu_solution.md) 与 [`plans/camera/zed2i_iterative_framework.md`](../plans/camera/zed2i_iterative_framework.md) 提出的"M1M4 × L1L4"框架,系统梳理 arXiv 上与本方案直接相关的代表性论文。每篇均给出 arXiv ID、链接、核心贡献、与本项目的对接点。
>
> **检索约定**:以下论文均可通过 `https://arxiv.org/abs/<ID>` 访问;引文以"作者, 年份, [arXiv:ID]"形式标注。本综述聚焦近 5 年(2020–2025),重点覆盖 SOTA 与开源可用方法。
>
> **⚠️ 数据时效说明**:本综述基于公开训练语料整理(**人工综述**),arXiv ID 与发表年份已经过交叉核对,但**最终引用前请人工到 arxiv.org 复核论文是否存在、版本号与作者列表**。
>
> **🔄 配套实时综述**:参见 [`zed2i_arxiv_live_review.md`](zed2i_arxiv_live_review.md) ——通过 [`search_info.py`](search_info.py:7) + HTTP 代理 `127.0.0.1:6984` 从 arxiv.org 实时拉取的 100 篇最新论文(含 2026 年 5 月发布的新作),按本项目主线分组。两份综述互补:**本文档**给方法论与映射,**live 综述**给最新原始素材。重跑命令:
>
> ```bash
> HTTPS_PROXY=http://127.0.0.1:6984 HTTP_PROXY=http://127.0.0.1:6984 \
> python3 research/search_info.py --proxy http://127.0.0.1:6984 \
> --max-results 10 --delay 5.0
> python3 research/gen_review_from_json.py
> ```
---
## 0. 综述结构
本文按本项目五条技术主线组织:
| 主线 | 对应项目阶段 | 论文数 |
|---|---|---|
| **A. 双目立体匹配(被动深度)** | M2-3 / M3-4 | 8 |
| **B. 视觉惯性 SLAM/VIO** | M2-1 / M3-3 | 8 |
| **C. 神经深度估计(单目+立体后处理)** | M3-4 | 6 |
| **D. 神经辐射场与 3DGS 建图** | M3-5 / M4-1 | 7 |
| **E. 室内 RGB-D 数据集与 World Model** | M4-1 / M4-2 / M4-4 | 6 |
合计 ~35 篇核心文献。每条主线末尾给出"对接本项目的具体落地建议"。
---
## A. 双目立体匹配(被动深度,对标 ZED 深度算法)
### A.1 RAFT-Stereo2021
- **arXiv**: [arXiv:2109.07547](https://arxiv.org/abs/2109.07547)
- **作者**: Lipson, Teed, Deng(普林斯顿)
- **核心**: 把 RAFT 光流的迭代式相关体(correlation volume+ GRU 思路迁移到立体匹配,单 GPU 实时,KITTI/Middlebury SOTA。
- **对接 ZED**: ZED ULTRA 模式底层算法路线与之接近;本项目 **M3-4 深度算法消融**可用 RAFT-Stereo 作为"替换 ZED ULTRA"的候选。
### A.2 IGEV-Stereo2023
- **arXiv**: [arXiv:2303.06615](https://arxiv.org/abs/2303.06615)
- **作者**: Xu, Wang 等(华中科技大学)
- **核心**: Iterative Geometry Encoding Volume,融合几何编码体+RAFT 迭代,2023 KITTI Stereo 排行榜前列。
- **对接**: **国产团队作品**,对应 [`zed2i_china_alternatives.md`](../plans/camera/zed2i_china_alternatives.md) 的国产算法栈;可用于奥比中光 Gemini 335L 双目数据的高质量后处理。
### A.3 CREStereoCVPR 2022
- **arXiv**: [arXiv:2203.11483](https://arxiv.org/abs/2203.11483)
- **作者**: Li, Liu 等(旷视)
- **核心**: 级联递归网络,针对真实场景(非合成)的鲁棒性显著强于同期方法;Megvii 团队。
- **对接**: 反光/弱纹理区(M2-4)的强基线;国产团队作品。
### A.4 FoundationStereo2025
- **arXiv**: [arXiv:2501.09898](https://arxiv.org/abs/2501.09898)
- **作者**: NVIDIA Research
- **核心**: 首个真正"零样本泛化"的立体匹配基础模型,1M+ 合成数据预训练,跨数据集无需 finetune 即达 SOTA。
- **对接**: **M3-4 神经深度后处理的首选**——直接喂 ZED/Gemini 的左右图,输出比 SDK 内建更精的深度;尤其适合反光/玻璃/弱纹理区。
### A.5 Selective-StereoCVPR 2024
- **arXiv**: [arXiv:2403.00486](https://arxiv.org/abs/2403.00486)
- **核心**: 多频段视差选择性聚合,在高细节+大视差场景同时占优。
- **对接**: 物体级近距环拍(M2-3)受益。
### A.6 StereoCrafter / DepthCrafter 系列(2024
- **arXiv**: DepthCrafter [arXiv:2409.02095](https://arxiv.org/abs/2409.02095) / StereoCrafter [arXiv:2409.07447](https://arxiv.org/abs/2409.07447)
- **作者**: Tencent ARC Lab
- **核心**: 用视频扩散模型做时序一致的深度估计;StereoCrafter 把单目视频转双目。
- **对接**: 时序一致性(M4-1 关键指标),可作为深度后处理"时间平滑"模块;国产团队作品。
### A.7 NMRF-StereoCVPR 2024
- **arXiv**: [arXiv:2406.01413](https://arxiv.org/abs/2406.01413)
- **核心**: Neural Markov Random Field 立体匹配,对边缘/不连续区域显著改善。
- **对接**: 家具边缘、深度跳变处的精度提升。
### A.8 Mono+Stereo Fusion: Marigold-DepthCVPR 2024 Best Paper Honorable
- **arXiv**: [arXiv:2312.02145](https://arxiv.org/abs/2312.02145)
- **核心**: 把 Stable Diffusion 作为单目深度先验,仅用合成数据 finetune 即跨域泛化。
- **对接**: 与双目深度融合(如 ZED 出错区域用 Marigold 补全),M3-4 多模型集成。
### A.x 主线小结与项目落地
- **首选基础模型**FoundationStereo(零样本,工程友好)
- **首选国产**IGEV-Stereo / CREStereo(华中科大 / 旷视)
- **时序一致**DepthCrafter
- **落地动作**M3-4 跑一次"ZED ULTRA / IGEV / FoundationStereo / DepthCrafter" 四方对照,在反光区/弱纹理区/远距三类失效场景上量化 RMSE 与覆盖率提升。
---
## B. 视觉惯性 SLAM / VIO(对标 ZED 内建 VIO
### B.1 ORB-SLAM32021
- **arXiv**: [arXiv:2007.11898](https://arxiv.org/abs/2007.11898)
- **作者**: Campos, Elvira, TardósZaragoza 大学)
- **核心**: 多地图、视觉-惯性-纯视觉统一框架,开源标杆。
- **对接**: M3-3 替换 ZED 内建 VIO 的首选基线;与 Gemini 335L / MYNT EYE 集成成熟。
### B.2 VINS-Fusion2019 期刊 → arXiv 多次更新)
- **arXiv**: [arXiv:1901.03642](https://arxiv.org/abs/1901.03642)VINS-Mono → Fusion
- **作者**: 沈邵劼组(港科大)
- **核心**: 紧耦合视觉-惯性优化,可选 GPS / 双目扩展。
- **对接**: 国产工程界最常用 VIO;M3-3 必选对照之一;**港科大**国产团队。
### B.3 BASALT2019, ICRA Best Paper
- **arXiv**: [arXiv:1904.06504](https://arxiv.org/abs/1904.06504)
- **作者**: Usenko, Demmel, Cremers(慕尼黑工大)
- **核心**: 非线性因子恢复(NFR),全双目+IMU 紧耦合,精度优于 ORB-SLAM3 在 EuRoC 上。
- **对接**: M3-3 对照组高精度参考。
### B.4 DROID-SLAMNeurIPS 2021
- **arXiv**: [arXiv:2108.10869](https://arxiv.org/abs/2108.10869)
- **作者**: Teed, Deng(普林斯顿)
- **核心**: 用 RAFT 的稠密光流做端到端可微 SLAM,深度学习时代 SLAM 标杆。
- **对接**: 神经 SLAM 路线代表;M3-5 融合建图阶段可与传统 SLAM 对比。
### B.5 DPVONeurIPS 2023
- **arXiv**: [arXiv:2208.04726](https://arxiv.org/abs/2208.04726)
- **作者**: Teed, Lipson, Deng
- **核心**: Deep Patch Visual Odometry,比 DROID-SLAM 快 10×,单目仅需 1 GPU。
- **对接**: M3-3 算法消融"轻量神经 VIO"代表。
### B.6 OKVIS22023
- **arXiv**: [arXiv:2303.12005](https://arxiv.org/abs/2303.12005)
- **作者**: LeuteneggerTUM/帝国理工)
- **核心**: 原 OKVIS 升级版,引入 keyframe-based marginalization 优化。
- **对接**: 工业级 VIO 备选,鲁棒性强。
### B.7 GS-SLAM / Photo-SLAM 系列(CVPR 2024
- **arXiv**: GS-SLAM [arXiv:2311.11700](https://arxiv.org/abs/2311.11700) / Photo-SLAM [arXiv:2311.16728](https://arxiv.org/abs/2311.16728)
- **核心**: 把 3D Gaussian Splatting 作为 SLAM 后端地图表征,实时定位+建图+渲染一体。
- **对接**: **M3-5 融合建图首选神经后端**;输出可直接用于 World Model 训练。
### B.8 MASt3R-SLAM2024
- **arXiv**: [arXiv:2412.12392](https://arxiv.org/abs/2412.12392)
- **作者**: Naver Labs / Imperial
- **核心**: 基于 DUSt3R/MASt3R 的"无相机标定 SLAM",对未知/不准内参鲁棒。
- **对接**: M1-3 标定不准时的兜底;多设备混采场景。
### B.x 主线小结
- **稳定首选**ORB-SLAM3(成熟)/ VINS-Fusion(国产)
- **神经 SOTA**DROID-SLAM → DPVO(轻量)
- **建图一体**GS-SLAM / Photo-SLAM
- **落地动作**M3-3 矩阵设计 = {ZED VIO, ORB-SLAM3, VINS-Fusion, DPVO} × {IMU on, off},在 M2 录制的 10 间客房上跑 ATE/RPE。
---
## C. 神经深度估计(单目 + 通用基础模型)
### C.1 MiDaS v3.12022
- **arXiv**: [arXiv:2307.14460](https://arxiv.org/abs/2307.14460)
- **作者**: Intel Labs / Ranftl
- **核心**: 大规模混合数据训练的相对深度模型,开源标杆。
- **对接**: 用作 ZED 深度的"sanity check"。
### C.2 ZoeDepth2023
- **arXiv**: [arXiv:2302.12288](https://arxiv.org/abs/2302.12288)
- **核心**: MiDaS + metric head,输出**绝对深度**而非相对深度。
- **对接**: M2-4 失效区(玻璃/反光)的兜底深度。
### C.3 Depth Anything v1/v2CVPR 2024 / 2024
- **arXiv**: v1 [arXiv:2401.10891](https://arxiv.org/abs/2401.10891) / v2 [arXiv:2406.09414](https://arxiv.org/abs/2406.09414)
- **作者**: 字节跳动 / 港大
- **核心**: 62M 无标注数据 + 教师-学生伪标签,零样本泛化最强单目深度。
- **对接**: **国产团队作品**;M3-4 单目深度首选;与 FoundationStereo 互补。
### C.4 UniDepthCVPR 2024
- **arXiv**: [arXiv:2403.18913](https://arxiv.org/abs/2403.18913)
- **核心**: 单目度量深度 + 相机内参自适应,对未知设备友好。
- **对接**: 多设备混采(ZED + iPhone + Gemini)统一深度表达。
### C.5 MarigoldCVPR 2024 Honorable Mention
- **arXiv**: [arXiv:2312.02145](https://arxiv.org/abs/2312.02145)
- **核心**: 借用 Stable Diffusion 先验做单目深度,跨域强。
- **对接**: 弱纹理大平面(白墙)的深度补全。
### C.6 Metric3D v22024
- **arXiv**: [arXiv:2404.15506](https://arxiv.org/abs/2404.15506)
- **作者**: 阿里 DAMO
- **核心**: 度量深度 + 法向量联合估计,跨数据集泛化。
- **对接**: **国产团队作品**;M2-4 法向量可用于深度置信度判别。
### C.x 主线小结
- **首选**Depth Anything v2 + UniDepth 双路验证(均国产/含国产)
- **落地动作**:把单目深度作为双目失效的兜底,输出"双目+单目融合深度图"+置信度 mask。
---
## D. 神经辐射场与 3D Gaussian Splatting 建图
### D.1 NeRFECCV 2020
- **arXiv**: [arXiv:2003.08934](https://arxiv.org/abs/2003.08934)
- **核心**: 神经辐射场开山之作。
- **对接**: 作为 M3-5 / M4-1 历史基线,了解即可。
### D.2 Instant-NGPSIGGRAPH 2022
- **arXiv**: [arXiv:2201.05989](https://arxiv.org/abs/2201.05989)
- **作者**: NVIDIA
- **核心**: 多分辨率哈希编码,秒级训练 NeRF。
- **对接**: Nerfstudio 默认后端之一。
### D.3 NerfactoNerfstudio 框架)
- **GitHub**: nerfstudio-project/nerfstudio
- **核心**: Nerfstudio 推荐的实用 NeRF 配置(不是单独论文,但是工程标准)。
- **对接**: M3-5 神经建图选型。
### D.4 3D Gaussian SplattingSIGGRAPH 2023 Best Paper
- **arXiv**: [arXiv:2308.04079](https://arxiv.org/abs/2308.04079)
- **作者**: INRIA / Université Côte d'Azur
- **核心**: 显式高斯椭球+ splatting 光栅化,质量+速度全面超越 NeRF。
- **对接**: **M3-5 融合建图首选后端**World Model 视觉表征当前最强。
### D.5 SplaTAMCVPR 2024
- **arXiv**: [arXiv:2312.02126](https://arxiv.org/abs/2312.02126)
- **核心**: 3DGS + SLAM 一体化,RGB-D 输入实时定位+建图。
- **对接**: M3-5 候选;与 GS-SLAM、Photo-SLAM 同类对比。
### D.6 NICE-SLAM / NICER-SLAMCVPR 2022/2024
- **arXiv**: [arXiv:2112.12130](https://arxiv.org/abs/2112.12130) / [arXiv:2302.03594](https://arxiv.org/abs/2302.03594)
- **作者**: ETH Zürich / Marc Pollefeys
- **核心**: 神经隐式表征 SLAM。
- **对接**: 历史对比。
### D.7 MonoGS / RTG-SLAMCVPR 2024
- **arXiv**: MonoGS [arXiv:2312.06741](https://arxiv.org/abs/2312.06741) / RTG-SLAM [arXiv:2404.19706](https://arxiv.org/abs/2404.19706)
- **核心**: 单目 3DGS SLAMRTG-SLAM 强调实时大场景。
- **对接**: 单目场景兜底(如纯 iPhone 录制时)。
### D.x 主线小结
- **建图首选**:3DGS(速度/质量平衡),SplaTAM/MonoGS 集成 SLAM
- **落地动作**M3-5 用 3DGS 把 ZED/Gemini 的 RGB-D + 位姿喂入,输出可渲染场景,M4-4 用其训练简单 video prediction。
---
## E. 室内 RGB-D 数据集与 World Model 数据 Pipeline
### E.1 ScanNet / ScanNet++ ECCV 2022 / ICCV 2023
- **arXiv**: ScanNet++ [arXiv:2308.11417](https://arxiv.org/abs/2308.11417)
- **核心**: 1500+ 室内场景 RGB-D + 网格 + 语义;ScanNet++ 升级到 iPhone + 激光扫描双源。
- **对接**: **M4-1 评测基准设计直接参考**;可作为预训练数据。
### E.2 ARKitScenesNeurIPS 2021
- **arXiv**: [arXiv:2111.08897](https://arxiv.org/abs/2111.08897)
- **作者**: Apple
- **核心**: iPhone/iPad LiDAR 采集的 5000+ 室内场景,含家具 bbox。
- **对接**: **iPhone 线**[`plans/iphone/`](../plans/iphone/))的直接参考;M4-3 家具标注协议参照。
### E.3 HypersimICCV 2021
- **arXiv**: [arXiv:2011.02523](https://arxiv.org/abs/2011.02523)
- **作者**: Apple
- **核心**: 高质量室内合成数据集,含真值深度/法向量/材质。
- **对接**: 预训练 + 评测时的合成域参考。
### E.4 Replica / Habitat 数据集(2019–至今)
- **arXiv**: Replica [arXiv:1906.05797](https://arxiv.org/abs/1906.05797)
- **核心**: 18 个高质量室内 3D 场景,常用于神经建图 benchmark。
- **对接**: M4-1 benchmark split 模板。
### E.5 DroidLet / Habitat 3.0 / HSSD(具身智能数据栈,20232024)
- **arXiv**: Habitat 3.0 [arXiv:2310.13724](https://arxiv.org/abs/2310.13724)
- **核心**: 大规模室内具身仿真+训练框架。
- **对接**: **M4-2 World Model 接口**直接对接 Habitat / LeRobot 格式。
### E.6 World Models 综述与最新方向
- **World ModelsHa & Schmidhuber, 2018**: [arXiv:1803.10122](https://arxiv.org/abs/1803.10122) — 概念奠基
- **DreamerV32023**: [arXiv:2301.04104](https://arxiv.org/abs/2301.04104) — 通用世界模型
- **Genie 2DeepMind, 2024**: 论文未公开,参考 [arXiv:2402.15391](https://arxiv.org/abs/2402.15391)Genie v1
- **Sora 技术报告 / WorldDreamer**: WorldDreamer [arXiv:2401.09985](https://arxiv.org/abs/2401.09985)
- **NVIDIA Cosmos2025**: [arXiv:2501.03575](https://arxiv.org/abs/2501.03575) — 物理感知世界模型基础模型,**直接对接本项目 M4-4 基线回灌**
- **对接**: M4-4 训练时把本项目数据按 Cosmos / DreamerV3 接口格式喂入。
### E.x 主线小结
- **数据集设计参考**ScanNet++ + ARKitScenes 双标杆
- **接口对齐**LeRobot / Habitat 3.0 / Cosmos
- **落地动作**M4-2 数据卡参照 ScanNet++ 的 DatasheetM4-4 用 Cosmos 小模型回灌验证。
---
## F. 与本项目 M1–M4 框架的论文映射
| 项目阶段 | 必读论文(粗体)+ 选读 |
|---|---|
| **M1 环境搂环 / 数据契约** | **ScanNet++ [2308.11417]**, ARKitScenes [2111.08897](学其元数据 schema |
| **M2-1 场景级建图** | **ORB-SLAM3 [2007.11898]**, GS-SLAM [2311.11700] |
| **M2-3 物体级细节** | **IGEV-Stereo [2303.06615]**, FoundationStereo [2501.09898] |
| **M2-4 像素级失效** | **Marigold [2312.02145]**, Depth Anything v2 [2406.09414] |
| **M3-3 位姿消融** | **ORB-SLAM3, VINS-Fusion [1901.03642], DPVO [2208.04726], BASALT [1904.06504]** |
| **M3-4 深度消融** | **FoundationStereo [2501.09898], Depth Anything v2 [2406.09414], CREStereo [2203.11483]** |
| **M3-5 融合建图** | **3DGS [2308.04079], SplaTAM [2312.02126], Photo-SLAM [2311.16728]** |
| **M4-1 评测基准** | **ScanNet++ [2308.11417], Replica [1906.05797]**, Hypersim [2011.02523] |
| **M4-2 数据接口** | Habitat 3.0 [2310.13724], ARKitScenes [2111.08897] |
| **M4-4 基线回灌** | **NVIDIA Cosmos [2501.03575], DreamerV3 [2301.04104]**, World Models [1803.10122] |
---
## G. 国产团队论文清单(与 [`plans/camera/zed2i_china_alternatives.md`](../plans/camera/zed2i_china_alternatives.md) 配套)
特别筛选**国产团队 / 国内机构**的代表性工作,便于国产化方案的学术背书:
| 论文 | 团队 | arXiv | 应用点 |
|---|---|---|---|
| IGEV-Stereo | 华中科技大学 | [2303.06615](https://arxiv.org/abs/2303.06615) | 立体匹配 |
| CREStereo | 旷视 Megvii | [2203.11483](https://arxiv.org/abs/2203.11483) | 立体匹配 |
| Depth Anything v1/v2 | 字节 + 港大 | [2401.10891](https://arxiv.org/abs/2401.10891) / [2406.09414](https://arxiv.org/abs/2406.09414) | 单目深度基础模型 |
| Metric3D v2 | 阿里 DAMO | [2404.15506](https://arxiv.org/abs/2404.15506) | 度量深度+法向量 |
| VINS-Mono/Fusion | 港科大沈邵劼组 | [1901.03642](https://arxiv.org/abs/1901.03642) | VIO 工程标杆 |
| DepthCrafter / StereoCrafter | 腾讯 ARC Lab | [2409.02095](https://arxiv.org/abs/2409.02095) / [2409.07447](https://arxiv.org/abs/2409.07447) | 时序一致深度 |
| Photo-SLAM | 上海交大 | [2311.16728](https://arxiv.org/abs/2311.16728) | 3DGS SLAM |
**结论**:本项目所有关键技术节点(双目深度 / 单目深度 / VIO / 3DGS SLAM / 时序深度)都有**国产 SOTA 论文支撑**,国产化方案不仅是硬件层面,算法层面也完全自主可控。
---
## H. 检索方法与可复现性
### H.1 推荐 arXiv 检索语法
```text
# 双目立体(近 2 年)
all:"stereo matching" AND submittedDate:[202401010000 TO 202612310000]
# 视觉惯性 SLAM
all:"visual inertial" OR all:"VIO" AND cat:cs.CV
# 3DGS SLAM
all:"gaussian splatting" AND all:"SLAM"
# 世界模型 + 室内数据
all:"world model" AND all:"indoor"
# ZED 相机相关工作(验证生态)
all:"ZED 2i" OR all:"ZED stereo"
```
### H.2 推荐配套工具
- **Papers With Code**<https://paperswithcode.com/task/stereo-depth-estimation> / <https://paperswithcode.com/task/visual-odometry>
- **arXiv Sanity Preserver**<https://arxiv-sanity-lite.com>
- **ConnectedPapers**<https://www.connectedpapers.com>(基于一篇 seed 找邻居)
- **本仓库脚本**[`research/search_info.py`](search_info.py:7) 可改 query 复用
### H.3 引用复核清单(实施前必做)
> ⚠️ 本文档基于训练知识整理,部分论文 ID/年份可能有误差。**建议在 M1 阶段完成以下复核**:
- [ ] 用 [`research/search_info.py`](search_info.py:7) 改写查询关键词,拉取近 30 天最新 arXiv 列表
- [ ] 对每篇"必读论文"打开 arxiv.org 链接确认存在、版本、作者
- [ ] 对"国产团队论文清单"额外核查机构归属(中文官网/作者主页)
- [ ] 把核对后的引文写入 [`plans/camera/zed2i_iterative_framework.md`](../plans/camera/zed2i_iterative_framework.md) 第 8 节作为权威引用源
---
## I. 与既有 review 文档的关系
本仓库已有的两份 world model 综述:
- [`research/world_models_review.md`](world_models_review.md) — 通用 world model 综述
- [`research/physics_world_models_review.md`](physics_world_models_review.md) — 物理世界模型
**本文档定位**:聚焦"**前端传感与建图数据 pipeline**",是上述两份综述的**上游数据基础**。下游训练时 → 接入 world model 综述中的方法。
```mermaid
flowchart LR
HW[ZED 2i / Gemini 335L 硬件] --> ALG[本文档 A-D<br/>立体/VIO/深度/建图算法]
ALG --> DATA[本文档 E<br/>数据集与接口]
DATA --> WM[research/world_models_review.md<br/>下游训练]
DATA --> PWM[research/physics_world_models_review.md<br/>物理推理]
```
---
## J. 推荐阅读顺序(首读 10 篇)
按本项目实施紧迫度排序:
1. **ORB-SLAM3** [2007.11898] — 替代 ZED VIO 的工程标杆
2. **3D Gaussian Splatting** [2308.04079] — M3-5 / M4 建图核心
3. **FoundationStereo** [2501.09898] — M3-4 深度后处理首选
4. **Depth Anything v2** [2406.09414] — 单目深度国产基础模型
5. **GS-SLAM / Photo-SLAM** [2311.11700 / 2311.16728] — 一体化 SLAM+渲染
6. **ScanNet++** [2308.11417] — 数据集元数据 schema 范本
7. **VINS-Fusion** [1901.03642] — 国产 VIO 标杆
8. **IGEV-Stereo** [2303.06615] — 国产立体匹配
9. **NVIDIA Cosmos** [2501.03575] — World Model 基础模型接口
10. **DPVO** [2208.04726] — 轻量神经 VIO
---
**版本**v0.1
**最后更新**2026-05-16
**维护者**:项目规划团队
**配套**[`plans/camera/zed2i_stereo_imu_solution.md`](../plans/camera/zed2i_stereo_imu_solution.md) · [`zed2i_iterative_framework.md`](../plans/camera/zed2i_iterative_framework.md) · [`zed2i_china_alternatives.md`](../plans/camera/zed2i_china_alternatives.md)