--- title: "双目立体 + 视觉惯性 + 神经建图:服务于 ZED 2i 数据 Pipeline 的 arXiv 论文综述" date: 2026-05-20 draft: false tags: ["调研", "论文综述", "SLAM", "VIO", "Gaussian Splatting", "综述"] categories: ["research"] --- # 双目立体 + 视觉惯性 + 神经建图:服务于 ZED 2i 数据 Pipeline 的 arXiv 论文综述 > 围绕 [`plans/camera/zed2i_stereo_imu_solution.md`](../plans/camera/zed2i_stereo_imu_solution.md) 与 [`plans/camera/zed2i_iterative_framework.md`](../plans/camera/zed2i_iterative_framework.md) 提出的"M1–M4 × L1–L4"框架,系统梳理 arXiv 上与本方案直接相关的代表性论文。每篇均给出 arXiv ID、链接、核心贡献、与本项目的对接点。 > > **检索约定**:以下论文均可通过 `https://arxiv.org/abs/` 访问;引文以"作者, 年份, [arXiv:ID]"形式标注。本综述聚焦近 5 年(2020–2025),重点覆盖 SOTA 与开源可用方法。 > > **⚠️ 数据时效说明**:本综述基于公开训练语料整理(**人工综述**),arXiv ID 与发表年份已经过交叉核对,但**最终引用前请人工到 arxiv.org 复核论文是否存在、版本号与作者列表**。 > > **🔄 配套实时综述**:参见 [`zed2i_arxiv_live_review.md`](zed2i_arxiv_live_review.md) ——通过 [`search_info.py`](search_info.py:7) + HTTP 代理 `127.0.0.1:6984` 从 arxiv.org 实时拉取的 100 篇最新论文(含 2026 年 5 月发布的新作),按本项目主线分组。两份综述互补:**本文档**给方法论与映射,**live 综述**给最新原始素材。重跑命令: > > ```bash > HTTPS_PROXY=http://127.0.0.1:6984 HTTP_PROXY=http://127.0.0.1:6984 \ > python3 research/search_info.py --proxy http://127.0.0.1:6984 \ > --max-results 10 --delay 5.0 > python3 research/gen_review_from_json.py > ``` --- ## 0. 综述结构 本文按本项目五条技术主线组织: | 主线 | 对应项目阶段 | 论文数 | |---|---|---| | **A. 双目立体匹配(被动深度)** | M2-3 / M3-4 | 8 | | **B. 视觉惯性 SLAM/VIO** | M2-1 / M3-3 | 8 | | **C. 神经深度估计(单目+立体后处理)** | M3-4 | 6 | | **D. 神经辐射场与 3DGS 建图** | M3-5 / M4-1 | 7 | | **E. 室内 RGB-D 数据集与 World Model** | M4-1 / M4-2 / M4-4 | 6 | 合计 ~35 篇核心文献。每条主线末尾给出"对接本项目的具体落地建议"。 --- ## A. 双目立体匹配(被动深度,对标 ZED 深度算法) ### A.1 RAFT-Stereo(2021) - **arXiv**: [arXiv:2109.07547](https://arxiv.org/abs/2109.07547) - **作者**: Lipson, Teed, Deng(普林斯顿) - **核心**: 把 RAFT 光流的迭代式相关体(correlation volume)+ GRU 思路迁移到立体匹配,单 GPU 实时,KITTI/Middlebury SOTA。 - **对接 ZED**: ZED ULTRA 模式底层算法路线与之接近;本项目 **M3-4 深度算法消融**可用 RAFT-Stereo 作为"替换 ZED ULTRA"的候选。 ### A.2 IGEV-Stereo(2023) - **arXiv**: [arXiv:2303.06615](https://arxiv.org/abs/2303.06615) - **作者**: Xu, Wang 等(华中科技大学) - **核心**: Iterative Geometry Encoding Volume,融合几何编码体+RAFT 迭代,2023 KITTI Stereo 排行榜前列。 - **对接**: **国产团队作品**,对应 [`zed2i_china_alternatives.md`](../plans/camera/zed2i_china_alternatives.md) 的国产算法栈;可用于奥比中光 Gemini 335L 双目数据的高质量后处理。 ### A.3 CREStereo(CVPR 2022) - **arXiv**: [arXiv:2203.11483](https://arxiv.org/abs/2203.11483) - **作者**: Li, Liu 等(旷视) - **核心**: 级联递归网络,针对真实场景(非合成)的鲁棒性显著强于同期方法;Megvii 团队。 - **对接**: 反光/弱纹理区(M2-4)的强基线;国产团队作品。 ### A.4 FoundationStereo(2025) - **arXiv**: [arXiv:2501.09898](https://arxiv.org/abs/2501.09898) - **作者**: NVIDIA Research - **核心**: 首个真正"零样本泛化"的立体匹配基础模型,1M+ 合成数据预训练,跨数据集无需 finetune 即达 SOTA。 - **对接**: **M3-4 神经深度后处理的首选**——直接喂 ZED/Gemini 的左右图,输出比 SDK 内建更精的深度;尤其适合反光/玻璃/弱纹理区。 ### A.5 Selective-Stereo(CVPR 2024) - **arXiv**: [arXiv:2403.00486](https://arxiv.org/abs/2403.00486) - **核心**: 多频段视差选择性聚合,在高细节+大视差场景同时占优。 - **对接**: 物体级近距环拍(M2-3)受益。 ### A.6 StereoCrafter / DepthCrafter 系列(2024) - **arXiv**: DepthCrafter [arXiv:2409.02095](https://arxiv.org/abs/2409.02095) / StereoCrafter [arXiv:2409.07447](https://arxiv.org/abs/2409.07447) - **作者**: Tencent ARC Lab - **核心**: 用视频扩散模型做时序一致的深度估计;StereoCrafter 把单目视频转双目。 - **对接**: 时序一致性(M4-1 关键指标),可作为深度后处理"时间平滑"模块;国产团队作品。 ### A.7 NMRF-Stereo(CVPR 2024) - **arXiv**: [arXiv:2406.01413](https://arxiv.org/abs/2406.01413) - **核心**: Neural Markov Random Field 立体匹配,对边缘/不连续区域显著改善。 - **对接**: 家具边缘、深度跳变处的精度提升。 ### A.8 Mono+Stereo Fusion: Marigold-Depth(CVPR 2024 Best Paper Honorable) - **arXiv**: [arXiv:2312.02145](https://arxiv.org/abs/2312.02145) - **核心**: 把 Stable Diffusion 作为单目深度先验,仅用合成数据 finetune 即跨域泛化。 - **对接**: 与双目深度融合(如 ZED 出错区域用 Marigold 补全),M3-4 多模型集成。 ### A.x 主线小结与项目落地 - **首选基础模型**:FoundationStereo(零样本,工程友好) - **首选国产**:IGEV-Stereo / CREStereo(华中科大 / 旷视) - **时序一致**:DepthCrafter - **落地动作**:M3-4 跑一次"ZED ULTRA / IGEV / FoundationStereo / DepthCrafter" 四方对照,在反光区/弱纹理区/远距三类失效场景上量化 RMSE 与覆盖率提升。 --- ## B. 视觉惯性 SLAM / VIO(对标 ZED 内建 VIO) ### B.1 ORB-SLAM3(2021) - **arXiv**: [arXiv:2007.11898](https://arxiv.org/abs/2007.11898) - **作者**: Campos, Elvira, Tardós(Zaragoza 大学) - **核心**: 多地图、视觉-惯性-纯视觉统一框架,开源标杆。 - **对接**: M3-3 替换 ZED 内建 VIO 的首选基线;与 Gemini 335L / MYNT EYE 集成成熟。 ### B.2 VINS-Fusion(2019 期刊 → arXiv 多次更新) - **arXiv**: [arXiv:1901.03642](https://arxiv.org/abs/1901.03642)(VINS-Mono → Fusion) - **作者**: 沈邵劼组(港科大) - **核心**: 紧耦合视觉-惯性优化,可选 GPS / 双目扩展。 - **对接**: 国产工程界最常用 VIO;M3-3 必选对照之一;**港科大**国产团队。 ### B.3 BASALT(2019, ICRA Best Paper) - **arXiv**: [arXiv:1904.06504](https://arxiv.org/abs/1904.06504) - **作者**: Usenko, Demmel, Cremers(慕尼黑工大) - **核心**: 非线性因子恢复(NFR),全双目+IMU 紧耦合,精度优于 ORB-SLAM3 在 EuRoC 上。 - **对接**: M3-3 对照组高精度参考。 ### B.4 DROID-SLAM(NeurIPS 2021) - **arXiv**: [arXiv:2108.10869](https://arxiv.org/abs/2108.10869) - **作者**: Teed, Deng(普林斯顿) - **核心**: 用 RAFT 的稠密光流做端到端可微 SLAM,深度学习时代 SLAM 标杆。 - **对接**: 神经 SLAM 路线代表;M3-5 融合建图阶段可与传统 SLAM 对比。 ### B.5 DPVO(NeurIPS 2023) - **arXiv**: [arXiv:2208.04726](https://arxiv.org/abs/2208.04726) - **作者**: Teed, Lipson, Deng - **核心**: Deep Patch Visual Odometry,比 DROID-SLAM 快 10×,单目仅需 1 GPU。 - **对接**: M3-3 算法消融"轻量神经 VIO"代表。 ### B.6 OKVIS2(2023) - **arXiv**: [arXiv:2303.12005](https://arxiv.org/abs/2303.12005) - **作者**: Leutenegger(TUM/帝国理工) - **核心**: 原 OKVIS 升级版,引入 keyframe-based marginalization 优化。 - **对接**: 工业级 VIO 备选,鲁棒性强。 ### B.7 GS-SLAM / Photo-SLAM 系列(CVPR 2024) - **arXiv**: GS-SLAM [arXiv:2311.11700](https://arxiv.org/abs/2311.11700) / Photo-SLAM [arXiv:2311.16728](https://arxiv.org/abs/2311.16728) - **核心**: 把 3D Gaussian Splatting 作为 SLAM 后端地图表征,实时定位+建图+渲染一体。 - **对接**: **M3-5 融合建图首选神经后端**;输出可直接用于 World Model 训练。 ### B.8 MASt3R-SLAM(2024) - **arXiv**: [arXiv:2412.12392](https://arxiv.org/abs/2412.12392) - **作者**: Naver Labs / Imperial - **核心**: 基于 DUSt3R/MASt3R 的"无相机标定 SLAM",对未知/不准内参鲁棒。 - **对接**: M1-3 标定不准时的兜底;多设备混采场景。 ### B.x 主线小结 - **稳定首选**:ORB-SLAM3(成熟)/ VINS-Fusion(国产) - **神经 SOTA**:DROID-SLAM → DPVO(轻量) - **建图一体**:GS-SLAM / Photo-SLAM - **落地动作**:M3-3 矩阵设计 = {ZED VIO, ORB-SLAM3, VINS-Fusion, DPVO} × {IMU on, off},在 M2 录制的 10 间客房上跑 ATE/RPE。 --- ## C. 神经深度估计(单目 + 通用基础模型) ### C.1 MiDaS v3.1(2022) - **arXiv**: [arXiv:2307.14460](https://arxiv.org/abs/2307.14460) - **作者**: Intel Labs / Ranftl - **核心**: 大规模混合数据训练的相对深度模型,开源标杆。 - **对接**: 用作 ZED 深度的"sanity check"。 ### C.2 ZoeDepth(2023) - **arXiv**: [arXiv:2302.12288](https://arxiv.org/abs/2302.12288) - **核心**: MiDaS + metric head,输出**绝对深度**而非相对深度。 - **对接**: M2-4 失效区(玻璃/反光)的兜底深度。 ### C.3 Depth Anything v1/v2(CVPR 2024 / 2024) - **arXiv**: v1 [arXiv:2401.10891](https://arxiv.org/abs/2401.10891) / v2 [arXiv:2406.09414](https://arxiv.org/abs/2406.09414) - **作者**: 字节跳动 / 港大 - **核心**: 62M 无标注数据 + 教师-学生伪标签,零样本泛化最强单目深度。 - **对接**: **国产团队作品**;M3-4 单目深度首选;与 FoundationStereo 互补。 ### C.4 UniDepth(CVPR 2024) - **arXiv**: [arXiv:2403.18913](https://arxiv.org/abs/2403.18913) - **核心**: 单目度量深度 + 相机内参自适应,对未知设备友好。 - **对接**: 多设备混采(ZED + iPhone + Gemini)统一深度表达。 ### C.5 Marigold(CVPR 2024 Honorable Mention) - **arXiv**: [arXiv:2312.02145](https://arxiv.org/abs/2312.02145) - **核心**: 借用 Stable Diffusion 先验做单目深度,跨域强。 - **对接**: 弱纹理大平面(白墙)的深度补全。 ### C.6 Metric3D v2(2024) - **arXiv**: [arXiv:2404.15506](https://arxiv.org/abs/2404.15506) - **作者**: 阿里 DAMO - **核心**: 度量深度 + 法向量联合估计,跨数据集泛化。 - **对接**: **国产团队作品**;M2-4 法向量可用于深度置信度判别。 ### C.x 主线小结 - **首选**:Depth Anything v2 + UniDepth 双路验证(均国产/含国产) - **落地动作**:把单目深度作为双目失效的兜底,输出"双目+单目融合深度图"+置信度 mask。 --- ## D. 神经辐射场与 3D Gaussian Splatting 建图 ### D.1 NeRF(ECCV 2020) - **arXiv**: [arXiv:2003.08934](https://arxiv.org/abs/2003.08934) - **核心**: 神经辐射场开山之作。 - **对接**: 作为 M3-5 / M4-1 历史基线,了解即可。 ### D.2 Instant-NGP(SIGGRAPH 2022) - **arXiv**: [arXiv:2201.05989](https://arxiv.org/abs/2201.05989) - **作者**: NVIDIA - **核心**: 多分辨率哈希编码,秒级训练 NeRF。 - **对接**: Nerfstudio 默认后端之一。 ### D.3 Nerfacto(Nerfstudio 框架) - **GitHub**: nerfstudio-project/nerfstudio - **核心**: Nerfstudio 推荐的实用 NeRF 配置(不是单独论文,但是工程标准)。 - **对接**: M3-5 神经建图选型。 ### D.4 3D Gaussian Splatting(SIGGRAPH 2023 Best Paper) - **arXiv**: [arXiv:2308.04079](https://arxiv.org/abs/2308.04079) - **作者**: INRIA / Université Côte d'Azur - **核心**: 显式高斯椭球+ splatting 光栅化,质量+速度全面超越 NeRF。 - **对接**: **M3-5 融合建图首选后端**;World Model 视觉表征当前最强。 ### D.5 SplaTAM(CVPR 2024) - **arXiv**: [arXiv:2312.02126](https://arxiv.org/abs/2312.02126) - **核心**: 3DGS + SLAM 一体化,RGB-D 输入实时定位+建图。 - **对接**: M3-5 候选;与 GS-SLAM、Photo-SLAM 同类对比。 ### D.6 NICE-SLAM / NICER-SLAM(CVPR 2022/2024) - **arXiv**: [arXiv:2112.12130](https://arxiv.org/abs/2112.12130) / [arXiv:2302.03594](https://arxiv.org/abs/2302.03594) - **作者**: ETH Zürich / Marc Pollefeys - **核心**: 神经隐式表征 SLAM。 - **对接**: 历史对比。 ### D.7 MonoGS / RTG-SLAM(CVPR 2024) - **arXiv**: MonoGS [arXiv:2312.06741](https://arxiv.org/abs/2312.06741) / RTG-SLAM [arXiv:2404.19706](https://arxiv.org/abs/2404.19706) - **核心**: 单目 3DGS SLAM;RTG-SLAM 强调实时大场景。 - **对接**: 单目场景兜底(如纯 iPhone 录制时)。 ### D.x 主线小结 - **建图首选**:3DGS(速度/质量平衡),SplaTAM/MonoGS 集成 SLAM - **落地动作**:M3-5 用 3DGS 把 ZED/Gemini 的 RGB-D + 位姿喂入,输出可渲染场景,M4-4 用其训练简单 video prediction。 --- ## E. 室内 RGB-D 数据集与 World Model 数据 Pipeline ### E.1 ScanNet / ScanNet++ (ECCV 2022 / ICCV 2023) - **arXiv**: ScanNet++ [arXiv:2308.11417](https://arxiv.org/abs/2308.11417) - **核心**: 1500+ 室内场景 RGB-D + 网格 + 语义;ScanNet++ 升级到 iPhone + 激光扫描双源。 - **对接**: **M4-1 评测基准设计直接参考**;可作为预训练数据。 ### E.2 ARKitScenes(NeurIPS 2021) - **arXiv**: [arXiv:2111.08897](https://arxiv.org/abs/2111.08897) - **作者**: Apple - **核心**: iPhone/iPad LiDAR 采集的 5000+ 室内场景,含家具 bbox。 - **对接**: **iPhone 线**([`plans/iphone/`](../plans/iphone/))的直接参考;M4-3 家具标注协议参照。 ### E.3 Hypersim(ICCV 2021) - **arXiv**: [arXiv:2011.02523](https://arxiv.org/abs/2011.02523) - **作者**: Apple - **核心**: 高质量室内合成数据集,含真值深度/法向量/材质。 - **对接**: 预训练 + 评测时的合成域参考。 ### E.4 Replica / Habitat 数据集(2019–至今) - **arXiv**: Replica [arXiv:1906.05797](https://arxiv.org/abs/1906.05797) - **核心**: 18 个高质量室内 3D 场景,常用于神经建图 benchmark。 - **对接**: M4-1 benchmark split 模板。 ### E.5 DroidLet / Habitat 3.0 / HSSD(具身智能数据栈,2023–2024) - **arXiv**: Habitat 3.0 [arXiv:2310.13724](https://arxiv.org/abs/2310.13724) - **核心**: 大规模室内具身仿真+训练框架。 - **对接**: **M4-2 World Model 接口**直接对接 Habitat / LeRobot 格式。 ### E.6 World Models 综述与最新方向 - **World Models(Ha & Schmidhuber, 2018)**: [arXiv:1803.10122](https://arxiv.org/abs/1803.10122) — 概念奠基 - **DreamerV3(2023)**: [arXiv:2301.04104](https://arxiv.org/abs/2301.04104) — 通用世界模型 - **Genie 2(DeepMind, 2024)**: 论文未公开,参考 [arXiv:2402.15391](https://arxiv.org/abs/2402.15391)(Genie v1) - **Sora 技术报告 / WorldDreamer**: WorldDreamer [arXiv:2401.09985](https://arxiv.org/abs/2401.09985) - **NVIDIA Cosmos(2025)**: [arXiv:2501.03575](https://arxiv.org/abs/2501.03575) — 物理感知世界模型基础模型,**直接对接本项目 M4-4 基线回灌** - **对接**: M4-4 训练时把本项目数据按 Cosmos / DreamerV3 接口格式喂入。 ### E.x 主线小结 - **数据集设计参考**:ScanNet++ + ARKitScenes 双标杆 - **接口对齐**:LeRobot / Habitat 3.0 / Cosmos - **落地动作**:M4-2 数据卡参照 ScanNet++ 的 Datasheet;M4-4 用 Cosmos 小模型回灌验证。 --- ## F. 与本项目 M1–M4 框架的论文映射 | 项目阶段 | 必读论文(粗体)+ 选读 | |---|---| | **M1 环境搂环 / 数据契约** | **ScanNet++ [2308.11417]**, ARKitScenes [2111.08897](学其元数据 schema) | | **M2-1 场景级建图** | **ORB-SLAM3 [2007.11898]**, GS-SLAM [2311.11700] | | **M2-3 物体级细节** | **IGEV-Stereo [2303.06615]**, FoundationStereo [2501.09898] | | **M2-4 像素级失效** | **Marigold [2312.02145]**, Depth Anything v2 [2406.09414] | | **M3-3 位姿消融** | **ORB-SLAM3, VINS-Fusion [1901.03642], DPVO [2208.04726], BASALT [1904.06504]** | | **M3-4 深度消融** | **FoundationStereo [2501.09898], Depth Anything v2 [2406.09414], CREStereo [2203.11483]** | | **M3-5 融合建图** | **3DGS [2308.04079], SplaTAM [2312.02126], Photo-SLAM [2311.16728]** | | **M4-1 评测基准** | **ScanNet++ [2308.11417], Replica [1906.05797]**, Hypersim [2011.02523] | | **M4-2 数据接口** | Habitat 3.0 [2310.13724], ARKitScenes [2111.08897] | | **M4-4 基线回灌** | **NVIDIA Cosmos [2501.03575], DreamerV3 [2301.04104]**, World Models [1803.10122] | --- ## G. 国产团队论文清单(与 [`plans/camera/zed2i_china_alternatives.md`](../plans/camera/zed2i_china_alternatives.md) 配套) 特别筛选**国产团队 / 国内机构**的代表性工作,便于国产化方案的学术背书: | 论文 | 团队 | arXiv | 应用点 | |---|---|---|---| | IGEV-Stereo | 华中科技大学 | [2303.06615](https://arxiv.org/abs/2303.06615) | 立体匹配 | | CREStereo | 旷视 Megvii | [2203.11483](https://arxiv.org/abs/2203.11483) | 立体匹配 | | Depth Anything v1/v2 | 字节 + 港大 | [2401.10891](https://arxiv.org/abs/2401.10891) / [2406.09414](https://arxiv.org/abs/2406.09414) | 单目深度基础模型 | | Metric3D v2 | 阿里 DAMO | [2404.15506](https://arxiv.org/abs/2404.15506) | 度量深度+法向量 | | VINS-Mono/Fusion | 港科大沈邵劼组 | [1901.03642](https://arxiv.org/abs/1901.03642) | VIO 工程标杆 | | DepthCrafter / StereoCrafter | 腾讯 ARC Lab | [2409.02095](https://arxiv.org/abs/2409.02095) / [2409.07447](https://arxiv.org/abs/2409.07447) | 时序一致深度 | | Photo-SLAM | 上海交大 | [2311.16728](https://arxiv.org/abs/2311.16728) | 3DGS SLAM | **结论**:本项目所有关键技术节点(双目深度 / 单目深度 / VIO / 3DGS SLAM / 时序深度)都有**国产 SOTA 论文支撑**,国产化方案不仅是硬件层面,算法层面也完全自主可控。 --- ## H. 检索方法与可复现性 ### H.1 推荐 arXiv 检索语法 ```text # 双目立体(近 2 年) all:"stereo matching" AND submittedDate:[202401010000 TO 202612310000] # 视觉惯性 SLAM all:"visual inertial" OR all:"VIO" AND cat:cs.CV # 3DGS SLAM all:"gaussian splatting" AND all:"SLAM" # 世界模型 + 室内数据 all:"world model" AND all:"indoor" # ZED 相机相关工作(验证生态) all:"ZED 2i" OR all:"ZED stereo" ``` ### H.2 推荐配套工具 - **Papers With Code**: / - **arXiv Sanity Preserver**: - **ConnectedPapers**:(基于一篇 seed 找邻居) - **本仓库脚本**:[`research/search_info.py`](search_info.py:7) 可改 query 复用 ### H.3 引用复核清单(实施前必做) > ⚠️ 本文档基于训练知识整理,部分论文 ID/年份可能有误差。**建议在 M1 阶段完成以下复核**: - [ ] 用 [`research/search_info.py`](search_info.py:7) 改写查询关键词,拉取近 30 天最新 arXiv 列表 - [ ] 对每篇"必读论文"打开 arxiv.org 链接确认存在、版本、作者 - [ ] 对"国产团队论文清单"额外核查机构归属(中文官网/作者主页) - [ ] 把核对后的引文写入 [`plans/camera/zed2i_iterative_framework.md`](../plans/camera/zed2i_iterative_framework.md) 第 8 节作为权威引用源 --- ## I. 与既有 review 文档的关系 本仓库已有的两份 world model 综述: - [`research/world_models_review.md`](world_models_review.md) — 通用 world model 综述 - [`research/physics_world_models_review.md`](physics_world_models_review.md) — 物理世界模型 **本文档定位**:聚焦"**前端传感与建图数据 pipeline**",是上述两份综述的**上游数据基础**。下游训练时 → 接入 world model 综述中的方法。 ```mermaid flowchart LR HW[ZED 2i / Gemini 335L 硬件] --> ALG[本文档 A-D
立体/VIO/深度/建图算法] ALG --> DATA[本文档 E
数据集与接口] DATA --> WM[research/world_models_review.md
下游训练] DATA --> PWM[research/physics_world_models_review.md
物理推理] ``` --- ## J. 推荐阅读顺序(首读 10 篇) 按本项目实施紧迫度排序: 1. **ORB-SLAM3** [2007.11898] — 替代 ZED VIO 的工程标杆 2. **3D Gaussian Splatting** [2308.04079] — M3-5 / M4 建图核心 3. **FoundationStereo** [2501.09898] — M3-4 深度后处理首选 4. **Depth Anything v2** [2406.09414] — 单目深度国产基础模型 5. **GS-SLAM / Photo-SLAM** [2311.11700 / 2311.16728] — 一体化 SLAM+渲染 6. **ScanNet++** [2308.11417] — 数据集元数据 schema 范本 7. **VINS-Fusion** [1901.03642] — 国产 VIO 标杆 8. **IGEV-Stereo** [2303.06615] — 国产立体匹配 9. **NVIDIA Cosmos** [2501.03575] — World Model 基础模型接口 10. **DPVO** [2208.04726] — 轻量神经 VIO --- **版本**:v0.1 **最后更新**:2026-05-16 **维护者**:项目规划团队 **配套**:[`plans/camera/zed2i_stereo_imu_solution.md`](../plans/camera/zed2i_stereo_imu_solution.md) · [`zed2i_iterative_framework.md`](../plans/camera/zed2i_iterative_framework.md) · [`zed2i_china_alternatives.md`](../plans/camera/zed2i_china_alternatives.md)