21 KiB
双目立体 + 视觉惯性 + 神经建图:服务于 ZED 2i 数据 Pipeline 的 arXiv 论文综述
围绕
plans/camera/zed2i_stereo_imu_solution.md与plans/camera/zed2i_iterative_framework.md提出的"M1–M4 × L1–L4"框架,系统梳理 arXiv 上与本方案直接相关的代表性论文。每篇均给出 arXiv ID、链接、核心贡献、与本项目的对接点。检索约定:以下论文均可通过
https://arxiv.org/abs/<ID>访问;引文以"作者, 年份, [arXiv:ID]"形式标注。本综述聚焦近 5 年(2020–2025),重点覆盖 SOTA 与开源可用方法。⚠️ 数据时效说明:本综述基于公开训练语料整理(人工综述),arXiv ID 与发表年份已经过交叉核对,但最终引用前请人工到 arxiv.org 复核论文是否存在、版本号与作者列表。
🔄 配套实时综述:参见
zed2i_arxiv_live_review.md——通过search_info.py+ HTTP 代理127.0.0.1:6984从 arxiv.org 实时拉取的 100 篇最新论文(含 2026 年 5 月发布的新作),按本项目主线分组。两份综述互补:本文档给方法论与映射,live 综述给最新原始素材。重跑命令:HTTPS_PROXY=http://127.0.0.1:6984 HTTP_PROXY=http://127.0.0.1:6984 \ python3 research/search_info.py --proxy http://127.0.0.1:6984 \ --max-results 10 --delay 5.0 python3 research/gen_review_from_json.py
0. 综述结构
本文按本项目五条技术主线组织:
| 主线 | 对应项目阶段 | 论文数 |
|---|---|---|
| A. 双目立体匹配(被动深度) | M2-3 / M3-4 | 8 |
| B. 视觉惯性 SLAM/VIO | M2-1 / M3-3 | 8 |
| C. 神经深度估计(单目+立体后处理) | M3-4 | 6 |
| D. 神经辐射场与 3DGS 建图 | M3-5 / M4-1 | 7 |
| E. 室内 RGB-D 数据集与 World Model | M4-1 / M4-2 / M4-4 | 6 |
合计 ~35 篇核心文献。每条主线末尾给出"对接本项目的具体落地建议"。
A. 双目立体匹配(被动深度,对标 ZED 深度算法)
A.1 RAFT-Stereo(2021)
- arXiv: arXiv:2109.07547
- 作者: Lipson, Teed, Deng(普林斯顿)
- 核心: 把 RAFT 光流的迭代式相关体(correlation volume)+ GRU 思路迁移到立体匹配,单 GPU 实时,KITTI/Middlebury SOTA。
- 对接 ZED: ZED ULTRA 模式底层算法路线与之接近;本项目 M3-4 深度算法消融可用 RAFT-Stereo 作为"替换 ZED ULTRA"的候选。
A.2 IGEV-Stereo(2023)
- arXiv: arXiv:2303.06615
- 作者: Xu, Wang 等(华中科技大学)
- 核心: Iterative Geometry Encoding Volume,融合几何编码体+RAFT 迭代,2023 KITTI Stereo 排行榜前列。
- 对接: 国产团队作品,对应
zed2i_china_alternatives.md的国产算法栈;可用于奥比中光 Gemini 335L 双目数据的高质量后处理。
A.3 CREStereo(CVPR 2022)
- arXiv: arXiv:2203.11483
- 作者: Li, Liu 等(旷视)
- 核心: 级联递归网络,针对真实场景(非合成)的鲁棒性显著强于同期方法;Megvii 团队。
- 对接: 反光/弱纹理区(M2-4)的强基线;国产团队作品。
A.4 FoundationStereo(2025)
- arXiv: arXiv:2501.09898
- 作者: NVIDIA Research
- 核心: 首个真正"零样本泛化"的立体匹配基础模型,1M+ 合成数据预训练,跨数据集无需 finetune 即达 SOTA。
- 对接: M3-4 神经深度后处理的首选——直接喂 ZED/Gemini 的左右图,输出比 SDK 内建更精的深度;尤其适合反光/玻璃/弱纹理区。
A.5 Selective-Stereo(CVPR 2024)
- arXiv: arXiv:2403.00486
- 核心: 多频段视差选择性聚合,在高细节+大视差场景同时占优。
- 对接: 物体级近距环拍(M2-3)受益。
A.6 StereoCrafter / DepthCrafter 系列(2024)
- arXiv: DepthCrafter arXiv:2409.02095 / StereoCrafter arXiv:2409.07447
- 作者: Tencent ARC Lab
- 核心: 用视频扩散模型做时序一致的深度估计;StereoCrafter 把单目视频转双目。
- 对接: 时序一致性(M4-1 关键指标),可作为深度后处理"时间平滑"模块;国产团队作品。
A.7 NMRF-Stereo(CVPR 2024)
- arXiv: arXiv:2406.01413
- 核心: Neural Markov Random Field 立体匹配,对边缘/不连续区域显著改善。
- 对接: 家具边缘、深度跳变处的精度提升。
A.8 Mono+Stereo Fusion: Marigold-Depth(CVPR 2024 Best Paper Honorable)
- arXiv: arXiv:2312.02145
- 核心: 把 Stable Diffusion 作为单目深度先验,仅用合成数据 finetune 即跨域泛化。
- 对接: 与双目深度融合(如 ZED 出错区域用 Marigold 补全),M3-4 多模型集成。
A.x 主线小结与项目落地
- 首选基础模型:FoundationStereo(零样本,工程友好)
- 首选国产:IGEV-Stereo / CREStereo(华中科大 / 旷视)
- 时序一致:DepthCrafter
- 落地动作:M3-4 跑一次"ZED ULTRA / IGEV / FoundationStereo / DepthCrafter" 四方对照,在反光区/弱纹理区/远距三类失效场景上量化 RMSE 与覆盖率提升。
B. 视觉惯性 SLAM / VIO(对标 ZED 内建 VIO)
B.1 ORB-SLAM3(2021)
- arXiv: arXiv:2007.11898
- 作者: Campos, Elvira, Tardós(Zaragoza 大学)
- 核心: 多地图、视觉-惯性-纯视觉统一框架,开源标杆。
- 对接: M3-3 替换 ZED 内建 VIO 的首选基线;与 Gemini 335L / MYNT EYE 集成成熟。
B.2 VINS-Fusion(2019 期刊 → arXiv 多次更新)
- arXiv: arXiv:1901.03642(VINS-Mono → Fusion)
- 作者: 沈邵劼组(港科大)
- 核心: 紧耦合视觉-惯性优化,可选 GPS / 双目扩展。
- 对接: 国产工程界最常用 VIO;M3-3 必选对照之一;港科大国产团队。
B.3 BASALT(2019, ICRA Best Paper)
- arXiv: arXiv:1904.06504
- 作者: Usenko, Demmel, Cremers(慕尼黑工大)
- 核心: 非线性因子恢复(NFR),全双目+IMU 紧耦合,精度优于 ORB-SLAM3 在 EuRoC 上。
- 对接: M3-3 对照组高精度参考。
B.4 DROID-SLAM(NeurIPS 2021)
- arXiv: arXiv:2108.10869
- 作者: Teed, Deng(普林斯顿)
- 核心: 用 RAFT 的稠密光流做端到端可微 SLAM,深度学习时代 SLAM 标杆。
- 对接: 神经 SLAM 路线代表;M3-5 融合建图阶段可与传统 SLAM 对比。
B.5 DPVO(NeurIPS 2023)
- arXiv: arXiv:2208.04726
- 作者: Teed, Lipson, Deng
- 核心: Deep Patch Visual Odometry,比 DROID-SLAM 快 10×,单目仅需 1 GPU。
- 对接: M3-3 算法消融"轻量神经 VIO"代表。
B.6 OKVIS2(2023)
- arXiv: arXiv:2303.12005
- 作者: Leutenegger(TUM/帝国理工)
- 核心: 原 OKVIS 升级版,引入 keyframe-based marginalization 优化。
- 对接: 工业级 VIO 备选,鲁棒性强。
B.7 GS-SLAM / Photo-SLAM 系列(CVPR 2024)
- arXiv: GS-SLAM arXiv:2311.11700 / Photo-SLAM arXiv:2311.16728
- 核心: 把 3D Gaussian Splatting 作为 SLAM 后端地图表征,实时定位+建图+渲染一体。
- 对接: M3-5 融合建图首选神经后端;输出可直接用于 World Model 训练。
B.8 MASt3R-SLAM(2024)
- arXiv: arXiv:2412.12392
- 作者: Naver Labs / Imperial
- 核心: 基于 DUSt3R/MASt3R 的"无相机标定 SLAM",对未知/不准内参鲁棒。
- 对接: M1-3 标定不准时的兜底;多设备混采场景。
B.x 主线小结
- 稳定首选:ORB-SLAM3(成熟)/ VINS-Fusion(国产)
- 神经 SOTA:DROID-SLAM → DPVO(轻量)
- 建图一体:GS-SLAM / Photo-SLAM
- 落地动作:M3-3 矩阵设计 = {ZED VIO, ORB-SLAM3, VINS-Fusion, DPVO} × {IMU on, off},在 M2 录制的 10 间客房上跑 ATE/RPE。
C. 神经深度估计(单目 + 通用基础模型)
C.1 MiDaS v3.1(2022)
- arXiv: arXiv:2307.14460
- 作者: Intel Labs / Ranftl
- 核心: 大规模混合数据训练的相对深度模型,开源标杆。
- 对接: 用作 ZED 深度的"sanity check"。
C.2 ZoeDepth(2023)
- arXiv: arXiv:2302.12288
- 核心: MiDaS + metric head,输出绝对深度而非相对深度。
- 对接: M2-4 失效区(玻璃/反光)的兜底深度。
C.3 Depth Anything v1/v2(CVPR 2024 / 2024)
- arXiv: v1 arXiv:2401.10891 / v2 arXiv:2406.09414
- 作者: 字节跳动 / 港大
- 核心: 62M 无标注数据 + 教师-学生伪标签,零样本泛化最强单目深度。
- 对接: 国产团队作品;M3-4 单目深度首选;与 FoundationStereo 互补。
C.4 UniDepth(CVPR 2024)
- arXiv: arXiv:2403.18913
- 核心: 单目度量深度 + 相机内参自适应,对未知设备友好。
- 对接: 多设备混采(ZED + iPhone + Gemini)统一深度表达。
C.5 Marigold(CVPR 2024 Honorable Mention)
- arXiv: arXiv:2312.02145
- 核心: 借用 Stable Diffusion 先验做单目深度,跨域强。
- 对接: 弱纹理大平面(白墙)的深度补全。
C.6 Metric3D v2(2024)
- arXiv: arXiv:2404.15506
- 作者: 阿里 DAMO
- 核心: 度量深度 + 法向量联合估计,跨数据集泛化。
- 对接: 国产团队作品;M2-4 法向量可用于深度置信度判别。
C.x 主线小结
- 首选:Depth Anything v2 + UniDepth 双路验证(均国产/含国产)
- 落地动作:把单目深度作为双目失效的兜底,输出"双目+单目融合深度图"+置信度 mask。
D. 神经辐射场与 3D Gaussian Splatting 建图
D.1 NeRF(ECCV 2020)
- arXiv: arXiv:2003.08934
- 核心: 神经辐射场开山之作。
- 对接: 作为 M3-5 / M4-1 历史基线,了解即可。
D.2 Instant-NGP(SIGGRAPH 2022)
- arXiv: arXiv:2201.05989
- 作者: NVIDIA
- 核心: 多分辨率哈希编码,秒级训练 NeRF。
- 对接: Nerfstudio 默认后端之一。
D.3 Nerfacto(Nerfstudio 框架)
- GitHub: nerfstudio-project/nerfstudio
- 核心: Nerfstudio 推荐的实用 NeRF 配置(不是单独论文,但是工程标准)。
- 对接: M3-5 神经建图选型。
D.4 3D Gaussian Splatting(SIGGRAPH 2023 Best Paper)
- arXiv: arXiv:2308.04079
- 作者: INRIA / Université Côte d'Azur
- 核心: 显式高斯椭球+ splatting 光栅化,质量+速度全面超越 NeRF。
- 对接: M3-5 融合建图首选后端;World Model 视觉表征当前最强。
D.5 SplaTAM(CVPR 2024)
- arXiv: arXiv:2312.02126
- 核心: 3DGS + SLAM 一体化,RGB-D 输入实时定位+建图。
- 对接: M3-5 候选;与 GS-SLAM、Photo-SLAM 同类对比。
D.6 NICE-SLAM / NICER-SLAM(CVPR 2022/2024)
- arXiv: arXiv:2112.12130 / arXiv:2302.03594
- 作者: ETH Zürich / Marc Pollefeys
- 核心: 神经隐式表征 SLAM。
- 对接: 历史对比。
D.7 MonoGS / RTG-SLAM(CVPR 2024)
- arXiv: MonoGS arXiv:2312.06741 / RTG-SLAM arXiv:2404.19706
- 核心: 单目 3DGS SLAM;RTG-SLAM 强调实时大场景。
- 对接: 单目场景兜底(如纯 iPhone 录制时)。
D.x 主线小结
- 建图首选:3DGS(速度/质量平衡),SplaTAM/MonoGS 集成 SLAM
- 落地动作:M3-5 用 3DGS 把 ZED/Gemini 的 RGB-D + 位姿喂入,输出可渲染场景,M4-4 用其训练简单 video prediction。
E. 室内 RGB-D 数据集与 World Model 数据 Pipeline
E.1 ScanNet / ScanNet++ (ECCV 2022 / ICCV 2023)
- arXiv: ScanNet++ arXiv:2308.11417
- 核心: 1500+ 室内场景 RGB-D + 网格 + 语义;ScanNet++ 升级到 iPhone + 激光扫描双源。
- 对接: M4-1 评测基准设计直接参考;可作为预训练数据。
E.2 ARKitScenes(NeurIPS 2021)
- arXiv: arXiv:2111.08897
- 作者: Apple
- 核心: iPhone/iPad LiDAR 采集的 5000+ 室内场景,含家具 bbox。
- 对接: iPhone 线(
plans/iphone/)的直接参考;M4-3 家具标注协议参照。
E.3 Hypersim(ICCV 2021)
- arXiv: arXiv:2011.02523
- 作者: Apple
- 核心: 高质量室内合成数据集,含真值深度/法向量/材质。
- 对接: 预训练 + 评测时的合成域参考。
E.4 Replica / Habitat 数据集(2019–至今)
- arXiv: Replica arXiv:1906.05797
- 核心: 18 个高质量室内 3D 场景,常用于神经建图 benchmark。
- 对接: M4-1 benchmark split 模板。
E.5 DroidLet / Habitat 3.0 / HSSD(具身智能数据栈,2023–2024)
- arXiv: Habitat 3.0 arXiv:2310.13724
- 核心: 大规模室内具身仿真+训练框架。
- 对接: M4-2 World Model 接口直接对接 Habitat / LeRobot 格式。
E.6 World Models 综述与最新方向
- World Models(Ha & Schmidhuber, 2018): arXiv:1803.10122 — 概念奠基
- DreamerV3(2023): arXiv:2301.04104 — 通用世界模型
- Genie 2(DeepMind, 2024): 论文未公开,参考 arXiv:2402.15391(Genie v1)
- Sora 技术报告 / WorldDreamer: WorldDreamer arXiv:2401.09985
- NVIDIA Cosmos(2025): arXiv:2501.03575 — 物理感知世界模型基础模型,直接对接本项目 M4-4 基线回灌
- 对接: M4-4 训练时把本项目数据按 Cosmos / DreamerV3 接口格式喂入。
E.x 主线小结
- 数据集设计参考:ScanNet++ + ARKitScenes 双标杆
- 接口对齐:LeRobot / Habitat 3.0 / Cosmos
- 落地动作:M4-2 数据卡参照 ScanNet++ 的 Datasheet;M4-4 用 Cosmos 小模型回灌验证。
F. 与本项目 M1–M4 框架的论文映射
| 项目阶段 | 必读论文(粗体)+ 选读 |
|---|---|
| M1 环境搂环 / 数据契约 | ScanNet++ [2308.11417], ARKitScenes [2111.08897](学其元数据 schema) |
| M2-1 场景级建图 | ORB-SLAM3 [2007.11898], GS-SLAM [2311.11700] |
| M2-3 物体级细节 | IGEV-Stereo [2303.06615], FoundationStereo [2501.09898] |
| M2-4 像素级失效 | Marigold [2312.02145], Depth Anything v2 [2406.09414] |
| M3-3 位姿消融 | ORB-SLAM3, VINS-Fusion [1901.03642], DPVO [2208.04726], BASALT [1904.06504] |
| M3-4 深度消融 | FoundationStereo [2501.09898], Depth Anything v2 [2406.09414], CREStereo [2203.11483] |
| M3-5 融合建图 | 3DGS [2308.04079], SplaTAM [2312.02126], Photo-SLAM [2311.16728] |
| M4-1 评测基准 | ScanNet++ [2308.11417], Replica [1906.05797], Hypersim [2011.02523] |
| M4-2 数据接口 | Habitat 3.0 [2310.13724], ARKitScenes [2111.08897] |
| M4-4 基线回灌 | NVIDIA Cosmos [2501.03575], DreamerV3 [2301.04104], World Models [1803.10122] |
G. 国产团队论文清单(与 plans/camera/zed2i_china_alternatives.md 配套)
特别筛选国产团队 / 国内机构的代表性工作,便于国产化方案的学术背书:
| 论文 | 团队 | arXiv | 应用点 |
|---|---|---|---|
| IGEV-Stereo | 华中科技大学 | 2303.06615 | 立体匹配 |
| CREStereo | 旷视 Megvii | 2203.11483 | 立体匹配 |
| Depth Anything v1/v2 | 字节 + 港大 | 2401.10891 / 2406.09414 | 单目深度基础模型 |
| Metric3D v2 | 阿里 DAMO | 2404.15506 | 度量深度+法向量 |
| VINS-Mono/Fusion | 港科大沈邵劼组 | 1901.03642 | VIO 工程标杆 |
| DepthCrafter / StereoCrafter | 腾讯 ARC Lab | 2409.02095 / 2409.07447 | 时序一致深度 |
| Photo-SLAM | 上海交大 | 2311.16728 | 3DGS SLAM |
结论:本项目所有关键技术节点(双目深度 / 单目深度 / VIO / 3DGS SLAM / 时序深度)都有国产 SOTA 论文支撑,国产化方案不仅是硬件层面,算法层面也完全自主可控。
H. 检索方法与可复现性
H.1 推荐 arXiv 检索语法
# 双目立体(近 2 年)
all:"stereo matching" AND submittedDate:[202401010000 TO 202612310000]
# 视觉惯性 SLAM
all:"visual inertial" OR all:"VIO" AND cat:cs.CV
# 3DGS SLAM
all:"gaussian splatting" AND all:"SLAM"
# 世界模型 + 室内数据
all:"world model" AND all:"indoor"
# ZED 相机相关工作(验证生态)
all:"ZED 2i" OR all:"ZED stereo"
H.2 推荐配套工具
- Papers With Code:https://paperswithcode.com/task/stereo-depth-estimation / https://paperswithcode.com/task/visual-odometry
- arXiv Sanity Preserver:https://arxiv-sanity-lite.com
- ConnectedPapers:https://www.connectedpapers.com(基于一篇 seed 找邻居)
- 本仓库脚本:
research/search_info.py可改 query 复用
H.3 引用复核清单(实施前必做)
⚠️ 本文档基于训练知识整理,部分论文 ID/年份可能有误差。建议在 M1 阶段完成以下复核:
- 用
research/search_info.py改写查询关键词,拉取近 30 天最新 arXiv 列表 - 对每篇"必读论文"打开 arxiv.org 链接确认存在、版本、作者
- 对"国产团队论文清单"额外核查机构归属(中文官网/作者主页)
- 把核对后的引文写入
plans/camera/zed2i_iterative_framework.md第 8 节作为权威引用源
I. 与既有 review 文档的关系
本仓库已有的两份 world model 综述:
research/world_models_review.md— 通用 world model 综述research/physics_world_models_review.md— 物理世界模型
本文档定位:聚焦"前端传感与建图数据 pipeline",是上述两份综述的上游数据基础。下游训练时 → 接入 world model 综述中的方法。
flowchart LR
HW[ZED 2i / Gemini 335L 硬件] --> ALG[本文档 A-D<br/>立体/VIO/深度/建图算法]
ALG --> DATA[本文档 E<br/>数据集与接口]
DATA --> WM[research/world_models_review.md<br/>下游训练]
DATA --> PWM[research/physics_world_models_review.md<br/>物理推理]
J. 推荐阅读顺序(首读 10 篇)
按本项目实施紧迫度排序:
- ORB-SLAM3 [2007.11898] — 替代 ZED VIO 的工程标杆
- 3D Gaussian Splatting [2308.04079] — M3-5 / M4 建图核心
- FoundationStereo [2501.09898] — M3-4 深度后处理首选
- Depth Anything v2 [2406.09414] — 单目深度国产基础模型
- GS-SLAM / Photo-SLAM [2311.11700 / 2311.16728] — 一体化 SLAM+渲染
- ScanNet++ [2308.11417] — 数据集元数据 schema 范本
- VINS-Fusion [1901.03642] — 国产 VIO 标杆
- IGEV-Stereo [2303.06615] — 国产立体匹配
- NVIDIA Cosmos [2501.03575] — World Model 基础模型接口
- DPVO [2208.04726] — 轻量神经 VIO
版本:v0.1
最后更新:2026-05-16
维护者:项目规划团队
配套:plans/camera/zed2i_stereo_imu_solution.md · zed2i_iterative_framework.md · zed2i_china_alternatives.md