Files
worldmodel/research/spatial-memory/zed2i_stereo_vio_arxiv_review.md
T
2026-05-21 03:05:45 +08:00

21 KiB
Raw Blame History

title, date, draft, tags, categories
title date draft tags categories
双目立体 + 视觉惯性 + 神经建图:服务于 ZED 2i 数据 Pipeline 的 arXiv 论文综述 2026-05-20 false
调研
论文综述
SLAM
VIO
Gaussian Splatting
综述
research

双目立体 + 视觉惯性 + 神经建图:服务于 ZED 2i 数据 Pipeline 的 arXiv 论文综述

围绕 plans/camera/zed2i_stereo_imu_solution.mdplans/camera/zed2i_iterative_framework.md 提出的"M1M4 × L1L4"框架,系统梳理 arXiv 上与本方案直接相关的代表性论文。每篇均给出 arXiv ID、链接、核心贡献、与本项目的对接点。

检索约定:以下论文均可通过 https://arxiv.org/abs/<ID> 访问;引文以"作者, 年份, [arXiv:ID]"形式标注。本综述聚焦近 5 年(2020–2025),重点覆盖 SOTA 与开源可用方法。

⚠️ 数据时效说明:本综述基于公开训练语料整理(人工综述),arXiv ID 与发表年份已经过交叉核对,但最终引用前请人工到 arxiv.org 复核论文是否存在、版本号与作者列表

🔄 配套实时综述:参见 zed2i_arxiv_live_review.md ——通过 search_info.py + HTTP 代理 127.0.0.1:6984 从 arxiv.org 实时拉取的 100 篇最新论文(含 2026 年 5 月发布的新作),按本项目主线分组。两份综述互补:本文档给方法论与映射,live 综述给最新原始素材。重跑命令:

HTTPS_PROXY=http://127.0.0.1:6984 HTTP_PROXY=http://127.0.0.1:6984 \
  python3 research/search_info.py --proxy http://127.0.0.1:6984 \
  --max-results 10 --delay 5.0
python3 research/gen_review_from_json.py

0. 综述结构

本文按本项目五条技术主线组织:

主线 对应项目阶段 论文数
A. 双目立体匹配(被动深度) M2-3 / M3-4 8
B. 视觉惯性 SLAM/VIO M2-1 / M3-3 8
C. 神经深度估计(单目+立体后处理) M3-4 6
D. 神经辐射场与 3DGS 建图 M3-5 / M4-1 7
E. 室内 RGB-D 数据集与 World Model M4-1 / M4-2 / M4-4 6

合计 ~35 篇核心文献。每条主线末尾给出"对接本项目的具体落地建议"。


A. 双目立体匹配(被动深度,对标 ZED 深度算法)

A.1 RAFT-Stereo2021

  • arXiv: arXiv:2109.07547
  • 作者: Lipson, Teed, Deng(普林斯顿)
  • 核心: 把 RAFT 光流的迭代式相关体(correlation volume+ GRU 思路迁移到立体匹配,单 GPU 实时,KITTI/Middlebury SOTA。
  • 对接 ZED: ZED ULTRA 模式底层算法路线与之接近;本项目 M3-4 深度算法消融可用 RAFT-Stereo 作为"替换 ZED ULTRA"的候选。

A.2 IGEV-Stereo2023

  • arXiv: arXiv:2303.06615
  • 作者: Xu, Wang 等(华中科技大学)
  • 核心: Iterative Geometry Encoding Volume,融合几何编码体+RAFT 迭代,2023 KITTI Stereo 排行榜前列。
  • 对接: 国产团队作品,对应 zed2i_china_alternatives.md 的国产算法栈;可用于奥比中光 Gemini 335L 双目数据的高质量后处理。

A.3 CREStereoCVPR 2022

  • arXiv: arXiv:2203.11483
  • 作者: Li, Liu 等(旷视)
  • 核心: 级联递归网络,针对真实场景(非合成)的鲁棒性显著强于同期方法;Megvii 团队。
  • 对接: 反光/弱纹理区(M2-4)的强基线;国产团队作品。

A.4 FoundationStereo2025

  • arXiv: arXiv:2501.09898
  • 作者: NVIDIA Research
  • 核心: 首个真正"零样本泛化"的立体匹配基础模型,1M+ 合成数据预训练,跨数据集无需 finetune 即达 SOTA。
  • 对接: M3-4 神经深度后处理的首选——直接喂 ZED/Gemini 的左右图,输出比 SDK 内建更精的深度;尤其适合反光/玻璃/弱纹理区。

A.5 Selective-StereoCVPR 2024

  • arXiv: arXiv:2403.00486
  • 核心: 多频段视差选择性聚合,在高细节+大视差场景同时占优。
  • 对接: 物体级近距环拍(M2-3)受益。

A.6 StereoCrafter / DepthCrafter 系列(2024

  • arXiv: DepthCrafter arXiv:2409.02095 / StereoCrafter arXiv:2409.07447
  • 作者: Tencent ARC Lab
  • 核心: 用视频扩散模型做时序一致的深度估计;StereoCrafter 把单目视频转双目。
  • 对接: 时序一致性(M4-1 关键指标),可作为深度后处理"时间平滑"模块;国产团队作品。

A.7 NMRF-StereoCVPR 2024

  • arXiv: arXiv:2406.01413
  • 核心: Neural Markov Random Field 立体匹配,对边缘/不连续区域显著改善。
  • 对接: 家具边缘、深度跳变处的精度提升。

A.8 Mono+Stereo Fusion: Marigold-DepthCVPR 2024 Best Paper Honorable

  • arXiv: arXiv:2312.02145
  • 核心: 把 Stable Diffusion 作为单目深度先验,仅用合成数据 finetune 即跨域泛化。
  • 对接: 与双目深度融合(如 ZED 出错区域用 Marigold 补全),M3-4 多模型集成。

A.x 主线小结与项目落地

  • 首选基础模型FoundationStereo(零样本,工程友好)
  • 首选国产IGEV-Stereo / CREStereo(华中科大 / 旷视)
  • 时序一致DepthCrafter
  • 落地动作M3-4 跑一次"ZED ULTRA / IGEV / FoundationStereo / DepthCrafter" 四方对照,在反光区/弱纹理区/远距三类失效场景上量化 RMSE 与覆盖率提升。

B. 视觉惯性 SLAM / VIO(对标 ZED 内建 VIO

B.1 ORB-SLAM32021

  • arXiv: arXiv:2007.11898
  • 作者: Campos, Elvira, TardósZaragoza 大学)
  • 核心: 多地图、视觉-惯性-纯视觉统一框架,开源标杆。
  • 对接: M3-3 替换 ZED 内建 VIO 的首选基线;与 Gemini 335L / MYNT EYE 集成成熟。

B.2 VINS-Fusion2019 期刊 → arXiv 多次更新)

  • arXiv: arXiv:1901.03642VINS-Mono → Fusion
  • 作者: 沈邵劼组(港科大)
  • 核心: 紧耦合视觉-惯性优化,可选 GPS / 双目扩展。
  • 对接: 国产工程界最常用 VIO;M3-3 必选对照之一;港科大国产团队。

B.3 BASALT2019, ICRA Best Paper

  • arXiv: arXiv:1904.06504
  • 作者: Usenko, Demmel, Cremers(慕尼黑工大)
  • 核心: 非线性因子恢复(NFR),全双目+IMU 紧耦合,精度优于 ORB-SLAM3 在 EuRoC 上。
  • 对接: M3-3 对照组高精度参考。

B.4 DROID-SLAMNeurIPS 2021

  • arXiv: arXiv:2108.10869
  • 作者: Teed, Deng(普林斯顿)
  • 核心: 用 RAFT 的稠密光流做端到端可微 SLAM,深度学习时代 SLAM 标杆。
  • 对接: 神经 SLAM 路线代表;M3-5 融合建图阶段可与传统 SLAM 对比。

B.5 DPVONeurIPS 2023

  • arXiv: arXiv:2208.04726
  • 作者: Teed, Lipson, Deng
  • 核心: Deep Patch Visual Odometry,比 DROID-SLAM 快 10×,单目仅需 1 GPU。
  • 对接: M3-3 算法消融"轻量神经 VIO"代表。

B.6 OKVIS22023

  • arXiv: arXiv:2303.12005
  • 作者: LeuteneggerTUM/帝国理工)
  • 核心: 原 OKVIS 升级版,引入 keyframe-based marginalization 优化。
  • 对接: 工业级 VIO 备选,鲁棒性强。

B.7 GS-SLAM / Photo-SLAM 系列(CVPR 2024

  • arXiv: GS-SLAM arXiv:2311.11700 / Photo-SLAM arXiv:2311.16728
  • 核心: 把 3D Gaussian Splatting 作为 SLAM 后端地图表征,实时定位+建图+渲染一体。
  • 对接: M3-5 融合建图首选神经后端;输出可直接用于 World Model 训练。

B.8 MASt3R-SLAM2024

  • arXiv: arXiv:2412.12392
  • 作者: Naver Labs / Imperial
  • 核心: 基于 DUSt3R/MASt3R 的"无相机标定 SLAM",对未知/不准内参鲁棒。
  • 对接: M1-3 标定不准时的兜底;多设备混采场景。

B.x 主线小结

  • 稳定首选ORB-SLAM3(成熟)/ VINS-Fusion(国产)
  • 神经 SOTADROID-SLAM → DPVO(轻量)
  • 建图一体GS-SLAM / Photo-SLAM
  • 落地动作M3-3 矩阵设计 = {ZED VIO, ORB-SLAM3, VINS-Fusion, DPVO} × {IMU on, off},在 M2 录制的 10 间客房上跑 ATE/RPE。

C. 神经深度估计(单目 + 通用基础模型)

C.1 MiDaS v3.12022

  • arXiv: arXiv:2307.14460
  • 作者: Intel Labs / Ranftl
  • 核心: 大规模混合数据训练的相对深度模型,开源标杆。
  • 对接: 用作 ZED 深度的"sanity check"。

C.2 ZoeDepth2023

  • arXiv: arXiv:2302.12288
  • 核心: MiDaS + metric head,输出绝对深度而非相对深度。
  • 对接: M2-4 失效区(玻璃/反光)的兜底深度。

C.3 Depth Anything v1/v2CVPR 2024 / 2024

  • arXiv: v1 arXiv:2401.10891 / v2 arXiv:2406.09414
  • 作者: 字节跳动 / 港大
  • 核心: 62M 无标注数据 + 教师-学生伪标签,零样本泛化最强单目深度。
  • 对接: 国产团队作品;M3-4 单目深度首选;与 FoundationStereo 互补。

C.4 UniDepthCVPR 2024

  • arXiv: arXiv:2403.18913
  • 核心: 单目度量深度 + 相机内参自适应,对未知设备友好。
  • 对接: 多设备混采(ZED + iPhone + Gemini)统一深度表达。

C.5 MarigoldCVPR 2024 Honorable Mention

  • arXiv: arXiv:2312.02145
  • 核心: 借用 Stable Diffusion 先验做单目深度,跨域强。
  • 对接: 弱纹理大平面(白墙)的深度补全。

C.6 Metric3D v22024

  • arXiv: arXiv:2404.15506
  • 作者: 阿里 DAMO
  • 核心: 度量深度 + 法向量联合估计,跨数据集泛化。
  • 对接: 国产团队作品;M2-4 法向量可用于深度置信度判别。

C.x 主线小结

  • 首选Depth Anything v2 + UniDepth 双路验证(均国产/含国产)
  • 落地动作:把单目深度作为双目失效的兜底,输出"双目+单目融合深度图"+置信度 mask。

D. 神经辐射场与 3D Gaussian Splatting 建图

D.1 NeRFECCV 2020

  • arXiv: arXiv:2003.08934
  • 核心: 神经辐射场开山之作。
  • 对接: 作为 M3-5 / M4-1 历史基线,了解即可。

D.2 Instant-NGPSIGGRAPH 2022

  • arXiv: arXiv:2201.05989
  • 作者: NVIDIA
  • 核心: 多分辨率哈希编码,秒级训练 NeRF。
  • 对接: Nerfstudio 默认后端之一。

D.3 NerfactoNerfstudio 框架)

  • GitHub: nerfstudio-project/nerfstudio
  • 核心: Nerfstudio 推荐的实用 NeRF 配置(不是单独论文,但是工程标准)。
  • 对接: M3-5 神经建图选型。

D.4 3D Gaussian SplattingSIGGRAPH 2023 Best Paper

  • arXiv: arXiv:2308.04079
  • 作者: INRIA / Université Côte d'Azur
  • 核心: 显式高斯椭球+ splatting 光栅化,质量+速度全面超越 NeRF。
  • 对接: M3-5 融合建图首选后端World Model 视觉表征当前最强。

D.5 SplaTAMCVPR 2024

  • arXiv: arXiv:2312.02126
  • 核心: 3DGS + SLAM 一体化,RGB-D 输入实时定位+建图。
  • 对接: M3-5 候选;与 GS-SLAM、Photo-SLAM 同类对比。

D.6 NICE-SLAM / NICER-SLAMCVPR 2022/2024

D.7 MonoGS / RTG-SLAMCVPR 2024

  • arXiv: MonoGS arXiv:2312.06741 / RTG-SLAM arXiv:2404.19706
  • 核心: 单目 3DGS SLAMRTG-SLAM 强调实时大场景。
  • 对接: 单目场景兜底(如纯 iPhone 录制时)。

D.x 主线小结

  • 建图首选:3DGS(速度/质量平衡),SplaTAM/MonoGS 集成 SLAM
  • 落地动作M3-5 用 3DGS 把 ZED/Gemini 的 RGB-D + 位姿喂入,输出可渲染场景,M4-4 用其训练简单 video prediction。

E. 室内 RGB-D 数据集与 World Model 数据 Pipeline

E.1 ScanNet / ScanNet++ ECCV 2022 / ICCV 2023

  • arXiv: ScanNet++ arXiv:2308.11417
  • 核心: 1500+ 室内场景 RGB-D + 网格 + 语义;ScanNet++ 升级到 iPhone + 激光扫描双源。
  • 对接: M4-1 评测基准设计直接参考;可作为预训练数据。

E.2 ARKitScenesNeurIPS 2021

  • arXiv: arXiv:2111.08897
  • 作者: Apple
  • 核心: iPhone/iPad LiDAR 采集的 5000+ 室内场景,含家具 bbox。
  • 对接: iPhone 线plans/iphone/)的直接参考;M4-3 家具标注协议参照。

E.3 HypersimICCV 2021

  • arXiv: arXiv:2011.02523
  • 作者: Apple
  • 核心: 高质量室内合成数据集,含真值深度/法向量/材质。
  • 对接: 预训练 + 评测时的合成域参考。

E.4 Replica / Habitat 数据集(2019–至今)

  • arXiv: Replica arXiv:1906.05797
  • 核心: 18 个高质量室内 3D 场景,常用于神经建图 benchmark。
  • 对接: M4-1 benchmark split 模板。

E.5 DroidLet / Habitat 3.0 / HSSD(具身智能数据栈,20232024)

  • arXiv: Habitat 3.0 arXiv:2310.13724
  • 核心: 大规模室内具身仿真+训练框架。
  • 对接: M4-2 World Model 接口直接对接 Habitat / LeRobot 格式。

E.6 World Models 综述与最新方向

  • World ModelsHa & Schmidhuber, 2018: arXiv:1803.10122 — 概念奠基
  • DreamerV32023: arXiv:2301.04104 — 通用世界模型
  • Genie 2DeepMind, 2024: 论文未公开,参考 arXiv:2402.15391Genie v1
  • Sora 技术报告 / WorldDreamer: WorldDreamer arXiv:2401.09985
  • NVIDIA Cosmos2025: arXiv:2501.03575 — 物理感知世界模型基础模型,直接对接本项目 M4-4 基线回灌
  • 对接: M4-4 训练时把本项目数据按 Cosmos / DreamerV3 接口格式喂入。

E.x 主线小结

  • 数据集设计参考ScanNet++ + ARKitScenes 双标杆
  • 接口对齐LeRobot / Habitat 3.0 / Cosmos
  • 落地动作M4-2 数据卡参照 ScanNet++ 的 DatasheetM4-4 用 Cosmos 小模型回灌验证。

F. 与本项目 M1–M4 框架的论文映射

项目阶段 必读论文(粗体)+ 选读
M1 环境搂环 / 数据契约 ScanNet++ [2308.11417], ARKitScenes [2111.08897](学其元数据 schema
M2-1 场景级建图 ORB-SLAM3 [2007.11898], GS-SLAM [2311.11700]
M2-3 物体级细节 IGEV-Stereo [2303.06615], FoundationStereo [2501.09898]
M2-4 像素级失效 Marigold [2312.02145], Depth Anything v2 [2406.09414]
M3-3 位姿消融 ORB-SLAM3, VINS-Fusion [1901.03642], DPVO [2208.04726], BASALT [1904.06504]
M3-4 深度消融 FoundationStereo [2501.09898], Depth Anything v2 [2406.09414], CREStereo [2203.11483]
M3-5 融合建图 3DGS [2308.04079], SplaTAM [2312.02126], Photo-SLAM [2311.16728]
M4-1 评测基准 ScanNet++ [2308.11417], Replica [1906.05797], Hypersim [2011.02523]
M4-2 数据接口 Habitat 3.0 [2310.13724], ARKitScenes [2111.08897]
M4-4 基线回灌 NVIDIA Cosmos [2501.03575], DreamerV3 [2301.04104], World Models [1803.10122]

G. 国产团队论文清单(与 plans/camera/zed2i_china_alternatives.md 配套)

特别筛选国产团队 / 国内机构的代表性工作,便于国产化方案的学术背书:

论文 团队 arXiv 应用点
IGEV-Stereo 华中科技大学 2303.06615 立体匹配
CREStereo 旷视 Megvii 2203.11483 立体匹配
Depth Anything v1/v2 字节 + 港大 2401.10891 / 2406.09414 单目深度基础模型
Metric3D v2 阿里 DAMO 2404.15506 度量深度+法向量
VINS-Mono/Fusion 港科大沈邵劼组 1901.03642 VIO 工程标杆
DepthCrafter / StereoCrafter 腾讯 ARC Lab 2409.02095 / 2409.07447 时序一致深度
Photo-SLAM 上海交大 2311.16728 3DGS SLAM

结论:本项目所有关键技术节点(双目深度 / 单目深度 / VIO / 3DGS SLAM / 时序深度)都有国产 SOTA 论文支撑,国产化方案不仅是硬件层面,算法层面也完全自主可控。


H. 检索方法与可复现性

H.1 推荐 arXiv 检索语法

# 双目立体(近 2 年)
all:"stereo matching" AND submittedDate:[202401010000 TO 202612310000]

# 视觉惯性 SLAM
all:"visual inertial" OR all:"VIO" AND cat:cs.CV

# 3DGS SLAM
all:"gaussian splatting" AND all:"SLAM"

# 世界模型 + 室内数据
all:"world model" AND all:"indoor"

# ZED 相机相关工作(验证生态)
all:"ZED 2i" OR all:"ZED stereo"

H.2 推荐配套工具

H.3 引用复核清单(实施前必做)

⚠️ 本文档基于训练知识整理,部分论文 ID/年份可能有误差。建议在 M1 阶段完成以下复核

  • research/search_info.py 改写查询关键词,拉取近 30 天最新 arXiv 列表
  • 对每篇"必读论文"打开 arxiv.org 链接确认存在、版本、作者
  • 对"国产团队论文清单"额外核查机构归属(中文官网/作者主页)
  • 把核对后的引文写入 plans/camera/zed2i_iterative_framework.md 第 8 节作为权威引用源

I. 与既有 review 文档的关系

本仓库已有的两份 world model 综述:

本文档定位:聚焦"前端传感与建图数据 pipeline",是上述两份综述的上游数据基础。下游训练时 → 接入 world model 综述中的方法。

flowchart LR
    HW[ZED 2i / Gemini 335L 硬件] --> ALG[本文档 A-D<br/>立体/VIO/深度/建图算法]
    ALG --> DATA[本文档 E<br/>数据集与接口]
    DATA --> WM[research/world_models_review.md<br/>下游训练]
    DATA --> PWM[research/physics_world_models_review.md<br/>物理推理]

J. 推荐阅读顺序(首读 10 篇)

按本项目实施紧迫度排序:

  1. ORB-SLAM3 [2007.11898] — 替代 ZED VIO 的工程标杆
  2. 3D Gaussian Splatting [2308.04079] — M3-5 / M4 建图核心
  3. FoundationStereo [2501.09898] — M3-4 深度后处理首选
  4. Depth Anything v2 [2406.09414] — 单目深度国产基础模型
  5. GS-SLAM / Photo-SLAM [2311.11700 / 2311.16728] — 一体化 SLAM+渲染
  6. ScanNet++ [2308.11417] — 数据集元数据 schema 范本
  7. VINS-Fusion [1901.03642] — 国产 VIO 标杆
  8. IGEV-Stereo [2303.06615] — 国产立体匹配
  9. NVIDIA Cosmos [2501.03575] — World Model 基础模型接口
  10. DPVO [2208.04726] — 轻量神经 VIO

版本v0.1 最后更新2026-05-16 维护者:项目规划团队 配套plans/camera/zed2i_stereo_imu_solution.md · zed2i_iterative_framework.md · zed2i_china_alternatives.md