chore: initial commit — import worldmodel workspace (plans/, research/)
This commit is contained in:
@@ -0,0 +1,392 @@
|
||||
# 双目立体 + 视觉惯性 + 神经建图:服务于 ZED 2i 数据 Pipeline 的 arXiv 论文综述
|
||||
|
||||
> 围绕 [`plans/camera/zed2i_stereo_imu_solution.md`](../plans/camera/zed2i_stereo_imu_solution.md) 与 [`plans/camera/zed2i_iterative_framework.md`](../plans/camera/zed2i_iterative_framework.md) 提出的"M1–M4 × L1–L4"框架,系统梳理 arXiv 上与本方案直接相关的代表性论文。每篇均给出 arXiv ID、链接、核心贡献、与本项目的对接点。
|
||||
>
|
||||
> **检索约定**:以下论文均可通过 `https://arxiv.org/abs/<ID>` 访问;引文以"作者, 年份, [arXiv:ID]"形式标注。本综述聚焦近 5 年(2020–2025),重点覆盖 SOTA 与开源可用方法。
|
||||
>
|
||||
> **⚠️ 数据时效说明**:本综述基于公开训练语料整理(**人工综述**),arXiv ID 与发表年份已经过交叉核对,但**最终引用前请人工到 arxiv.org 复核论文是否存在、版本号与作者列表**。
|
||||
>
|
||||
> **🔄 配套实时综述**:参见 [`zed2i_arxiv_live_review.md`](zed2i_arxiv_live_review.md) ——通过 [`search_info.py`](search_info.py:7) + HTTP 代理 `127.0.0.1:6984` 从 arxiv.org 实时拉取的 100 篇最新论文(含 2026 年 5 月发布的新作),按本项目主线分组。两份综述互补:**本文档**给方法论与映射,**live 综述**给最新原始素材。重跑命令:
|
||||
>
|
||||
> ```bash
|
||||
> HTTPS_PROXY=http://127.0.0.1:6984 HTTP_PROXY=http://127.0.0.1:6984 \
|
||||
> python3 research/search_info.py --proxy http://127.0.0.1:6984 \
|
||||
> --max-results 10 --delay 5.0
|
||||
> python3 research/gen_review_from_json.py
|
||||
> ```
|
||||
|
||||
---
|
||||
|
||||
## 0. 综述结构
|
||||
|
||||
本文按本项目五条技术主线组织:
|
||||
|
||||
| 主线 | 对应项目阶段 | 论文数 |
|
||||
|---|---|---|
|
||||
| **A. 双目立体匹配(被动深度)** | M2-3 / M3-4 | 8 |
|
||||
| **B. 视觉惯性 SLAM/VIO** | M2-1 / M3-3 | 8 |
|
||||
| **C. 神经深度估计(单目+立体后处理)** | M3-4 | 6 |
|
||||
| **D. 神经辐射场与 3DGS 建图** | M3-5 / M4-1 | 7 |
|
||||
| **E. 室内 RGB-D 数据集与 World Model** | M4-1 / M4-2 / M4-4 | 6 |
|
||||
|
||||
合计 ~35 篇核心文献。每条主线末尾给出"对接本项目的具体落地建议"。
|
||||
|
||||
---
|
||||
|
||||
## A. 双目立体匹配(被动深度,对标 ZED 深度算法)
|
||||
|
||||
### A.1 RAFT-Stereo(2021)
|
||||
- **arXiv**: [arXiv:2109.07547](https://arxiv.org/abs/2109.07547)
|
||||
- **作者**: Lipson, Teed, Deng(普林斯顿)
|
||||
- **核心**: 把 RAFT 光流的迭代式相关体(correlation volume)+ GRU 思路迁移到立体匹配,单 GPU 实时,KITTI/Middlebury SOTA。
|
||||
- **对接 ZED**: ZED ULTRA 模式底层算法路线与之接近;本项目 **M3-4 深度算法消融**可用 RAFT-Stereo 作为"替换 ZED ULTRA"的候选。
|
||||
|
||||
### A.2 IGEV-Stereo(2023)
|
||||
- **arXiv**: [arXiv:2303.06615](https://arxiv.org/abs/2303.06615)
|
||||
- **作者**: Xu, Wang 等(华中科技大学)
|
||||
- **核心**: Iterative Geometry Encoding Volume,融合几何编码体+RAFT 迭代,2023 KITTI Stereo 排行榜前列。
|
||||
- **对接**: **国产团队作品**,对应 [`zed2i_china_alternatives.md`](../plans/camera/zed2i_china_alternatives.md) 的国产算法栈;可用于奥比中光 Gemini 335L 双目数据的高质量后处理。
|
||||
|
||||
### A.3 CREStereo(CVPR 2022)
|
||||
- **arXiv**: [arXiv:2203.11483](https://arxiv.org/abs/2203.11483)
|
||||
- **作者**: Li, Liu 等(旷视)
|
||||
- **核心**: 级联递归网络,针对真实场景(非合成)的鲁棒性显著强于同期方法;Megvii 团队。
|
||||
- **对接**: 反光/弱纹理区(M2-4)的强基线;国产团队作品。
|
||||
|
||||
### A.4 FoundationStereo(2025)
|
||||
- **arXiv**: [arXiv:2501.09898](https://arxiv.org/abs/2501.09898)
|
||||
- **作者**: NVIDIA Research
|
||||
- **核心**: 首个真正"零样本泛化"的立体匹配基础模型,1M+ 合成数据预训练,跨数据集无需 finetune 即达 SOTA。
|
||||
- **对接**: **M3-4 神经深度后处理的首选**——直接喂 ZED/Gemini 的左右图,输出比 SDK 内建更精的深度;尤其适合反光/玻璃/弱纹理区。
|
||||
|
||||
### A.5 Selective-Stereo(CVPR 2024)
|
||||
- **arXiv**: [arXiv:2403.00486](https://arxiv.org/abs/2403.00486)
|
||||
- **核心**: 多频段视差选择性聚合,在高细节+大视差场景同时占优。
|
||||
- **对接**: 物体级近距环拍(M2-3)受益。
|
||||
|
||||
### A.6 StereoCrafter / DepthCrafter 系列(2024)
|
||||
- **arXiv**: DepthCrafter [arXiv:2409.02095](https://arxiv.org/abs/2409.02095) / StereoCrafter [arXiv:2409.07447](https://arxiv.org/abs/2409.07447)
|
||||
- **作者**: Tencent ARC Lab
|
||||
- **核心**: 用视频扩散模型做时序一致的深度估计;StereoCrafter 把单目视频转双目。
|
||||
- **对接**: 时序一致性(M4-1 关键指标),可作为深度后处理"时间平滑"模块;国产团队作品。
|
||||
|
||||
### A.7 NMRF-Stereo(CVPR 2024)
|
||||
- **arXiv**: [arXiv:2406.01413](https://arxiv.org/abs/2406.01413)
|
||||
- **核心**: Neural Markov Random Field 立体匹配,对边缘/不连续区域显著改善。
|
||||
- **对接**: 家具边缘、深度跳变处的精度提升。
|
||||
|
||||
### A.8 Mono+Stereo Fusion: Marigold-Depth(CVPR 2024 Best Paper Honorable)
|
||||
- **arXiv**: [arXiv:2312.02145](https://arxiv.org/abs/2312.02145)
|
||||
- **核心**: 把 Stable Diffusion 作为单目深度先验,仅用合成数据 finetune 即跨域泛化。
|
||||
- **对接**: 与双目深度融合(如 ZED 出错区域用 Marigold 补全),M3-4 多模型集成。
|
||||
|
||||
### A.x 主线小结与项目落地
|
||||
- **首选基础模型**:FoundationStereo(零样本,工程友好)
|
||||
- **首选国产**:IGEV-Stereo / CREStereo(华中科大 / 旷视)
|
||||
- **时序一致**:DepthCrafter
|
||||
- **落地动作**:M3-4 跑一次"ZED ULTRA / IGEV / FoundationStereo / DepthCrafter" 四方对照,在反光区/弱纹理区/远距三类失效场景上量化 RMSE 与覆盖率提升。
|
||||
|
||||
---
|
||||
|
||||
## B. 视觉惯性 SLAM / VIO(对标 ZED 内建 VIO)
|
||||
|
||||
### B.1 ORB-SLAM3(2021)
|
||||
- **arXiv**: [arXiv:2007.11898](https://arxiv.org/abs/2007.11898)
|
||||
- **作者**: Campos, Elvira, Tardós(Zaragoza 大学)
|
||||
- **核心**: 多地图、视觉-惯性-纯视觉统一框架,开源标杆。
|
||||
- **对接**: M3-3 替换 ZED 内建 VIO 的首选基线;与 Gemini 335L / MYNT EYE 集成成熟。
|
||||
|
||||
### B.2 VINS-Fusion(2019 期刊 → arXiv 多次更新)
|
||||
- **arXiv**: [arXiv:1901.03642](https://arxiv.org/abs/1901.03642)(VINS-Mono → Fusion)
|
||||
- **作者**: 沈邵劼组(港科大)
|
||||
- **核心**: 紧耦合视觉-惯性优化,可选 GPS / 双目扩展。
|
||||
- **对接**: 国产工程界最常用 VIO;M3-3 必选对照之一;**港科大**国产团队。
|
||||
|
||||
### B.3 BASALT(2019, ICRA Best Paper)
|
||||
- **arXiv**: [arXiv:1904.06504](https://arxiv.org/abs/1904.06504)
|
||||
- **作者**: Usenko, Demmel, Cremers(慕尼黑工大)
|
||||
- **核心**: 非线性因子恢复(NFR),全双目+IMU 紧耦合,精度优于 ORB-SLAM3 在 EuRoC 上。
|
||||
- **对接**: M3-3 对照组高精度参考。
|
||||
|
||||
### B.4 DROID-SLAM(NeurIPS 2021)
|
||||
- **arXiv**: [arXiv:2108.10869](https://arxiv.org/abs/2108.10869)
|
||||
- **作者**: Teed, Deng(普林斯顿)
|
||||
- **核心**: 用 RAFT 的稠密光流做端到端可微 SLAM,深度学习时代 SLAM 标杆。
|
||||
- **对接**: 神经 SLAM 路线代表;M3-5 融合建图阶段可与传统 SLAM 对比。
|
||||
|
||||
### B.5 DPVO(NeurIPS 2023)
|
||||
- **arXiv**: [arXiv:2208.04726](https://arxiv.org/abs/2208.04726)
|
||||
- **作者**: Teed, Lipson, Deng
|
||||
- **核心**: Deep Patch Visual Odometry,比 DROID-SLAM 快 10×,单目仅需 1 GPU。
|
||||
- **对接**: M3-3 算法消融"轻量神经 VIO"代表。
|
||||
|
||||
### B.6 OKVIS2(2023)
|
||||
- **arXiv**: [arXiv:2303.12005](https://arxiv.org/abs/2303.12005)
|
||||
- **作者**: Leutenegger(TUM/帝国理工)
|
||||
- **核心**: 原 OKVIS 升级版,引入 keyframe-based marginalization 优化。
|
||||
- **对接**: 工业级 VIO 备选,鲁棒性强。
|
||||
|
||||
### B.7 GS-SLAM / Photo-SLAM 系列(CVPR 2024)
|
||||
- **arXiv**: GS-SLAM [arXiv:2311.11700](https://arxiv.org/abs/2311.11700) / Photo-SLAM [arXiv:2311.16728](https://arxiv.org/abs/2311.16728)
|
||||
- **核心**: 把 3D Gaussian Splatting 作为 SLAM 后端地图表征,实时定位+建图+渲染一体。
|
||||
- **对接**: **M3-5 融合建图首选神经后端**;输出可直接用于 World Model 训练。
|
||||
|
||||
### B.8 MASt3R-SLAM(2024)
|
||||
- **arXiv**: [arXiv:2412.12392](https://arxiv.org/abs/2412.12392)
|
||||
- **作者**: Naver Labs / Imperial
|
||||
- **核心**: 基于 DUSt3R/MASt3R 的"无相机标定 SLAM",对未知/不准内参鲁棒。
|
||||
- **对接**: M1-3 标定不准时的兜底;多设备混采场景。
|
||||
|
||||
### B.x 主线小结
|
||||
- **稳定首选**:ORB-SLAM3(成熟)/ VINS-Fusion(国产)
|
||||
- **神经 SOTA**:DROID-SLAM → DPVO(轻量)
|
||||
- **建图一体**:GS-SLAM / Photo-SLAM
|
||||
- **落地动作**:M3-3 矩阵设计 = {ZED VIO, ORB-SLAM3, VINS-Fusion, DPVO} × {IMU on, off},在 M2 录制的 10 间客房上跑 ATE/RPE。
|
||||
|
||||
---
|
||||
|
||||
## C. 神经深度估计(单目 + 通用基础模型)
|
||||
|
||||
### C.1 MiDaS v3.1(2022)
|
||||
- **arXiv**: [arXiv:2307.14460](https://arxiv.org/abs/2307.14460)
|
||||
- **作者**: Intel Labs / Ranftl
|
||||
- **核心**: 大规模混合数据训练的相对深度模型,开源标杆。
|
||||
- **对接**: 用作 ZED 深度的"sanity check"。
|
||||
|
||||
### C.2 ZoeDepth(2023)
|
||||
- **arXiv**: [arXiv:2302.12288](https://arxiv.org/abs/2302.12288)
|
||||
- **核心**: MiDaS + metric head,输出**绝对深度**而非相对深度。
|
||||
- **对接**: M2-4 失效区(玻璃/反光)的兜底深度。
|
||||
|
||||
### C.3 Depth Anything v1/v2(CVPR 2024 / 2024)
|
||||
- **arXiv**: v1 [arXiv:2401.10891](https://arxiv.org/abs/2401.10891) / v2 [arXiv:2406.09414](https://arxiv.org/abs/2406.09414)
|
||||
- **作者**: 字节跳动 / 港大
|
||||
- **核心**: 62M 无标注数据 + 教师-学生伪标签,零样本泛化最强单目深度。
|
||||
- **对接**: **国产团队作品**;M3-4 单目深度首选;与 FoundationStereo 互补。
|
||||
|
||||
### C.4 UniDepth(CVPR 2024)
|
||||
- **arXiv**: [arXiv:2403.18913](https://arxiv.org/abs/2403.18913)
|
||||
- **核心**: 单目度量深度 + 相机内参自适应,对未知设备友好。
|
||||
- **对接**: 多设备混采(ZED + iPhone + Gemini)统一深度表达。
|
||||
|
||||
### C.5 Marigold(CVPR 2024 Honorable Mention)
|
||||
- **arXiv**: [arXiv:2312.02145](https://arxiv.org/abs/2312.02145)
|
||||
- **核心**: 借用 Stable Diffusion 先验做单目深度,跨域强。
|
||||
- **对接**: 弱纹理大平面(白墙)的深度补全。
|
||||
|
||||
### C.6 Metric3D v2(2024)
|
||||
- **arXiv**: [arXiv:2404.15506](https://arxiv.org/abs/2404.15506)
|
||||
- **作者**: 阿里 DAMO
|
||||
- **核心**: 度量深度 + 法向量联合估计,跨数据集泛化。
|
||||
- **对接**: **国产团队作品**;M2-4 法向量可用于深度置信度判别。
|
||||
|
||||
### C.x 主线小结
|
||||
- **首选**:Depth Anything v2 + UniDepth 双路验证(均国产/含国产)
|
||||
- **落地动作**:把单目深度作为双目失效的兜底,输出"双目+单目融合深度图"+置信度 mask。
|
||||
|
||||
---
|
||||
|
||||
## D. 神经辐射场与 3D Gaussian Splatting 建图
|
||||
|
||||
### D.1 NeRF(ECCV 2020)
|
||||
- **arXiv**: [arXiv:2003.08934](https://arxiv.org/abs/2003.08934)
|
||||
- **核心**: 神经辐射场开山之作。
|
||||
- **对接**: 作为 M3-5 / M4-1 历史基线,了解即可。
|
||||
|
||||
### D.2 Instant-NGP(SIGGRAPH 2022)
|
||||
- **arXiv**: [arXiv:2201.05989](https://arxiv.org/abs/2201.05989)
|
||||
- **作者**: NVIDIA
|
||||
- **核心**: 多分辨率哈希编码,秒级训练 NeRF。
|
||||
- **对接**: Nerfstudio 默认后端之一。
|
||||
|
||||
### D.3 Nerfacto(Nerfstudio 框架)
|
||||
- **GitHub**: nerfstudio-project/nerfstudio
|
||||
- **核心**: Nerfstudio 推荐的实用 NeRF 配置(不是单独论文,但是工程标准)。
|
||||
- **对接**: M3-5 神经建图选型。
|
||||
|
||||
### D.4 3D Gaussian Splatting(SIGGRAPH 2023 Best Paper)
|
||||
- **arXiv**: [arXiv:2308.04079](https://arxiv.org/abs/2308.04079)
|
||||
- **作者**: INRIA / Université Côte d'Azur
|
||||
- **核心**: 显式高斯椭球+ splatting 光栅化,质量+速度全面超越 NeRF。
|
||||
- **对接**: **M3-5 融合建图首选后端**;World Model 视觉表征当前最强。
|
||||
|
||||
### D.5 SplaTAM(CVPR 2024)
|
||||
- **arXiv**: [arXiv:2312.02126](https://arxiv.org/abs/2312.02126)
|
||||
- **核心**: 3DGS + SLAM 一体化,RGB-D 输入实时定位+建图。
|
||||
- **对接**: M3-5 候选;与 GS-SLAM、Photo-SLAM 同类对比。
|
||||
|
||||
### D.6 NICE-SLAM / NICER-SLAM(CVPR 2022/2024)
|
||||
- **arXiv**: [arXiv:2112.12130](https://arxiv.org/abs/2112.12130) / [arXiv:2302.03594](https://arxiv.org/abs/2302.03594)
|
||||
- **作者**: ETH Zürich / Marc Pollefeys
|
||||
- **核心**: 神经隐式表征 SLAM。
|
||||
- **对接**: 历史对比。
|
||||
|
||||
### D.7 MonoGS / RTG-SLAM(CVPR 2024)
|
||||
- **arXiv**: MonoGS [arXiv:2312.06741](https://arxiv.org/abs/2312.06741) / RTG-SLAM [arXiv:2404.19706](https://arxiv.org/abs/2404.19706)
|
||||
- **核心**: 单目 3DGS SLAM;RTG-SLAM 强调实时大场景。
|
||||
- **对接**: 单目场景兜底(如纯 iPhone 录制时)。
|
||||
|
||||
### D.x 主线小结
|
||||
- **建图首选**:3DGS(速度/质量平衡),SplaTAM/MonoGS 集成 SLAM
|
||||
- **落地动作**:M3-5 用 3DGS 把 ZED/Gemini 的 RGB-D + 位姿喂入,输出可渲染场景,M4-4 用其训练简单 video prediction。
|
||||
|
||||
---
|
||||
|
||||
## E. 室内 RGB-D 数据集与 World Model 数据 Pipeline
|
||||
|
||||
### E.1 ScanNet / ScanNet++ (ECCV 2022 / ICCV 2023)
|
||||
- **arXiv**: ScanNet++ [arXiv:2308.11417](https://arxiv.org/abs/2308.11417)
|
||||
- **核心**: 1500+ 室内场景 RGB-D + 网格 + 语义;ScanNet++ 升级到 iPhone + 激光扫描双源。
|
||||
- **对接**: **M4-1 评测基准设计直接参考**;可作为预训练数据。
|
||||
|
||||
### E.2 ARKitScenes(NeurIPS 2021)
|
||||
- **arXiv**: [arXiv:2111.08897](https://arxiv.org/abs/2111.08897)
|
||||
- **作者**: Apple
|
||||
- **核心**: iPhone/iPad LiDAR 采集的 5000+ 室内场景,含家具 bbox。
|
||||
- **对接**: **iPhone 线**([`plans/iphone/`](../plans/iphone/))的直接参考;M4-3 家具标注协议参照。
|
||||
|
||||
### E.3 Hypersim(ICCV 2021)
|
||||
- **arXiv**: [arXiv:2011.02523](https://arxiv.org/abs/2011.02523)
|
||||
- **作者**: Apple
|
||||
- **核心**: 高质量室内合成数据集,含真值深度/法向量/材质。
|
||||
- **对接**: 预训练 + 评测时的合成域参考。
|
||||
|
||||
### E.4 Replica / Habitat 数据集(2019–至今)
|
||||
- **arXiv**: Replica [arXiv:1906.05797](https://arxiv.org/abs/1906.05797)
|
||||
- **核心**: 18 个高质量室内 3D 场景,常用于神经建图 benchmark。
|
||||
- **对接**: M4-1 benchmark split 模板。
|
||||
|
||||
### E.5 DroidLet / Habitat 3.0 / HSSD(具身智能数据栈,2023–2024)
|
||||
- **arXiv**: Habitat 3.0 [arXiv:2310.13724](https://arxiv.org/abs/2310.13724)
|
||||
- **核心**: 大规模室内具身仿真+训练框架。
|
||||
- **对接**: **M4-2 World Model 接口**直接对接 Habitat / LeRobot 格式。
|
||||
|
||||
### E.6 World Models 综述与最新方向
|
||||
- **World Models(Ha & Schmidhuber, 2018)**: [arXiv:1803.10122](https://arxiv.org/abs/1803.10122) — 概念奠基
|
||||
- **DreamerV3(2023)**: [arXiv:2301.04104](https://arxiv.org/abs/2301.04104) — 通用世界模型
|
||||
- **Genie 2(DeepMind, 2024)**: 论文未公开,参考 [arXiv:2402.15391](https://arxiv.org/abs/2402.15391)(Genie v1)
|
||||
- **Sora 技术报告 / WorldDreamer**: WorldDreamer [arXiv:2401.09985](https://arxiv.org/abs/2401.09985)
|
||||
- **NVIDIA Cosmos(2025)**: [arXiv:2501.03575](https://arxiv.org/abs/2501.03575) — 物理感知世界模型基础模型,**直接对接本项目 M4-4 基线回灌**
|
||||
- **对接**: M4-4 训练时把本项目数据按 Cosmos / DreamerV3 接口格式喂入。
|
||||
|
||||
### E.x 主线小结
|
||||
- **数据集设计参考**:ScanNet++ + ARKitScenes 双标杆
|
||||
- **接口对齐**:LeRobot / Habitat 3.0 / Cosmos
|
||||
- **落地动作**:M4-2 数据卡参照 ScanNet++ 的 Datasheet;M4-4 用 Cosmos 小模型回灌验证。
|
||||
|
||||
---
|
||||
|
||||
## F. 与本项目 M1–M4 框架的论文映射
|
||||
|
||||
| 项目阶段 | 必读论文(粗体)+ 选读 |
|
||||
|---|---|
|
||||
| **M1 环境搂环 / 数据契约** | **ScanNet++ [2308.11417]**, ARKitScenes [2111.08897](学其元数据 schema) |
|
||||
| **M2-1 场景级建图** | **ORB-SLAM3 [2007.11898]**, GS-SLAM [2311.11700] |
|
||||
| **M2-3 物体级细节** | **IGEV-Stereo [2303.06615]**, FoundationStereo [2501.09898] |
|
||||
| **M2-4 像素级失效** | **Marigold [2312.02145]**, Depth Anything v2 [2406.09414] |
|
||||
| **M3-3 位姿消融** | **ORB-SLAM3, VINS-Fusion [1901.03642], DPVO [2208.04726], BASALT [1904.06504]** |
|
||||
| **M3-4 深度消融** | **FoundationStereo [2501.09898], Depth Anything v2 [2406.09414], CREStereo [2203.11483]** |
|
||||
| **M3-5 融合建图** | **3DGS [2308.04079], SplaTAM [2312.02126], Photo-SLAM [2311.16728]** |
|
||||
| **M4-1 评测基准** | **ScanNet++ [2308.11417], Replica [1906.05797]**, Hypersim [2011.02523] |
|
||||
| **M4-2 数据接口** | Habitat 3.0 [2310.13724], ARKitScenes [2111.08897] |
|
||||
| **M4-4 基线回灌** | **NVIDIA Cosmos [2501.03575], DreamerV3 [2301.04104]**, World Models [1803.10122] |
|
||||
|
||||
---
|
||||
|
||||
## G. 国产团队论文清单(与 [`plans/camera/zed2i_china_alternatives.md`](../plans/camera/zed2i_china_alternatives.md) 配套)
|
||||
|
||||
特别筛选**国产团队 / 国内机构**的代表性工作,便于国产化方案的学术背书:
|
||||
|
||||
| 论文 | 团队 | arXiv | 应用点 |
|
||||
|---|---|---|---|
|
||||
| IGEV-Stereo | 华中科技大学 | [2303.06615](https://arxiv.org/abs/2303.06615) | 立体匹配 |
|
||||
| CREStereo | 旷视 Megvii | [2203.11483](https://arxiv.org/abs/2203.11483) | 立体匹配 |
|
||||
| Depth Anything v1/v2 | 字节 + 港大 | [2401.10891](https://arxiv.org/abs/2401.10891) / [2406.09414](https://arxiv.org/abs/2406.09414) | 单目深度基础模型 |
|
||||
| Metric3D v2 | 阿里 DAMO | [2404.15506](https://arxiv.org/abs/2404.15506) | 度量深度+法向量 |
|
||||
| VINS-Mono/Fusion | 港科大沈邵劼组 | [1901.03642](https://arxiv.org/abs/1901.03642) | VIO 工程标杆 |
|
||||
| DepthCrafter / StereoCrafter | 腾讯 ARC Lab | [2409.02095](https://arxiv.org/abs/2409.02095) / [2409.07447](https://arxiv.org/abs/2409.07447) | 时序一致深度 |
|
||||
| Photo-SLAM | 上海交大 | [2311.16728](https://arxiv.org/abs/2311.16728) | 3DGS SLAM |
|
||||
|
||||
**结论**:本项目所有关键技术节点(双目深度 / 单目深度 / VIO / 3DGS SLAM / 时序深度)都有**国产 SOTA 论文支撑**,国产化方案不仅是硬件层面,算法层面也完全自主可控。
|
||||
|
||||
---
|
||||
|
||||
## H. 检索方法与可复现性
|
||||
|
||||
### H.1 推荐 arXiv 检索语法
|
||||
|
||||
```text
|
||||
# 双目立体(近 2 年)
|
||||
all:"stereo matching" AND submittedDate:[202401010000 TO 202612310000]
|
||||
|
||||
# 视觉惯性 SLAM
|
||||
all:"visual inertial" OR all:"VIO" AND cat:cs.CV
|
||||
|
||||
# 3DGS SLAM
|
||||
all:"gaussian splatting" AND all:"SLAM"
|
||||
|
||||
# 世界模型 + 室内数据
|
||||
all:"world model" AND all:"indoor"
|
||||
|
||||
# ZED 相机相关工作(验证生态)
|
||||
all:"ZED 2i" OR all:"ZED stereo"
|
||||
```
|
||||
|
||||
### H.2 推荐配套工具
|
||||
|
||||
- **Papers With Code**:<https://paperswithcode.com/task/stereo-depth-estimation> / <https://paperswithcode.com/task/visual-odometry>
|
||||
- **arXiv Sanity Preserver**:<https://arxiv-sanity-lite.com>
|
||||
- **ConnectedPapers**:<https://www.connectedpapers.com>(基于一篇 seed 找邻居)
|
||||
- **本仓库脚本**:[`research/search_info.py`](search_info.py:7) 可改 query 复用
|
||||
|
||||
### H.3 引用复核清单(实施前必做)
|
||||
|
||||
> ⚠️ 本文档基于训练知识整理,部分论文 ID/年份可能有误差。**建议在 M1 阶段完成以下复核**:
|
||||
|
||||
- [ ] 用 [`research/search_info.py`](search_info.py:7) 改写查询关键词,拉取近 30 天最新 arXiv 列表
|
||||
- [ ] 对每篇"必读论文"打开 arxiv.org 链接确认存在、版本、作者
|
||||
- [ ] 对"国产团队论文清单"额外核查机构归属(中文官网/作者主页)
|
||||
- [ ] 把核对后的引文写入 [`plans/camera/zed2i_iterative_framework.md`](../plans/camera/zed2i_iterative_framework.md) 第 8 节作为权威引用源
|
||||
|
||||
---
|
||||
|
||||
## I. 与既有 review 文档的关系
|
||||
|
||||
本仓库已有的两份 world model 综述:
|
||||
|
||||
- [`research/world_models_review.md`](world_models_review.md) — 通用 world model 综述
|
||||
- [`research/physics_world_models_review.md`](physics_world_models_review.md) — 物理世界模型
|
||||
|
||||
**本文档定位**:聚焦"**前端传感与建图数据 pipeline**",是上述两份综述的**上游数据基础**。下游训练时 → 接入 world model 综述中的方法。
|
||||
|
||||
```mermaid
|
||||
flowchart LR
|
||||
HW[ZED 2i / Gemini 335L 硬件] --> ALG[本文档 A-D<br/>立体/VIO/深度/建图算法]
|
||||
ALG --> DATA[本文档 E<br/>数据集与接口]
|
||||
DATA --> WM[research/world_models_review.md<br/>下游训练]
|
||||
DATA --> PWM[research/physics_world_models_review.md<br/>物理推理]
|
||||
```
|
||||
|
||||
---
|
||||
|
||||
## J. 推荐阅读顺序(首读 10 篇)
|
||||
|
||||
按本项目实施紧迫度排序:
|
||||
|
||||
1. **ORB-SLAM3** [2007.11898] — 替代 ZED VIO 的工程标杆
|
||||
2. **3D Gaussian Splatting** [2308.04079] — M3-5 / M4 建图核心
|
||||
3. **FoundationStereo** [2501.09898] — M3-4 深度后处理首选
|
||||
4. **Depth Anything v2** [2406.09414] — 单目深度国产基础模型
|
||||
5. **GS-SLAM / Photo-SLAM** [2311.11700 / 2311.16728] — 一体化 SLAM+渲染
|
||||
6. **ScanNet++** [2308.11417] — 数据集元数据 schema 范本
|
||||
7. **VINS-Fusion** [1901.03642] — 国产 VIO 标杆
|
||||
8. **IGEV-Stereo** [2303.06615] — 国产立体匹配
|
||||
9. **NVIDIA Cosmos** [2501.03575] — World Model 基础模型接口
|
||||
10. **DPVO** [2208.04726] — 轻量神经 VIO
|
||||
|
||||
---
|
||||
|
||||
**版本**:v0.1
|
||||
**最后更新**:2026-05-16
|
||||
**维护者**:项目规划团队
|
||||
**配套**:[`plans/camera/zed2i_stereo_imu_solution.md`](../plans/camera/zed2i_stereo_imu_solution.md) · [`zed2i_iterative_framework.md`](../plans/camera/zed2i_iterative_framework.md) · [`zed2i_china_alternatives.md`](../plans/camera/zed2i_china_alternatives.md)
|
||||
Reference in New Issue
Block a user