Files
worldmodel/research/crowdroom_related_papers_2026.md
T
gaojie cf19b313ae
Sync to site1 / sync (push) Has been cancelled
chore: update research categories from worldmodel to research
2026-05-21 02:35:05 +08:00

24 KiB
Raw Blame History

title, date, draft, tags, categories
title date draft tags categories
CrowdRoom 相关论文综述(2026 骨架版) 2026-05-20 false
调研
论文综述
SLAM
NeRF
Gaussian Splatting
机器人
research

CrowdRoom 相关论文综述(2026 骨架版)

文档时间戳(开头)

  • ISO 8601 (UTC): 2026-05-20T09:06:58Z
  • Asia/Shanghai (UTC+8): 2026-05-20 17:06:58
  • 生成模式:抓取失败状态报告 + 综述骨架(0 篇真实论文)

摘要

本综述原计划基于 research/crowdroom_papers_raw.json 中由 research/fetch_crowdroom_papers.py 抓取的 arXiv 论文,围绕 CrowdRoom"RoomPlan 版 Sketchfab + Pinterest",详见 plans/CrowdRoom/00_overview.md)所关切的 10 个研究方向,给出按主题组织的中文文献综述。然而,本次数据采集因 arXiv API 全面速率限制(HTTP 429)而完全失败JSON 中 unique_papers 为空数组,10 个主题各自返回 0 篇论文。为遵守"不要编造未在 JSON 中出现的论文"的硬性约束,本文不引用任何具体论文,而是以骨架(skeleton)形式给出:(i) 数据采集失败状态的如实复盘;(ii) 10 个预设主题各自的研究问题(Research Questions, RQ);(iii) 每个主题应覆盖的典型方法学家族(taxonomy placeholder);(iv) CrowdRoom 项目可能受益的研究空白与未来方向。本文档预期在后续抓取成功后,被自动化脚本填充为完整综述。


1. 引言与背景

1.1 研究动机:为什么 CrowdRoom 需要一份文献综述

CrowdRoom 的产品定位是「人人用 iPhone 扫一个房间,传到云端就有可在浏览器里 360° 把玩、分层切换、换家具换材质、Remix 再创作的 3D 房间社区」。其技术链路(参见 plans/CrowdRoom/00_overview.md §4 架构图)横跨多个活跃研究领域:

  • 采集端iPhone RoomPlan / ARKit / LiDAR 的几何与语义精度边界;
  • 重建端:以 NeRF、3D Gaussian Splatting3DGS)为代表的神经场重建;
  • 生成端text-to-3D 家具、image-to-3D 单图重建、室内布局生成;
  • 理解端3D 物体姿态估计、OBBOriented Bounding Box)朝向估计;
  • 数据与社区:众包 3D 数据采集、隐私脱敏、UGC 治理;
  • 应用与互操作:数字孪生 / Scan-to-BIM、USD / glTF / OpenUSD 资产标准化。

每一条链路都已有成熟的学术社群与代表性方法;CrowdRoom 要在 8 周内交付 MVP(参见 plans/CrowdRoom/00_overview.md §7.1),需要快速吸收"哪些方法已成熟、哪些仍是开放问题、哪些方法学路线与消费级路线相容"等综述性判断。本文档即为该综述的预定位版本。

1.2 综述的范围与边界

本综述聚焦 10 个由 research/crowdroom_papers_raw.jsontopics_meta 字段预先定义的主题(详见 §3)。范围内:与上述链路直接相关的几何重建、生成式 3D、众包数据、隐私、资产标准化文献。范围外:通用机器人 SLAM 综述、与消费级路线无关的工业 BIM/GIS、纯图像生成(2D 扩散模型)综述。

1.3 与 CrowdRoom 项目文档的关系

本综述与 plans/CrowdRoom/ 目录下的产品/技术文档形成"文献证据 ↔ 工程决策"的双向引用关系:

  • 工程文档中"选 3DGS 还是 NeRF?"等技术选型问题,应由本综述的 §3.2 / §3.3 给出文献支撑;
  • 本综述识别出的研究空白,应反馈到 plans/CrowdRoom/ROADMAP.md

2. 数据采集状态(如实复盘)

2.1 抓取结果总览

字段
数据源文件 research/crowdroom_papers_raw.json
生成时间 2026-05-20T16:30:00+0800
抓取脚本 research/fetch_crowdroom_papers.py
抓取状态 FAILED_RATE_LIMIT
涵盖论文总数 0 篇
唯一论文数 unique_papers 0
涉及主题数 10(全部预设主题)
失败模式 arXiv API 全面返回 HTTP 429「Rate exceeded」

2.2 已尝试的抓取过程

JSON meta.fetch_attempts 字段记录了 4 次明确的尝试,均失败:

# 时间(CST 主题 结果
1 2026-05-20T13:18 roomplan_arkit 0 篇;4× 42930/60/90/120 s 退避)
2 2026-05-20T16:32(后台) roomplan_arkit 0 篇;4× 429 + 2× SSL timeout
3 2026-05-20T16:32(后台) gaussian_splatting_indoor 0 篇;6× 42930/60/90/120/150/180 s 退避)
4 2026-05-20T16:50(探针) all:RoomPlan 直连与代理双双返回 HTTP 429

其余 8 个主题状态为 not-attempted (killed at topic 3):因脚本在第 3 个主题处即被限流终止,未进入。

2.3 失败原因诊断

  • 触发条件:宿主机 IP 与 HTTP 代理(http://127.0.0.1:6984)IP 均已被 arXiv 速率限制器标记,速率窗口长度 > 2 小时;
  • 重试无效30/60/90/120/150/180 秒的指数退避未能恢复;
  • 协议无效:IPv4 与 IPv6 双栈同样被拒;
  • 代理无效:直连与回环代理表现一致。

2.4 建议的恢复策略

根据 JSON meta.recommended_retry

  1. 等待 ≥ 2 小时后重试;
  2. 执行时段:建议在北京时间 04:00–09:00 的 arXiv 低峰窗口;
  3. 网络方案:必要时切换到住宅代理(residential proxy);
  4. 降级方案:使用 Semantic Scholar API 或 OpenAlex 作为替代检索源(不在当前脚本范围内)。

2.5 对本综述的直接影响

由于 0 篇真实论文可引用,本综述:

  • 给出任何 [编号] 形式的引用(参考文献章节为空,明确标注 0 篇);
  • 包含任何具体方法(如"3DGS 方法 X 在 Replica 数据集上取得 PSNR=Y")的数值或作者归属;
  • 给出每个主题的研究问题、应覆盖的方法学家族(taxonomy placeholder)、CrowdRoom 应当从中提取的工程结论模板。

3. 主题骨架(10 个预设方向)

以下 10 个一级主题严格对应 JSON topics_meta 字段的 10 个键,顺序保留原顺序。每个主题给出:(a) 主题定义与 CrowdRoom 关联(b) 待回答的研究问题 RQ(c) 应覆盖的方法学家族(d) 论文填充占位

3.1 主题一:iPhone RoomPlan / ARKit 室内扫描

(a) 主题定义与 CrowdRoom 关联 该主题关注 Apple RoomPlan API、ARKit、iPhone LiDAR 在室内几何采集中的精度边界、语义输出格式与最佳实践。CrowdRoom iOS App 的唯一采集入口即 RoomPlan,因此该主题是综述的主干,对应 plans/CrowdRoom/03_ios_app_plan.mdplans/iphone/roomplan_accuracy_and_cad_export.md 的工程文档。

(b) RQ

  • RQ1.1RoomPlan 在不同光照 / 户型 / 家具密度下的几何精度量化结论是什么?
  • RQ1.2RoomPlan 输出的 USDZ + JSON 是否足以支撑下游"分层切换 / 家具替换"的语义需求?
  • RQ1.3ARKit / iPhone LiDAR 与中高端激光扫描仪(如 Matterport / Leica BLK)的差距在哪些指标上显著?
  • RQ1.4:扫描路径与移动速度对 RoomPlan 重建质量的影响曲线如何?

(c) 应覆盖的方法学家族

家族 代表性方法(占位) CrowdRoom 关注角度
LiDAR + VIO 几何采集 待填充 扫描引导提示、精度免责声明
平面 / 房间几何拟合 待填充 墙地分割稳定性、出图精度
室内语义分割(家具类别) 待填充 与 RoomPlan 内置类别的对齐
扫描质量评估与反馈 待填充 用户扫描中实时提示

(d) 论文填充占位:当前 0 篇。


3.2 主题二:3D Gaussian Splatting 室内重建

(a) 主题定义与 CrowdRoom 关联 3DGS 与 NeRF(§3.3)并列为近年主流的"可微神经场"方案,其在室内场景的实时渲染速度与显存占用对 Web 端可视化具有直接吸引力。CrowdRoom MVP 中的 Web 端实际渲染由 Three.js / R3F 承担,仍是网格 + 贴图路线;3DGS 是未来可选升级路径(参见 plans/CrowdRoom/00_overview.md §5 备选项)。

(b) RQ

  • RQ2.13DGS 在室内复杂遮挡 / 反射 / 透明物体上的失败模式是什么?
  • RQ2.23DGS 与传统网格 + PBR 贴图路线相比,在带宽 / 显存 / 浏览器兼容性上的真实差距?
  • RQ2.3:是否存在可编辑(语义可分层、家具可替换)的 3DGS 表达?
  • RQ2.43DGS 与 RoomPlan 输出(USDZ + 平面几何)如何融合?

(c) 应覆盖的方法学家族

家族 代表性方法(占位) CrowdRoom 关注角度
原始 3DGS 渲染 待填充 浏览器端渲染可行性
大场景 / 房间级 3DGS 待填充 单房间显存占用
可编辑 / 可分层 3DGS 待填充 与"分层 = L1L4"的对齐
3DGS 压缩与流式传输 待填充 CDN 分发可行性

(d) 论文填充占位:当前 0 篇。


3.3 主题三:NeRF 室内场景重建

(a) 主题定义与 CrowdRoom 关联 NeRF 作为 3DGS 之前的主流神经场方法,仍在"高保真离线重建 + 服务端渲染"路线下保有价值。CrowdRoom MVP 明确不做服务端实时渲染(plans/CrowdRoom/00_overview.md §4),因此 NeRF 主要作为对比参考与离线烘焙工具进入综述。

(b) RQ

  • RQ3.1NeRF 在房间尺度(room-scale)下的训练耗时与显存占用边界?
  • RQ3.2NeRF → 网格(mesh extraction)的质量损失曲线如何?
  • RQ3.3:是否存在"少量 iPhone 帧 → 可用 NeRF"的实用化方案?
  • RQ3.4:NeRF 在低纹理墙面 / 大面积玻璃上的退化机制?

(c) 应覆盖的方法学家族

家族 代表性方法(占位) CrowdRoom 关注角度
原始体素 NeRF 待填充 训练成本基线
加速 NeRF(哈希编码等) 待填充 离线烘焙可行性
室内大场景 NeRF 待填充 房间尺度收敛性
NeRF → mesh 提取 待填充 与 glTF 管线衔接

(d) 论文填充占位:当前 0 篇。


3.4 主题四:text-to-3D 家具 / 资产生成

(a) 主题定义与 CrowdRoom 关联 text-to-3D 让 Remixer 用户通过自然语言生成新家具,对应 CrowdRoom user story US-5(家具替换,见 plans/CrowdRoom/00_overview.md §3)。MVP 阶段公共资产库走 CC0 素材路线,text-to-3D 是P2 阶段的潜在能力扩展。

(b) RQ

  • RQ4.1:当前 text-to-3D 在家具类目(沙发 / 椅子 / 灯具)的生成质量是否足够直接进入 glTF 管线?
  • RQ4.2:生成结果的拓扑、UV 与 PBR 材质是否可被 Three.js 直接消费?
  • RQ4.3:生成式资产的版权与可商用边界?
  • RQ4.4:与"扫描自真实家具"的资产相比,生成式资产在物理尺度上的一致性如何?

(c) 应覆盖的方法学家族

家族 代表性方法(占位) CrowdRoom 关注角度
Score Distillation 路线 待填充 生成质量与时间成本
多视图扩散 → 3D 重建 待填充 与 image-to-3D 的边界
Native 3D 扩散(点云 / 三平面) 待填充 输出格式与 glTF 兼容性
家具专用大规模训练 待填充 类别覆盖度

(d) 论文填充占位:当前 0 篇。


3.5 主题五:室内布局生成 / 房间布置合成

(a) 主题定义与 CrowdRoom 关联 "给定一个空房间,自动生成一种家具布局",对 CrowdRoom 的 Remix 创作("装修方案")有显著加速价值。MVP 暂不引入自动布局,但综述应识别该领域的成熟度,以支撑 P2 路线图。

(b) RQ

  • RQ5.1:当前室内布局生成是否能保证物理可行性(无穿插、可达性、人体工学)?
  • RQ5.2:以扩散模型为代表的布局生成方法与传统优化方法(如约束求解)的对比?
  • RQ5.3:是否存在可条件化于"扫描得到的真实房间几何"的布局生成?
  • RQ5.4:风格条件(如"日式 / 北欧 / 工业风")是否可控?

(c) 应覆盖的方法学家族

家族 代表性方法(占位) CrowdRoom 关注角度
自回归布局生成 待填充 物理约束的硬约束注入
扩散模型布局生成 待填充 风格可控性
优化 / 规则驱动布局 待填充 与生成式方法的混合
基于场景图的布局 待填充 与 PRISM 语义图的对齐

(d) 论文填充占位:当前 0 篇。


3.6 主题六:3D 物体姿态估计 / OBB 朝向

(a) 主题定义与 CrowdRoom 关联 RoomPlan 输出的家具节点含位置与 OBB,但朝向("沙发面朝哪里")的稳定性是已知痛点。该主题决定 CrowdRoom 在家具替换时能否做到"新沙发面朝原沙发同一方向"的自动对齐。

(b) RQ

  • RQ6.1:在 iPhone LiDAR 噪声水平下,9DoF 姿态估计的可达精度?
  • RQ6.2RoomPlan 原生朝向输出的失败模式(如对称家具)如何缓解?
  • RQ6.3:是否存在仅靠扫描得到的稀疏点云即可恢复朝向的轻量方法?
  • RQ6.4:基于类别先验("沙发的座面朝向房间内侧")的规则修正是否实用?

(c) 应覆盖的方法学家族

家族 代表性方法(占位) CrowdRoom 关注角度
模板匹配 / ICP 待填充 与公共资产库的对齐
学习式 6D/9D 姿态 待填充 噪声鲁棒性
类别级姿态(NOCS 等) 待填充 跨实例泛化
朝向投票 / 对称性消歧 待填充 对称家具消歧

(d) 论文填充占位:当前 0 篇。


3.7 主题七:众包 3D 数据采集 / 数据集

(a) 主题定义与 CrowdRoom 关联 这是 CrowdRoom 的身份主题:是否存在已有的众包 3D 数据社区?其失败 / 成功要素是什么?这是综述中最需要识别"研究空白"的章节,对应 plans/CrowdRoom/10_governance.mdplans/CrowdRoom/09_privacy.md

(b) RQ

  • RQ7.1:现有大规模室内 3D 数据集(如 ScanNet 系列、Matterport3D 等)的采集模式是众包还是专业团队?
  • RQ7.2:众包 3D 数据的质量控制机制(重叠采集、用户评分、自动筛选)有哪些?
  • RQ7.3UGC 3D 内容的版权与许可(CC0 / CC-BY / 商用)实践?
  • RQ7.4:是否有研究专门量化"业余用户扫描"vs"专业团队扫描"的质量差距?

(c) 应覆盖的方法学家族

家族 代表性方法(占位) CrowdRoom 关注角度
专业团队大规模室内数据集 待填充 数据规模基线
众包 2D / 3D 标注 待填充 质量控制流程
用户贡献 3D 内容平台 待填充 社区机制
联邦 / 隐私保护的数据共享 待填充 与 §3.9 的衔接

(d) 论文填充占位:当前 0 篇。


3.8 主题八:数字孪生 / 室内 GIS / Scan-to-BIM

(a) 主题定义与 CrowdRoom 关联 plans/CrowdRoom/00_overview.md §1 明确划清:"CrowdRoom 不做专业 GIS 查询,只做消费级图层操作"。本主题在综述中作为对照组:说明"我们不走 Scan-to-BIM 路线"的判断依据。

(b) RQ

  • RQ8.1Scan-to-BIM 当前的自动化程度是什么?是否仍依赖大量人工修正?
  • RQ8.2:消费级 RoomPlan 输出与 BIM 所需精度(IFC LOD 等级)之间的差距?
  • RQ8.3:是否有轻量级"消费级数字孪生"的中间路线?
  • RQ8.4:室内 GIS 数据模型(如 IndoorGML)与 Three.js 渲染管线的兼容性?

(c) 应覆盖的方法学家族

家族 代表性方法(占位) CrowdRoom 关注角度
点云 / 网格 → IFC 自动化 待填充 自动化上限
室内 GIS 查询 待填充 暂不引入的理由
数字孪生平台 待填充 消费级 vs 工业级边界
轻量化 BIM / 简化 IFC 待填充 中间路线可行性

(d) 论文填充占位:当前 0 篇。


3.9 主题九:image-to-3D / 单图重建

(a) 主题定义与 CrowdRoom 关联 单图 → 3D 重建可用于"用户上传一张家具照片,自动生成可替换的 3D 资产",是 Remix 创作的潜在低门槛入口。它与 §3.4(text-to-3D)共同构成"非扫描类资产入库"路径。

(b) RQ

  • RQ9.1:当前 image-to-3D 在家具类目下的几何完整性(背面 / 底面)如何?
  • RQ9.2:单图 vs 少视图(few-view)的质量拐点在哪里?
  • RQ9.3:输出网格的拓扑质量是否能被 PBR 管线直接消费?
  • RQ9.4:与 text-to-3D 相比,image-to-3D 在"形似但不同物"的语义偏移上表现如何?

(c) 应覆盖的方法学家族

家族 代表性方法(占位) CrowdRoom 关注角度
回归式单视图重建 待填充 几何完整性
扩散先验式重建 待填充 背面合理性
多视图扩散 + 重建 待填充 与扫描互补
类别先验式重建 待填充 家具类目泛化

(d) 论文填充占位:当前 0 篇。


3.10 主题十:USD / glTF / 3D 资产标准化

(a) 主题定义与 CrowdRoom 关联 CrowdRoom 数据链路的核心格式约定为「USDZ(来自 RoomPlan)→ glTF/.glbWeb 端消费)」。该主题为综述提供"为什么是这两种格式""未来 OpenUSD 的影响"等格式层的文献支撑,对应 plans/CrowdRoom/01_data_schema.mdplans/iphone/roomplan_accuracy_and_cad_export.md

(b) RQ

  • RQ10.1USDZ 与 glTF 在浏览器端的兼容性现状?
  • RQ10.2OpenUSD 的开放化进程对消费级 3D 社区的影响?
  • RQ10.3Draco / Meshopt 压缩对 glTF 在 Web 端的实际收益曲线?
  • RQ10.4:3D 资产的版权水印 / 来源认证是否已有标准化方案?

(c) 应覆盖的方法学家族

家族 代表性方法(占位) CrowdRoom 关注角度
glTF 核心规范与扩展 待填充 Three.js 兼容性
USD / OpenUSD 生态 待填充 与 Apple 工具链衔接
网格 / 纹理压缩 待填充 CDN 带宽优化
资产来源 / 水印 待填充 UGC 治理

(d) 论文填充占位:当前 0 篇。


4. 跨主题趋势观察(基于主题定义层面)

由于本次未抓到任何论文,本节给出基于真实文献的量化趋势,仅基于上述主题定义层面的合理推断(在抓取成功后应被实证数据替换):

# 观察 与 CrowdRoom 的关联
T1 神经场(3DGS / NeRF)路线正逐步从"研究 demo"走向"产品可用",但可编辑性仍是显著缺口 决定 Web 端是否升级到 3DGS 渲染
T2 生成式 3Dtext-to-3D / image-to-3D)在家具类目上的"可用门槛"正快速降低,但与 PBR / 物理尺度的对齐仍未完全解决 决定 Remix 资产入库是否引入生成式入口
T3 室内扫描的"消费级"端(RoomPlan / 手机 LiDAR)与"专业级"端(Matterport / 激光扫描)之间,存在精度差距 vs 易用性的稳定权衡 决定 CrowdRoom 在"易用性优先"路线上的定位
T4 众包 3D 数据集的质量控制与隐私治理仍缺乏成熟方法学,研究空白显著 直接关系 plans/CrowdRoom/09_privacy.mdplans/CrowdRoom/10_governance.md
T5 USD/OpenUSD 的开放化让"Apple 生态 → 通用 Web 3D"的链路在标准层趋于稳定 支撑 USDZ → glTF 转码路线的长期可持续性

以上 5 条观察仅为待证伪假设(hypothesis),需在抓取成功后用真实文献交叉验证。


5. 研究空白与 CrowdRoom 的未来方向

基于 §3 的 RQ 与 §4 的趋势观察,结合 plans/CrowdRoom/00_overview.md §6 与 §7,本综述识别出以下潜在研究空白(同样为待证伪命题):

  1. 可编辑、可分层的神经场表达3DGS / NeRF 是否能原生支持"墙 / 地板 / 家具 / 材质"四层切换?这是 CrowdRoom 走 3DGS 路线的硬性前提。
  2. 手机端扫描的朝向稳定化:仅靠 RoomPlan 输出(无重新训练)的朝向后处理方法,是 MVP 内最可能产生工程贡献的方向。
  3. 众包 3D 内容的轻量级隐私脱敏:端侧人脸 / 身份证 / logo 模糊,与镜面区域 / 反射场景的边界处理,是研究与产品共同的真实空白。
  4. 生成式资产与扫描资产的尺度 / 材质一致性Remix 替换家具时的"无缝感"由此决定。
  5. 消费级数字孪生的中间表达:介于"专业 BIM"与"消费级 glTF"之间,是否存在一种轻量结构化表达,恰好满足"分层 + Remix"

这 5 条空白构成抓取成功后综述应重点检索的关键词组合(如 "editable 3DGS"、"object orientation refinement RoomPlan"、"privacy preserving mesh"、"text-to-3D physical scale"、"lightweight scene graph")。


6. 局限与下一步

6.1 本综述的明确局限

  • 0 篇真实论文:本综述未引用任何具体论文,所有判断为基于领域常识与项目文档的占位结论;
  • 无量化对比:所有比较表均为"待填充",未给出 PSNR / 训练时间 / 模型体积等具体数值;
  • 无引用编号:参考文献章节为空(§7),文中未使用 [N] 形式的编号引用。

6.2 下一步行动建议

  1. 等待 ≥ 2 小时后,按 research/crowdroom_papers_raw.jsonmeta.recommended_retry 在北京时间 04:0009:00 重跑 research/fetch_crowdroom_papers.py
  2. 若 arXiv 持续受限,降级到 Semantic Scholar / OpenAlex 双源补全;
  3. 抓取成功后,按本骨架的 §3.1–§3.10 顺序,将每个主题下"应覆盖的方法学家族"表格中"待填充"替换为真实代表性论文(含 [编号]),并补全 §7 参考文献;
  4. 用真实数据替换 §4 的待证伪假设与 §5 的研究空白判断。

7. 参考文献

本次纳入论文总数:0 篇

由于 arXiv API 在 2026-05-20 全面返回 HTTP 429 速率限制,research/crowdroom_papers_raw.jsonunique_papers 为空数组。按任务规则"不要在综述中加入未在 JSON 中出现的论文",本章节当前不列出任何条目。

预留编号区间:抓取成功后,预计 10 个主题各 5–15 篇,共约 60–120 篇,按主题分组并在文中以 [编号] 形式引用。条目格式预定为:

[N] 标题. 作者 1, 作者 2, ...(年份). 期刊/会议. 链接.

文档时间戳(结尾)

  • ISO 8601 (UTC): 2026-05-20T09:06:58Z
  • Asia/Shanghai (UTC+8): 2026-05-20 17:06:58
  • 实时时间获取建议:date -u +"%Y-%m-%dT%H:%M:%SZ"
  • 生成模式:抓取失败状态报告 + 综述骨架(0 篇真实论文)
  • 数据源快照:research/crowdroom_papers_raw.json fetch_status = FAILED_RATE_LIMIT