Add multiple research papers in PDF format to the repository, including recent works on AI and physics, with file sizes ranging from 1.7 MB to 32.3 MB.
Sync to site1 / sync (push) Has been cancelled

This commit is contained in:
gaojie
2026-06-02 04:12:38 +08:00
parent 36fe037bc1
commit c55f47b287
57 changed files with 278820 additions and 3 deletions
@@ -0,0 +1,542 @@
# 多感官物体感知与触觉:方向综述
> 子方向:Multisensory Object Perception & Tactile Sensing
> 锚点论文:**ObjectFolder 系列**CoRL 2021 / CVPR 2022 / CVPR 2023)与 **VTV-LLM**NeurIPS 2025
> 定位:本综述以 MultiPLY 为出发点,系统梳理"让机器同时用视觉、听觉、触觉(乃至温度)感知物体"这一方向的传感器、仿真、数据集、表示学习、与大模型结合、以及机器人操作应用,面向研究者。
> 配套阅读:同目录《MultiPLY技术讲解.md》
---
## 1. 这个方向是什么,为什么重要
人类认识一个物体,从来不是只靠"看"。判断牛油果熟没熟要捏一捏(触觉硬度),判断杯子是空是满可以敲一敲(撞击声),判断锅烫不烫要靠温度。这些**只有交互才能获得**的物理属性,正是纯视觉模型的盲区——视觉能告诉你"这是个杯子",但说不准它的材质、软硬、温度、是否中空。
"多感官物体感知与触觉"这个方向,研究的就是如何让机器获得、表示并推理这些**视觉之外的物体物理属性**,核心模态是:
- **触觉(tactile)**:接触面的微观几何、纹理、软硬、滑动/形变——最难也最关键的一环;
- **听觉(audio / impact sound**:敲击声携带材质、结构(实心/中空)、尺寸信息;
- **温度(thermal)**:材质导热性的代理信号;
- 它们与**视觉、语言**的对齐与融合。
这与 MultiPLY 的关系非常直接:**MultiPLY 是"具身体 + 多感官 + LLM"的集成系统,而本方向提供它赖以成立的全部底层积木**——MultiPLY 的撞击声与材质来自 **ObjectFolder**,触觉来自 **DiffTactile**,而把触觉/多感官接进语言模型的范式(Octopi、TVL、VTV-LLM)则是它的同代与后继。
---
## 2. 方向地图(Taxonomy
可以从五个正交维度理解这个方向的所有工作:
1. **模态组合**:触觉单模态 / 视-触 / 视-触-语 / 视-听-触 / 视-听-触-温。
2. **数据来源**:仿真(ObjectFolder、TACTO、Taxim、DiffTactilevs 真实采集(Touch and Go、SSVTP、ObjectFolder Real)。
3. **表示与监督**:自监督跨模态对比(SSVTP、Touch and Go/ 绑定到视觉锚点(UniTouchImageBind 式)/ 三模态成对对比(TVL/ 隐式神经场(ObjectFolder)。
4. **与语言/LLM 的结合度**:无语言(纯表示)→ 触觉-语言对齐(Touch100k、TLV)→ 触觉接入 LLM 做推理(Octopi、VTV-LLM)→ 接入动作(Tactile-VLA、MultiPLY)。
5. **下游任务**:材质/属性识别、跨模态检索、接触定位、抓取稳定性预测、形状重建、物理推理问答、操作控制。
下面先深入两条锚点线,再横向铺开传感器、仿真、数据集、表示学习、LLM 结合与机器人操作。
---
## 3. 锚点一:ObjectFolder 系列——多感官物体的"隐式神经数据库"
ObjectFolder 由斯坦福 / CMURuohan Gao、Jiajun Wu、Li Fei-Fei、Wenzhen Yuan 等)推动,三代演进,是整个方向最具影响力的数据基座。
### 3.1 核心思想:Object File 与隐式神经表示
它借用认知科学的 **"Object File"** 概念(Kahneman)——一个物体在某位置上被接收到的全部感官信息。ObjectFolder 把每个物体建模成一个**紧凑的隐式神经网络**,内含三个子网络:
- **VisionNet**:给定相机视角/光照,渲染外观;
- **AudioNet**:给定敲击位置/力度,给出撞击声;
- **TouchNet**:给定接触位置/凝胶形变,给出触觉读数(按 DIGIT 传感器建模)。
关键设计是 **"intrinsic(物体内禀)/ extrinsic(查询参数)分离"**:物体的内禀属性固化在网络权重里,用外参(视角、敲击点、接触点)去"查询"就能得到对应模态的感官信号。这让数据集既紧凑又灵活——存的是网络,不是海量渲染结果。
### 3.2 三代演进
| 代次 | 会议 | 物体数 | 关键进展 |
|------|------|--------|----------|
| **ObjectFolder 1.0** | CoRL 2021 | 100(虚拟) | 首次把视/听/触统一进隐式神经表示;4 个基准任务:实例识别、跨模态检索、3D 重建、机器人抓取 |
| **ObjectFolder 2.0** | CVPR 2022 | 1000(虚拟) | 规模 ×10、渲染快几个数量级、质量大幅提升;**首次实现 sim2real**(尺度估计、接触定位、形状重建三任务从虚拟物体迁移到真实物体) |
| **ObjectFolder Benchmark + ObjectFolder Real** | CVPR 2023 | +100(真实) | 10 个标准化任务(围绕识别、重建、操作);用 Franka 机械臂 + GelSight 采集 100 个真实家用物体的网格、视频、撞击声、触觉,建立 neural↔real 对照基准 |
### 3.3 它为什么对 MultiPLY 至关重要
MultiPLY 的数据流水线里,**ObjectFolder 提供了 1k 物体网格 + 以隐式神经场存储的撞击声 + 材质标注**——智能体"敲击"`<hit>`)一个物体时听到的声音,正是查询 AudioNet 得到的。可以说没有 ObjectFolder 这类"可查询的多感官物体库"MultiPLY 的"主动交互取声"就无从谈起。
---
## 4. 锚点二:VTV-LLM——把触觉"视频"接进大语言模型
**VTV-LLM: Universal Visuo-Tactile Video Understanding for Embodied Interaction**NeurIPS 2025Yifan Xie 等)是首个面向**通用视触觉视频(Visuo-Tactile Video)理解**的多模态大语言模型,把触觉感知正式当作"跨模态推理"问题——让触觉视频与语言描述对齐,从而对物理属性做复杂推理。
### 4.1 为什么是"视频"而非"图像"
视触觉传感器(GelSight/DIGIT 等)本质是相机,但它的输出与自然图像差异巨大,且**触觉本身是时序过程**:按压、滑动、形变都在时间维度展开,存在帧间相关与时间冗余。所以 VTV-LLM 强调对触觉**视频**做鲁棒的时序表示,而非把它当静态图。
### 4.2 VTV150K 数据集
- **规模**150,000 视频帧,来自 **100 个物体**
- **跨传感器**:横跨 **GelSight Mini、DIGIT、Tac3D** 三种传感器(这点很重要——跨传感器泛化是触觉领域的老大难);
- **属性标注**:四个基础触觉属性——**硬度(hardness)、凸起(protrusion)、弹性(elasticity)、摩擦(friction**
- **问答构造**:用结构化模板 + 比较算子(more/less/most/least+ 属性选择器,生成约 **10,000 条 QA 对**,支持比较分析、场景决策等。
### 4.3 三阶段训练范式
1. **VTV enhancement**:学习鲁棒的视触觉表示(针对触觉视频的特性做专门微调);
2. **VTV-text alignment**:建立视触觉与语言的跨模态对应;
3. **text prompt finetuning**:让模型用自然语言生成回答。
最终能做触觉特征评估、表面特征区分、触觉场景分析等具身交互任务。
### 4.4 它在谱系中的位置
VTV-LLM 与 MultiPLY 是互补的:MultiPLY 把触觉作为"多感官之一"塞进具身 LLM、强调主动交互闭环;VTV-LLM 则**专攻触觉这一条模态的深度理解**(时序、跨传感器、细粒度属性、可比较推理)。两者合起来勾勒了"触觉 + 语言"的两种走法:广度集成 vs 深度专精。
---
## 5. 传感器基础:触觉与听觉怎么"采"
### 5.1 视触觉(vision-based tactile)传感器
这是当前触觉学习的主流硬件,原理是用一块**可形变弹性体(凝胶)**做接触介质,背后一个**微型相机**拍下凝胶被压出的形变,从而把"触觉"转化为"图像"——于是所有计算机视觉/深度学习算法都能直接用。
- **GelSight**(MIT 起源):高分辨率,能估计接触几何与受力;很多变体(GelSlim 等)。
- **DIGIT**Meta AI × GelSight2020/2021):小型化、低成本、可装在多指手上,是机器学习社区用得最多的型号;2024 年推出 **Digit 360**>18 种感知特征)。
- **Tac3D** 等:提供三维形变/力场估计。
视触觉传感器的优点是"信息密度高、可直接复用视觉模型",缺点是**各家输出不标准化**——这正是 UniTouch、TLV-CoRe 等要解决的"跨传感器泛化"问题。
### 5.2 听觉:接触式麦克风与撞击声
撞击声携带材质、结构、尺寸信息,且**极具判别性**且能捕捉"视觉看不到的瞬时事件"。采集上常用**接触式麦克风(contact microphone**(如 See Hear Feel),物理上则可由声学仿真(如 ObjectFolder 的 AudioNet、SoundSpaces 的房间脉冲响应)合成。
---
## 6. 仿真与数据生成:触觉/声音"造数据"
真实触觉数据采集昂贵(要机械臂逐点接触),所以仿真是这个方向的命脉。视触觉仿真有一条清晰的演进线:
| 仿真器 | 年份/会议 | 类型 | 关键特点 |
|--------|-----------|------|----------|
| **TACTO** | 2020RAL/IROS | 渲染式 | 高速渲染 DIGIT/OmniTact 触觉图像(数百 FPS),接触动力学交给 PyBullet 等外部物理引擎 |
| **Taxim** | 2021RAL 2022 | 示例式/数据驱动 | 用多项式查找表建模光学响应 + 弹性叠加原理建模 marker 运动;**<100 个真实标定点**即可,CPU 可跑 |
| **DiffTactile** | ICLR 2024 | 物理式**可微** | FEM 软体模型 + 多材质仿真(刚/弹/弹塑性);可微性支持梯度优化做 sim2real 标定与技能学习 |
值得注意的是 **DiffTactile 正是 MultiPLY 触觉信号的来源**,且其作者(Zilin Si)也是 Taxim 的主导者,呈现清晰的研究传承;DiffTactile 隶属 Genesis-Embodied-AI 生态。更新的 **DOT-Sim** 进一步用 MPM(物质点法)建模软体传感器,提升物理精度。
声学方面,撞击声可由 ObjectFolder 的隐式声场查询得到,环境/空间化音频则可用 SoundSpaces 式的**房间脉冲响应(RIR)卷积**生成(MultiPLY 仿真器即如此)。
---
## 7. 数据集谱系(一张表看懂)
| 数据集 | 年份/会议 | 模态 | 规模 | 传感器/来源 | 特点 |
|--------|-----------|------|------|-------------|------|
| **ObjectFolder 1.0** | CoRL 2021 | 视/听/触 | 100 虚拟物体 | DIGIT(触觉) | 隐式神经 Object File |
| **ObjectFolder 2.0** | CVPR 2022 | 视/听/触 | 1000 虚拟物体 | 仿真 | 实时渲染、sim2real |
| **ObjectFolder Real** | CVPR 2023 | 视/听/触 | 100 真实物体 | Franka + GelSight | 真实多感官测量、10 任务基准 |
| **SSVTP** | RSS 2023 | 视-触 | ~4.5k 对齐对 | UR5 + DIGIT | 机器人自采、空间对齐 |
| **Touch and Go (TAG)** | NeurIPS 2022 | 视-触 | in-the-wild | 人采 + GelSight | 自然场景、真实物体 |
| **VisGel** | (早期) | 视-触 | ~大规模 | GelSight | 后续多个语言数据集的视触来源 |
| **PhysiCLeAR**Octopi | RSS 2024 | 触-语 | 408 视频/74 物体 | GelSight | 硬度/粗糙/凹凸属性标注 |
| **TVL** | ICML 2024 | 触-视-语 | 44K 对 | SSVTP+HCTGPT-4V 伪标注 | 三模态对齐 |
| **TLV** | 2024 | 触-语-视 | ~19.8k 条 | VisGel + 人机协作标注 | 句级描述 |
| **Touch100k** | 2024Inf. Fusion | 触-语-视 | ~100k 条 | TAG+VisGelGPT-4V | 多粒度触觉描述 |
| **VTV150K**VTV-LLM | NeurIPS 2025 | 视-触(视频)-语 | 150k 帧/100 物体 | GelSight Mini/DIGIT/Tac3D | 跨传感器、4 属性、QA |
一个清晰的趋势:**从"视-触成对"→"加上语言"→"视频化、跨传感器、问答化"**,数据正在朝"能直接训练触觉大模型"的方向演进。
---
## 8. 表示学习:把触觉对齐到视觉与语言
核心问题:触觉信号怎么学到一个**能和视觉、语言互通**的表示?四种代表性思路:
- **自监督跨模态对比(机器人自采)——SSVTP**(RSS 2023):让机器人自动采集**空间对齐**的视-触图像对,用跨模态对比损失学共享隐空间,免人工标注;下游 5 个定位/跟随任务取得 73–100% 成功率。
- **自然场景视-触学习——Touch and Go**NeurIPS 2022):人手持 GelSight 在真实世界探物 + 录第一视角视频,做自监督视触特征、触觉驱动图像风格化、触觉未来帧预测。
- **绑定到视觉锚点——UniTouch**CVPR 2024"Binding Touch to Everything"):把触觉 embedding 对齐到**已与多模态关联的预训练图像 embedding**ImageBind 式),并用**可学习的"传感器特定 token"**同时吃多种异构传感器;从而零样本做材质识别、抓取稳定性预测、触觉图像问答,还能接 diffusion 做触觉→图像生成。
- **三模态成对对比 + 生成——TVL**ICML 2024UC Berkeley/Meta):不把一切绑到视觉,而是在**触/视/语三模态间两两对比**;用 44K 对(10% 人工 + 90% GPT-4V 伪标注)训练触觉编码器,再微调 **LLaMA2-7B** 生成触觉描述;分类 +29%,触视理解超 GPT-4V +12%。
延伸:**Touch100k / TLV-Link** 用课程学习把触-语-视对齐做到 100k 规模;**TLV-CoRe**2026)提出 Sensor-Aware Modulator 统一不同传感器特征,专攻跨传感器鲁棒性。
---
## 9. 触觉/多感官接入语言与 LLM
这是与 MultiPLY 最近的一圈,可按"理解 → 推理 → 动作"排列:
- **触觉物理属性推理——Octopi**RSS 2024):用 GelSight 触觉视频 + VLM,最小语言微调即可预测并推理物体物理属性(硬度/粗糙/凹凸)。经典例子:摸两个牛油果,结合触觉(更软)+ 常识(更软=更熟)选出更熟的那个——展示了"触觉 + 常识推理"的闭环。
- **触觉视频大模型——VTV-LLM**NeurIPS 2025):见第 4 节,跨传感器、时序、可比较推理。
- **触觉生成式语言模型——TVL**:见第 8 节,LLaMA2 生成触觉描述。
- **触觉进入 VLA(动作)——Tactile-VLA / VTLA**:把触觉接入"视觉-语言-动作"模型,用混合位置-力控制器 + 触觉反馈推理,做插入等接触密集型操作。
- **集大成的具身多感官 LLM——MultiPLY**:把视/听/触/温作为状态 token、配动作 token,形成主动交互闭环(详见配套文档)。
**一句话对比**Octopi/VTV-LLM 专注"触觉→语言理解与推理"TVL 专注"触觉表示 + 描述生成"Tactile-VLA 把触觉接到动作;MultiPLY 把它们整合进具身 3D 智能体。
---
## 10. 多感官机器人操作:为什么需要不止一种感官
回到机器人本身——多感官的价值在操作任务上最直观:
- **See, Hear, and Feel**CoRL 2022Hao Li 等):用相机(看)+ 接触式麦克风(听)+ 视触觉传感器(触),自注意力融合三模态。在**密集装填(dense packing**与**倒水(pouring)**两个难任务上验证:视觉给全局但易遮挡,**音频给关键时刻的即时反馈(甚至是看不见的)**,触觉给精确局部几何——三者缺一不可。
- **MidasTouch**CoRL 2022):**纯触觉**全局定位——传感器在物体表面滑动,用粒子滤波 + 触觉码网络估计位姿分布,无需视觉先验;并发布 YCB-Slide 数据集。说明触觉单模态也能解决"我现在摸到的是物体哪个部位"。
- **声音引导探索**:如"Impact Makes a Sound"指出声音高度判别且常被忽视;AuRL 用接触麦克风的声音做自监督学习动态操作。
这些工作共同说明:**遮挡、瞬时事件、精细局部几何**这三类信息分别由视觉、听觉、触觉最擅长覆盖,多感官融合不是锦上添花而是任务刚需。
---
## 11. 开放问题与趋势
- **跨传感器泛化**GelSight / DIGIT / Tac3D 输出不标准,模型换个传感器就掉点。UniTouch 的传感器 token、TLV-CoRe 的 Sensor-Aware Modulator、VTV150K 的跨传感器数据都是尝试,但远未解决。
- **Sim2Real**:触觉/声学仿真与真实的差距仍大;DiffTactile 的可微标定、ObjectFolder 的 neural↔real 基准是方向,但真实触觉的噪声、磨损、标定漂移仍棘手。
- **数据稀缺与标注**:触觉天然缺语言标签,目前大量依赖 GPT-4V 伪标注(TVL、Touch100k),质量与偏置存疑。
- **时序与动态**:多数工作仍偏静态接触;VTV-LLM 强调视频时序是重要一步,但动态滑动/力控的建模仍欠缺。
- **温度等"长尾模态"**:温度、本体感觉等被 MultiPLY 列入但少有专门数据与模型(MultiPLY 代码里温度模态甚至未完整释出)。
- **从理解到动作的闭环**Tactile-VLA、MultiPLY 起步,但"主动决定去摸哪、摸完怎么改计划"的交互式策略仍是前沿。
- **统一的多感官基础模型**:把视/听/触/温 + 语言 + 动作统一在一个模型里(MultiPLY 的愿景),数据、表示、训练范式都还在早期。
---
## 12. 与 MultiPLY 的呼应
把本方向的积木对回 MultiPLY,就能看清它"站在巨人肩上"的具体位置:
- **数据底座** ← ObjectFolder(撞击声 + 材质 + 物体库);
- **触觉信号** ← DiffTactile(可微触觉仿真);
- **声学空间化** ← SoundSpaces 式 RIR 卷积;
- **触觉/多感官 + 语言范式** ← Octopi / TVL / VTV-LLM 的同代探索;
- **多感官操作动机** ← See Hear Feel 证明的"三感官互补";
- **MultiPLY 的增量** = 把这些整合进**具身 3D 智能体 + 主动交互闭环(动作 token / 状态 token+ LLM**。
换句话说,本方向回答的是"**每一种感官怎么采、怎么表示、怎么对齐语言**",而 MultiPLY 回答的是"**如何让一个 LLM 智能体主动调度这些感官去完成任务**"。
---
## 13. 论文与资源清单
### 锚点
- ObjectFolder 1.0CoRL 2021<https://arxiv.org/abs/2109.07991>
- ObjectFolder 2.0CVPR 2022<https://arxiv.org/abs/2204.02389>
- ObjectFolder Benchmark / RealCVPR 2023<https://arxiv.org/abs/2306.00956>
- VTV-LLMNeurIPS 2025<https://arxiv.org/abs/2505.22566>
### 触觉/多感官 + 语言与 LLM
- OctopiRSS 2024<https://arxiv.org/abs/2405.02794>
- TVL: Touch-Vision-Language DatasetICML 2024<https://arxiv.org/abs/2402.13232>
- UniTouch: Binding Touch to EverythingCVPR 2024<https://arxiv.org/abs/2401.18084>
- TLV: Touch-Language-Vision Dataset2024<https://arxiv.org/abs/2403.09813>
- Touch100k2024<https://arxiv.org/abs/2406.03813>
- TLV-CoRe2026<https://arxiv.org/abs/2511.11512>
- Tactile-VLA2025<https://arxiv.org/abs/2507.09160>
### 视触觉表示学习与数据集
- SSVTPRSS 2023<https://arxiv.org/abs/2209.13042>
- Touch and GoNeurIPS 2022<https://arxiv.org/abs/2211.12498>
### 传感器与仿真
- TACTO 仿真器<https://arxiv.org/abs/2012.08456>
- Taxim 仿真器(GelSight<https://arxiv.org/abs/2109.04027>
- DiffTactileICLR 2024MultiPLY 触觉来源)<https://arxiv.org/abs/2403.08716>
### 多感官机器人操作
- See, Hear, and FeelCoRL 2022<https://arxiv.org/abs/2212.03858>
- MidasTouchCoRL 2022<https://arxiv.org/abs/2210.14210>
- Impact Makes a Sound2022<https://arxiv.org/abs/2208.02680>
---
## 14. 硬件方案:多感官数据采集设备选型(国际主流 vs 中国平替)
> 目标场景:搭建一套能采集**视觉 / 深度 / 触觉 / 撞击声 / 温度**的物体级多感官数据采集装置(对标 ObjectFolder Real、TVL、VTV150K 的数据规格)。
> 选型基调:**性能 / 生态优先**——主推社区成熟、论文复现友好的国际主流器件,同时为每一类给出**中国平替**,便于成本敏感时替换。
> 价格为公开渠道的大致参考,会随时间与汇率波动,仅供量级判断。
### 14.0 一套采集装置需要哪些"感官硬件"
把多感官数据采集拆成"感官通道 + 交互执行 + 同步"三部分:
- **感官通道**:① 视触觉/触觉传感器(触)② RGB-D 相机(视 + 点云)③ 接触式麦克风 + 麦克风(听,尤其撞击声)④ 热成像/温度(温)。
- **交互执行**("主动采集"的关键,对标 ObjectFolder Real 用 Franka + GelSight 逐点接触):⑤ 机械臂 ⑥ 夹爪/灵巧手 ⑦ 六维力/力矩传感器(控制接触力、保护传感器)。
- **同步与底座**:转台、标定板、统一时间戳采集(硬件触发或 ROS 时间同步)。
下面逐类给出选型。
### 14.1 视触觉(光学)触觉传感器——"触觉相机"
把凝胶形变拍成图像,可直接复用视觉模型,是当前触觉学习数据采集的首选。**强烈建议数据采集主力选 GelSight Mini 或 DIGIT**——因为 ObjectFolder、Touch and Go、TVL、PhysiCLeAR、VTV150K 等数据集大多基于它们,复现/迁移最顺。
| 型号 | 厂商/产地 | 关键规格 | 参考价 | 备注 |
|------|-----------|----------|--------|------|
| **GelSight Mini** | GelSight(美) | 超人类分辨率 2D/3D,浏览器即插即用,提供 ROS/Python | ~$499 | 生态最成熟、采集首选 |
| **DIGIT** | Meta×GelSight(美) | 小型化、USB-3、可装多指手,开源(digit.ml) | 低成本/开源 | 论文用得最多、适合上手 |
| **Digit 360** | Meta×GelSight(美) | 指尖形、~830 万 taxel、可测 1mN、含振动/热/气味 | 科研早期申请 | 最前沿、面向多模态触觉研究 |
| **DM-Tac W / F** | 戴盟 Daimon(深圳) | 多维高分辨率视触觉、CE/FCC、>500 万次按压寿命 | 询价 | 中国平替,主打高频高分辨率 |
| **GF225** | 纬钛 WTac(中国) | 10µm 级分辨率、可同测法向/切向力 | 询价 | 中国平替,分辨率高 |
### 14.2 多维力阵列 / 电子皮肤 / 仿生触觉
当需要**法向+切向力、温度、振动**等更"物理量化"的触觉(而非纯图像),用阵列式/仿生传感器。这一类**中国厂商已相当强**(人形机器人热潮推动),可大胆用国产。
| 型号 | 厂商/产地 | 原理 | 关键规格 | 备注 |
|------|-----------|------|----------|------|
| **BioTac** | SynTouch(美) | 液阻 + 热敏 + 水听器 | 测法向/切向力、振动、温度梯度,仿人指尖 | 经典仿生、多模态 |
| **uSkin** | XELA Robotics(日) | 霍尔阵列 + 磁体 | 3 轴力分布阵列,可贴/拧到手指手掌 | 分布式多点 |
| **ReSkin** | Meta/学术(美) | 磁性软皮肤 | <$30、23mm 薄、400Hz、1mm 空间分辨、可更换 | 极低成本、自采友好 |
| **PX 多维触觉 / DexH** | 帕西尼 PaXini(深圳) | 6D 霍尔阵列 | 第三代 15 维感知,单价降至数千元;曾用于英伟达 CES 展示机器人 | 中国平替,多维+灵巧手生态 |
| **TS 指尖触觉** | 他山 TASHAN(中国) | 电容 + 触觉 AI 芯片 | 0.01N 力分辨,含接近觉/三维力/纹理;自研类脑触觉芯片 | 中国平替,边缘智能 |
| **柔性触觉芯片** | 钛深 TacSense(深圳) | 柔性离电子(Iontronic) | 薄膜分布式压力、高灵敏;与优必选/大疆合作 | 中国平替,柔性大面积 |
### 14.3 RGB-D / 深度相机——视觉与点云
提供外观图像 + 深度点云(对标 ObjectFolder 的 VisionNet、3D 重建)。**注意:Intel 已停止 RealSense 新品研发**,长周期项目建议把 Orbbec(奥比中光)作为"未来可持续"的首选之一——它自研深度芯片、生态接近、价格更低。
| 型号 | 厂商/产地 | 原理 | 关键规格 | 参考价 |
|------|-----------|------|----------|--------|
| **RealSense D405 / D435i / D455** | Intel(美) | 主动红外双目 | D405 近距操作首选;D455 FOV 90×65、0.66m;板载算深度 | ~$250–400(已停研,渠道库存) |
| **Azure Kinect DK** | Microsoft(美) | ToF | 大 FOV、高彩色分辨、30fps、3m 内骨架追踪佳 | ~$400 |
| **ZED 2 / ZED X** | Stereolabs(美) | 被动双目 + GPU 神经深度 | 户外可用、最远 ~20m,需 CUDA GPU | ~$450+ |
| **Gemini 335 / Femto Bolt** | Orbbec 奥比中光(深圳) | 主动双目 / ToF | Gemini 335 户外/复杂场景优于 D435iFOV 更大;Femto Bolt 兼容 Azure Kinect SDK | ~¥1950 / ~$250 |
| **Percipio 系列** | 图漾 PercipioXYZ(上海) | 主动双目 + 结构光辅助 | 工业级、环境适应性强 | 询价 |
### 14.4 热成像 / 温度——第四感官
温度是材质导热性的代理信号(MultiPLY 列为第四模态)。FLIR 的 Lepton/Boson 是集成生态标杆;但**中国厂商在出货量上已全球领先**,性价比高,平替力度可大。
| 型号 | 厂商/产地 | 关键规格 | 备注 |
|------|-----------|----------|------|
| **FLIR Lepton** | Teledyne FLIR(美) | 微型 LWIR 模组,160×120 / 80×60,可辐射测温 | 集成生态最佳(多平台 SDK) |
| **FLIR Boson** | Teledyne FLIR(美) | 12µm 非制冷、640 分辨率,性能参考级 | 高端核心 |
| **艾睿 / Micro III 等模组** | 睿创微纳 InfiRay/Raytron(烟台) | 模组/机芯齐全,独立测评对比 FLIR 表现接近 | 中国平替,出货量大 |
| **HIKMICRO 模组** | 海康微影(杭州) | MEMS 自研,探测器/机芯/模组全栈 | 中国平替,供应链完整 |
| **Guide 高德** | 高德红外/高德智感(武汉) | 中国最大、全球第二大红外探测器企业 | 中国平替,自研探测器 |
> 提示:高端探测器精度上国产仍略逊 FLIR,但对"物体相对温度/材质区分"这类数据采集足够。
### 14.5 音频——撞击声与环境声
对标 ObjectFolder 的 AudioNet(撞击声)。两类麦克风互补:**接触式麦克风(压电 piezo)采"敲击/接触的结构声"**,**麦克风阵列采"空间环境声 + 声源定位"**。
- **接触式麦克风(撞击声主力)**:压电片把表面振动转成电信号,能隔离空气噪声、专捕接触/撞击声。注意 piezo 频响非线性、有谐振着色,采集时需做阻抗匹配/滤波。国际可选 DPA、Shure 等专业贴片式;低成本可用通用压电片 + 前置放大。
- **麦克风阵列(环境声/定位)**:如 8 麦阵列可做声源到达方向估计(DoA)。开源生态常用 **ReSpeaker** 系列阵列(带 ROS 接口)。采集时遵循"stop-perceive-act"(采集瞬间停住)以减少自运动噪声。
### 14.6 机械臂——"主动接触"的执行主体
ObjectFolder Real 用 **Franka + GelSight 逐点接触**采集真实触觉。研究级采集强烈建议选**带关节力矩、1kHz 低层控制、ROS2 生态好**的臂——这对"力控接触不压坏触觉传感器"至关重要。
| 型号 | 厂商/产地 | 关键规格 | 参考价 | 备注 |
|------|-----------|----------|--------|------|
| **Franka Research 3** | Franka(德) | 7-DOF、每关节力矩、1kHz、低层接口 | ~$25–30K | 学术操作研究事实标准 |
| **Kinova Gen3** | Kinova(加) | 7-DOF、每关节力矩、ROS2、30 分钟上手 | ~$28K | 研究级、轻量便携 |
| **UR5e** | Universal Robots(丹麦) | 5kg/850mm、工业可靠性标杆 | ~$35K | 标配无关节力矩 |
| **RealMan RM65-B** | 睿尔曼(北京) | 6-DOF、整臂 7.2kg、负载 5kg(峰值 9kg)、610mm、ROS | 显著更低 | 中国平替,国内具身/模仿学习常用 |
| **JAKA / AUBO / Dobot** | 节卡/遨博/越疆(中国) | 协作臂,±0.02–0.1mm,负载/易用性强 | 较低 | 中国平替,工业生态成熟 |
> 取舍:Franka/Kinova 强在**低层力矩控制 + 开放研究接口**;多数国产协作臂历史上偏工业易用/负载/价格,研究级力控 API 稍弱,但 RealMan 等已专攻具身研究位。
### 14.7 末端执行器——夹爪与灵巧手
采集时用来"持握触觉传感器去接触物体"或"做抓取交互"。若只为给传感器做接触,二指夹爪足矣;若要采集灵巧操作数据,再上灵巧手。
| 型号 | 厂商/产地 | 关键规格 | 参考价 | 备注 |
|------|-----------|----------|--------|------|
| **Robotiq 2F-85** | Robotiq(加) | 二指自适应、行程 85mm、握力 30–100N、负载 5kg、即插即用 | 中端 | 接触采集够用、最省心 |
| **Allegro Hand** | Wonik(韩) | 直驱四指研究标准、原生兼容 DIGIT | ~$16K | 研究常用,连续负载易过热 |
| **Shadow Hand** | Shadow Robot(英) | 24-DOF、>100 传感器、1kHz,最仿人 | >$100K | 最高保真,贵且维护重 |
| **因时 Inspire RH56** | 因时机器人(北京) | 6-DOF/12 关节、内置 6 路力传感、力位混合控制 | 较低 | 中国平替,已规模出货 |
| **LinkerHand L20/L30** | 灵心巧手 Linkerbot(北京) | 21/22-DOF(研究版至 42-DOF),多传动 | ~¥5–10 万 | 中国平替,高自由度领先 |
| **BrainCo Revo 2** | 强脑(杭州) | 11-DOF、383g、握力 50N、含 3D 触觉 | 较低 | 中国平替,超轻+触觉 |
### 14.8 六维力/力矩传感器——接触力闭环
装在臂腕与末端之间,用于**控制接触力、保护脆弱的触觉凝胶、并把力觉作为一路数据**。这一类**国产成熟度高、性价比突出**,坤维已可对标 ATI。
| 型号 | 厂商/产地 | 关键规格 | 参考价 | 备注 |
|------|-----------|----------|--------|------|
| **ATI Nano 系列** | ATI(美) | 0.5% 精度、硅应变片,计量级 | 可达 ~¥10 万/个 | 行业龙头、最高精度 |
| **Robotiq FT 300** | Robotiq(加) | 电容式、±300N/±30N·m、全数字 | 中端 | 高重复性而非高精度,UR 即插即用 |
| **坤维 Kunwei** | 坤维科技(中国) | 0.5% 精度对标 ATI,协作机器人市占率 >80% | ~¥2 万+ | 中国平替首选 |
| **宇立 SRI** | 宇立仪器(中国) | 9mm 全球最薄、汽车碰撞测试级 | 询价 | 中国平替,超薄/磨抛 |
| **鑫精诚 Forsentek/XJC** | 鑫精诚(中国) | 结构解耦、3C 起家、高性价比 | 较低 | 中国平替,成本敏感 |
### 14.9 推荐配置(面向多感官数据采集)
**配置 A —— 性能/生态优先(论文复现友好,推荐)**
- 触觉:**GelSight Mini ×12**(主力)+ 选配 **DIGIT** 装夹爪指尖
- 视觉/点云:**Intel RealSense D435i/D405**(近距)或 **ZED 2**(大场景)
- 温度:**FLIR Lepton/Boson** 模组
- 音频:专业**接触式麦克风**(撞击声)+ **ReSpeaker 麦阵**(环境声)
- 机械臂:**Franka Research 3**(关节力矩 + 1kHz 力控)
- 末端:**Robotiq 2F-85**(接触采集)或 **Allegro Hand**(灵巧采集)
- 力觉:**ATI Nano** 或 **坤维**(力控闭环保护触觉传感器)
- 同步:转台 + 标定板 + ROS2 时间同步/硬件触发
**配置 B —— 中国平替优先(成本可控,国产生态)**
- 触觉:**戴盟 DM-Tac / 纬钛 GF225**(视触觉)+ **帕西尼 / 他山**(多维力阵列)
- 视觉/点云:**Orbbec Gemini 335 / Femto Bolt**
- 温度:**艾睿 InfiRay / 海康微影 / 高德** 模组
- 音频:通用压电接触片 + 前置放大 + 国产麦阵
- 机械臂:**睿尔曼 RM65-B** 或 **JAKA/遨博**
- 末端:**因时 RH56 / LinkerHand / BrainCo Revo 2**
- 力觉:**坤维 / 宇立 / 鑫精诚**
### 14.10 采集与工程注意事项
- **力控保护**:视触觉凝胶易磨损(DM-Tac 标称 >500 万次按压),务必用力矩臂或六维力传感器限制接触力。
- **跨传感器一致性**:不同触觉传感器输出不可直接混用(VTV150K 跨 GelSight Mini/DIGIT/Tac3D 正是为此);若混采,需记录传感器型号并考虑 UniTouch/TLV-CoRe 式的跨传感器对齐。
- **多模态时间同步**:撞击声是**瞬时事件**,必须与触觉/视觉精确对齐(硬件触发优于软件时间戳)。
- **标定**:RGB-D 内外参、热像与可见光配准(MSX 式)、力传感器零偏,采集前都要标定。
- **数据规格对标**:想直接对接现有工作,可参考 ObjectFolder Real(网格+视频+撞击声+触觉)、TVL(视-触成对 + 语言标注)、VTV150K(视触觉视频 + 4 属性 + QA)的字段组织。
---
## 15. 超声感知:测距与材质/厚度检测
> 本章把**超声(ultrasound)**作为一种独立的物体感知模态纳入综述。它的独特定位是:**主动发射声波、非接触、且能"穿透"到次表面**——正好补上视觉(怕遮挡/透明/暗光)与触觉(必须接触)的盲区,介于"被动听撞击声"和"主动接触"之间。
> 两个核心能力:① **测距(ranging)**——隔空测物体距离/轮廓;② **测厚与材质识别**——靠声速、声阻抗、回波结构反推材料厚度与种类。
### 15.0 为什么超声值得纳入多感官物体感知
- **非接触 + 不怕光**:超声靠声波而非光,全黑、强光、烟尘下都能工作,且**不受物体颜色/透明度影响**(玻璃、透明塑料这些视觉/红外的"硬骨头",超声照测不误)。
- **可探次表面**:声波能进入材料内部,从回波里读出**厚度、分层、内部缺陷**——这是纯表面模态(视觉、视触觉)做不到的。
- **材质判别的物理基础**:不同材质的**声速**和**声阻抗 Z=ρc**(密度×声速)不同,回波的到达时间与幅度因此携带材质信息。
- 与本综述其他模态互补:视觉给外观、触觉给接触面微观几何、撞击声给"敲击后"的材质线索,而**超声能在"接触之前"就隔空给出距离 + 材质预判**。
### 15.1 测距:脉冲回波 / 飞行时间(ToF)
原理极简:发射一个超声脉冲,测它碰到目标反射回来的**飞行时间(Time-of-Flight, ToF**,距离 = 声速 × ToF ÷ 2。工程上常用**互相关(cross-correlation**而非简单阈值来精确估计 ToF。
**传感器从"大块头"走向 MEMS 化**。传统压电换能器体积大、与空气声阻抗不匹配(需匹配层)。新一代 **MEMS 微机械超声换能器**有两类:
- **PMUT(压电式)**:低驱动电压、低功耗、与空气声阻抗匹配好、工艺成本低——是**空气中小型测距的主流**;缺点是窄带,空气中高分辨 3D 测距能力有限。
- **CMUT(电容式)**:带宽更好,但需要高 DC 偏压和亚微米间隙,限制了声功率与测距应用。
**商用代表:TDK ChirpPMUT**。把 PMUT + 超低功耗 SoC 封进 3.5×3.5mm 的微型封装:
- **CH101**:量程约 1.2m**CH201**:量程达 5m;新一代 **ICU-10201/20201** 量程 5m、FOV 可配置。
- 亮点:毫米级精度、**不受光照/颜色/透明度影响**、大视场、**功耗约 15µA(比红外 ToF 低约 500 倍)**,片上自主运算可让主控休眠。非常适合**机器人避障、接近觉、液位检测**。
- 局限:PMUT 窄带、空气衰减限制远距离(小型超声一般 ≤5m),多径/连续波在极近距离误差大(可用多频脉冲 MFPW 缓解),盲区需靠宽带设计压缩(已有把盲区降到 ~4.4mm、±0.3mm 误差的研究)。
### 15.2 测厚与材质识别
#### 测厚(thickness gauging
同样是 ToF:脉冲在材料里来回一趟,**厚度 = 声速 × ToF ÷ 2**。探头有三种主流形态:
- **单晶探头 + 延迟线(delay line)**:测**薄/高精度**材料;延迟线拉开发射与回波的时间间隔,避免太薄时回波分不开。
- **双晶探头(dual elementpitch-and-catch**:一发一收成"V"形路径,对**腐蚀、粗糙面**信噪比更好,是腐蚀测厚主力。
- **回波-回波(echo-to-echo/ 穿透涂层(THRU-COAT)**:用两次背壁回波的时间差测厚,从而**忽略涂层只测基材**;多层结构可用**去卷积(deconvolution**分离各层厚度。
**EMAT(电磁声换能器)——免耦合剂的特殊路线**:靠线圈涡流 + 磁场在金属/铁磁体内**直接激发超声**(洛伦兹力或磁致伸缩),天然产生**水平剪切波(SH 波)**。优点是**无需耦合剂、可隔着油漆/氧化层/空气层、耐高温**(锅炉管在 >800°C 氧化层下仍可测),适合粗糙/高温/涂覆表面;缺点是频率低、对极薄/细分层分辨率受限、只能单晶、对点蚀检测弱、仪器更贵。
#### 材质识别(material characterization
物理上:回波幅度由**界面两侧声阻抗失配**决定,声速因材质而异——把回波信号喂给模型即可分类材质。
### 15.3 前沿:超声 + 机器学习
非接触超声 + ML 做材质识别正成为视觉的有力补充(不怕暗光/烟尘):
- **经典 ML**:用经验模态分解(EMD)从回波提 16 维特征,喂 KNN / 决策树 / SVM,并配声学理论模型——显著提升机器人在黑暗/粉尘/危险环境下的材质识别。
- **深度学习**:如 **AE-CS-TCN** 直接从原始回波联合学习空间/时序/多尺度特征(含空间注意力 + 时序卷积 + 跨尺度融合 + 交叉注意力),在机器人平台上做可复现的材质识别。
- **双模态 / 实时**:一种同时测**接近距离 + 材质**的双模态超声系统对 13 种工业材料达 **98% 分类准确率**、测距误差 **<3mm**、毫秒级响应;也有**柔性超声传感阵列**兼顾接近觉与材质识别用于机器人安全控制。
- **多传感器数据集****MatSense2025**(超声 + 毫米波)面向材质分类、无损检测与传感器融合研究。
> 深入阅读:本节有一份独立深度子专题《超声+ML材质识别_深度子专题.md》,详细展开物理可分性、信号特征、模型方法谱系、机器人 pre-touch 应用、数据流水线与核心挑战(距离/角度/温度/跨传感器泛化)。
### 15.4 与多感官框架 / MultiPLY 的关系
把超声放进本综述的模态地图,它是一种**"主动声学探测"模态**
- 与"听"(被动撞击声,ObjectFolder 的 AudioNet)相比,超声是**主动发射 + 接收**,可控、可隔空、可探内部;
- 与"触"相比,超声**无需接触**就能给出距离与材质预判,可作为接触前的"预探测",降低碰坏脆弱触觉凝胶的风险;
- 在 MultiPLY 式的具身 LLM 框架里,超声天然可成为一个新的**动作 token(如 `<probe>` 超声探测)+ 状态 token(回波/距离/材质特征)**,让智能体"先隔空扫一下再决定要不要去摸/敲"。
- 在数据采集装置里(见第 14 章),超声可作为**第五路传感通道**,尤其适合采集"透明/暗色/内部结构"这类视觉与视触觉都吃力的样本。
### 15.5 硬件选型:国际主流 vs 中国平替
超声硬件分两条线:**消费/机器人测距传感器**(避障、接近觉)与**工业测厚/无损检测(NDT)设备**。
**A. 测距 / 接近觉传感器(含 MEMS 超声 ToF)**
| 型号/品牌 | 厂商/产地 | 特点 | 备注 |
|-----------|-----------|------|------|
| **Chirp CH101 / CH201 / ICU 系列** | TDK(美/日) | PMUT MEMS ToF3.5×3.5mm1.25mmm 级,15µA 超低功耗 | 机器人/无人机首选,生态新 |
| **车规/工业超声雷达** | Murata 村田(日) | 车载超声龙头,倒车雷达/避障 | 车规生态成熟 |
| **MB 系列** | MaxBotix(美) | 测距/液位/接近,OEM 友好 | 模块化易集成 |
| **UC/RU 系列** | Pepperl+Fuchs、SICK、Banner(欧美) | 工业级、IO-Link、可调声束 | 工业自动化标杆 |
| **AK2 超声雷达 / 材质识别 / 水下测距传感器** | 奥迪威 Audiowell(广东) | 国产超声传感器龙头,**已量产"材质识别传感器"与"水下测距传感器"**,车载与机器人布局 | 中国平替首选,与本主题高度契合 |
**B. 测厚仪 / 无损检测(NDT)设备与探头**
| 型号/品牌 | 厂商/产地 | 特点 | 备注 |
|-----------|-----------|------|------|
| **38DL PLUS / 39DL PLUS** | Evident(原 Olympus,日/美) | 测厚 0.08635mm,单/双晶、THRU-COAT/回波-回波、高分辨 0.001mm | 行业标杆(39DL 为新款,含 Wi-Fi/蓝牙) |
| **便携测厚仪 / 探伤仪** | Dakota、Elcometer、Baker Hughes(欧美) | 腐蚀测厚、涂层穿透 | 工业常用 |
| **CTS 系列探伤仪 / CTS-409 EMAT 测厚** | 汕头超声 ST-NDT(广东) | "中国超声第一家",相控阵/3D 全聚焦/EMAT,免耦合剂电磁超声测厚 | 中国平替,NDT 全线 |
| **HS 系列探伤 / HS F91 EMAT 测厚 / HS P9s 笔式测厚** | 武汉中科创新(汉威 HS) | 数字探伤、电磁超声测厚、应力检测、自动化检测系统 | 中国平替,产品线全 |
### 15.6 局限与工程注意事项
- **耦合剂**:接触式压电测厚通常需耦合剂(凝胶/水);要免耦合剂选 EMAT(但分辨率、成本有代价)。
- **空气衰减与距离**:空气中高频超声衰减快,小型 MEMS 测距一般 ≤5m;测厚则是贴合/近场。
- **分辨率与盲区**:窄带 PMUT 分辨率有限,近距有盲区,需宽带设计或多频脉冲缓解。
- **难测目标**:强吸声(海绵/泡沫)、镜面斜反射、极薄涂层等会削弱回波。
- **温度影响声速**:声速随温度/介质变化,精密测距/测厚需做温度补偿与零点标定。
- **多径与串扰**:复杂场景多径反射会污染 ToF,阵列/编码波形/互相关可改善。
---
## 来源(Sources
- [ObjectFolder 1.0 (2109.07991)](https://arxiv.org/abs/2109.07991)
- [ObjectFolder 2.0 (2204.02389)](https://arxiv.org/abs/2204.02389)
- [ObjectFolder Benchmark/Real (2306.00956)](https://arxiv.org/abs/2306.00956)
- [VTV-LLM (2505.22566)](https://arxiv.org/abs/2505.22566)
- [Octopi (2405.02794)](https://arxiv.org/abs/2405.02794)
- [TVL (2402.13232)](https://arxiv.org/abs/2402.13232)
- [UniTouch (2401.18084)](https://arxiv.org/abs/2401.18084)
- [TLV (2403.09813)](https://arxiv.org/abs/2403.09813)
- [Touch100k (2406.03813)](https://arxiv.org/abs/2406.03813)
- [TLV-CoRe (2511.11512)](https://arxiv.org/abs/2511.11512)
- [Tactile-VLA (2507.09160)](https://arxiv.org/abs/2507.09160)
- [SSVTP (2209.13042)](https://arxiv.org/abs/2209.13042)
- [Touch and Go (2211.12498)](https://arxiv.org/abs/2211.12498)
- [TACTO (2012.08456)](https://arxiv.org/abs/2012.08456)
- [Taxim (2109.04027)](https://arxiv.org/abs/2109.04027)
- [DiffTactile (2403.08716)](https://arxiv.org/abs/2403.08716)
- [See, Hear, and Feel (2212.03858)](https://arxiv.org/abs/2212.03858)
- [MidasTouch (2210.14210)](https://arxiv.org/abs/2210.14210)
- [Impact Makes a Sound (2208.02680)](https://arxiv.org/abs/2208.02680)
硬件方案(第 14 节)来源:
- [GelSight Mini / DIGIT / Digit 360 官方](https://www.gelsight.com/)
- [Meta DIGIT 开源平台](https://digit.ml/)
- [ReSkin (2111.00071)](https://arxiv.org/abs/2111.00071)
- [XELA Robotics uSkin](https://www.xelarobotics.com/tactile-sensors)
- [帕西尼 PaXini 官网](https://paxini.com/)
- [因时机器人 Inspire-Robots 官网](https://www.inspire-robots.com/)
- [人形机器人触觉传感器国内供应商盘点(艾邦机器人)](https://www.aibangbots.com/a/4289)
- [深度相机选型(RealSense/ZED/Orbbec, SVRC 2026](https://www.roboticscenter.ai/blog/best-depth-cameras-robotics)
- [Teledyne FLIR Lepton OEM 模组](https://oem.flir.com/products/lepton/)
- [InfiRay/FLIR/Seek 热像对比(Yole](https://www.yolegroup.com/press-release/infiray-teledyne-flir-seek-thermal-the-ultimate-thermal-camera-comparison/)
- [Franka Research 3 官网](https://franka.de/franka-research-3)
- [机器人臂价格指南 2026SVRC](https://www.roboticscenter.ai/learn/robot-arm-pricing-2026)
- [Robotiq FT-300 力矩传感器](https://robotiq.com/products/ft-300-force-torque-sensor)
- [六维力传感器国产替代深度报告(东方财富)](https://pdf.dfcfw.com/pdf/H3_AP202404151630231635_1.pdf)
超声感知(第 15 节)来源:
- [TDK Chirp CH101 超声 ToF 传感器](https://invensense.tdk.com/en-us/news-media/press/tdk-announces-worldwide-availability-chirp-ch101-ultrasonic-tof-sensor-platform)
- [TDK SmartSonic 超声 ToF 产品总览](https://product.tdk.com/en/techlibrary/productoverview/smart-sonic-products.html)
- [PMUT 测距综述(PMC](https://pmc.ncbi.nlm.nih.gov/articles/PMC9961946/)
- [超声测厚原理(Elcometer](https://www.elcometer.com/en/how-do-ultrasonic-ndt-thickness-gauges-work)
- [EMAT 电磁超声测厚(Evident](https://ims.evidentscientific.com/en/applications/thickness-boiler-tubes-emat-transducers)
- [Evident/Olympus 38DL PLUS 测厚仪](https://ims.evidentscientific.com/en/insights/the-38dl-plus-ultrasonic-thickness-gauge-is-an-asset-to-asset-reliability-inspections)
- [非接触超声回波 + 深度学习材质分类(ScienceDirect](https://www.sciencedirect.com/science/article/pii/S1877050924007361)
- [机器人超声材质识别(Wiley](https://onlinelibrary.wiley.com/doi/10.1155/2023/1998218)
- [双功能柔性超声阵列:接近觉+材质识别(Wiley)](https://onlinelibrary.wiley.com/doi/10.1002/rob.70225)
- [奥迪威 Audiowell 官网(含材质识别/水下测距传感器)](https://www.audiowell.net/)
- [汕头超声 ST-NDT 官网](https://www.st-ndt.com/)
- [武汉中科创新(汉威)官网](https://www.zkcx.com/)