44 KiB
多感官物体感知与触觉:方向综述
子方向:Multisensory Object Perception & Tactile Sensing 锚点论文:ObjectFolder 系列(CoRL 2021 / CVPR 2022 / CVPR 2023)与 VTV-LLM(NeurIPS 2025) 定位:本综述以 MultiPLY 为出发点,系统梳理"让机器同时用视觉、听觉、触觉(乃至温度)感知物体"这一方向的传感器、仿真、数据集、表示学习、与大模型结合、以及机器人操作应用,面向研究者。 配套阅读:同目录《MultiPLY技术讲解.md》
1. 这个方向是什么,为什么重要
人类认识一个物体,从来不是只靠"看"。判断牛油果熟没熟要捏一捏(触觉硬度),判断杯子是空是满可以敲一敲(撞击声),判断锅烫不烫要靠温度。这些只有交互才能获得的物理属性,正是纯视觉模型的盲区——视觉能告诉你"这是个杯子",但说不准它的材质、软硬、温度、是否中空。
"多感官物体感知与触觉"这个方向,研究的就是如何让机器获得、表示并推理这些视觉之外的物体物理属性,核心模态是:
- 触觉(tactile):接触面的微观几何、纹理、软硬、滑动/形变——最难也最关键的一环;
- 听觉(audio / impact sound):敲击声携带材质、结构(实心/中空)、尺寸信息;
- 温度(thermal):材质导热性的代理信号;
- 它们与视觉、语言的对齐与融合。
这与 MultiPLY 的关系非常直接:MultiPLY 是"具身体 + 多感官 + LLM"的集成系统,而本方向提供它赖以成立的全部底层积木——MultiPLY 的撞击声与材质来自 ObjectFolder,触觉来自 DiffTactile,而把触觉/多感官接进语言模型的范式(Octopi、TVL、VTV-LLM)则是它的同代与后继。
2. 方向地图(Taxonomy)
可以从五个正交维度理解这个方向的所有工作:
- 模态组合:触觉单模态 / 视-触 / 视-触-语 / 视-听-触 / 视-听-触-温。
- 数据来源:仿真(ObjectFolder、TACTO、Taxim、DiffTactile)vs 真实采集(Touch and Go、SSVTP、ObjectFolder Real)。
- 表示与监督:自监督跨模态对比(SSVTP、Touch and Go)/ 绑定到视觉锚点(UniTouch,ImageBind 式)/ 三模态成对对比(TVL)/ 隐式神经场(ObjectFolder)。
- 与语言/LLM 的结合度:无语言(纯表示)→ 触觉-语言对齐(Touch100k、TLV)→ 触觉接入 LLM 做推理(Octopi、VTV-LLM)→ 接入动作(Tactile-VLA、MultiPLY)。
- 下游任务:材质/属性识别、跨模态检索、接触定位、抓取稳定性预测、形状重建、物理推理问答、操作控制。
下面先深入两条锚点线,再横向铺开传感器、仿真、数据集、表示学习、LLM 结合与机器人操作。
3. 锚点一:ObjectFolder 系列——多感官物体的"隐式神经数据库"
ObjectFolder 由斯坦福 / CMU(Ruohan Gao、Jiajun Wu、Li Fei-Fei、Wenzhen Yuan 等)推动,三代演进,是整个方向最具影响力的数据基座。
3.1 核心思想:Object File 与隐式神经表示
它借用认知科学的 "Object File" 概念(Kahneman)——一个物体在某位置上被接收到的全部感官信息。ObjectFolder 把每个物体建模成一个紧凑的隐式神经网络,内含三个子网络:
- VisionNet:给定相机视角/光照,渲染外观;
- AudioNet:给定敲击位置/力度,给出撞击声;
- TouchNet:给定接触位置/凝胶形变,给出触觉读数(按 DIGIT 传感器建模)。
关键设计是 "intrinsic(物体内禀)/ extrinsic(查询参数)分离":物体的内禀属性固化在网络权重里,用外参(视角、敲击点、接触点)去"查询"就能得到对应模态的感官信号。这让数据集既紧凑又灵活——存的是网络,不是海量渲染结果。
3.2 三代演进
| 代次 | 会议 | 物体数 | 关键进展 |
|---|---|---|---|
| ObjectFolder 1.0 | CoRL 2021 | 100(虚拟) | 首次把视/听/触统一进隐式神经表示;4 个基准任务:实例识别、跨模态检索、3D 重建、机器人抓取 |
| ObjectFolder 2.0 | CVPR 2022 | 1000(虚拟) | 规模 ×10、渲染快几个数量级、质量大幅提升;首次实现 sim2real(尺度估计、接触定位、形状重建三任务从虚拟物体迁移到真实物体) |
| ObjectFolder Benchmark + ObjectFolder Real | CVPR 2023 | +100(真实) | 10 个标准化任务(围绕识别、重建、操作);用 Franka 机械臂 + GelSight 采集 100 个真实家用物体的网格、视频、撞击声、触觉,建立 neural↔real 对照基准 |
3.3 它为什么对 MultiPLY 至关重要
MultiPLY 的数据流水线里,ObjectFolder 提供了 1k 物体网格 + 以隐式神经场存储的撞击声 + 材质标注——智能体"敲击"(<hit>)一个物体时听到的声音,正是查询 AudioNet 得到的。可以说没有 ObjectFolder 这类"可查询的多感官物体库",MultiPLY 的"主动交互取声"就无从谈起。
4. 锚点二:VTV-LLM——把触觉"视频"接进大语言模型
VTV-LLM: Universal Visuo-Tactile Video Understanding for Embodied Interaction(NeurIPS 2025,Yifan Xie 等)是首个面向通用视触觉视频(Visuo-Tactile Video)理解的多模态大语言模型,把触觉感知正式当作"跨模态推理"问题——让触觉视频与语言描述对齐,从而对物理属性做复杂推理。
4.1 为什么是"视频"而非"图像"
视触觉传感器(GelSight/DIGIT 等)本质是相机,但它的输出与自然图像差异巨大,且触觉本身是时序过程:按压、滑动、形变都在时间维度展开,存在帧间相关与时间冗余。所以 VTV-LLM 强调对触觉视频做鲁棒的时序表示,而非把它当静态图。
4.2 VTV150K 数据集
- 规模:150,000 视频帧,来自 100 个物体;
- 跨传感器:横跨 GelSight Mini、DIGIT、Tac3D 三种传感器(这点很重要——跨传感器泛化是触觉领域的老大难);
- 属性标注:四个基础触觉属性——硬度(hardness)、凸起(protrusion)、弹性(elasticity)、摩擦(friction);
- 问答构造:用结构化模板 + 比较算子(more/less/most/least)+ 属性选择器,生成约 10,000 条 QA 对,支持比较分析、场景决策等。
4.3 三阶段训练范式
- VTV enhancement:学习鲁棒的视触觉表示(针对触觉视频的特性做专门微调);
- VTV-text alignment:建立视触觉与语言的跨模态对应;
- text prompt finetuning:让模型用自然语言生成回答。
最终能做触觉特征评估、表面特征区分、触觉场景分析等具身交互任务。
4.4 它在谱系中的位置
VTV-LLM 与 MultiPLY 是互补的:MultiPLY 把触觉作为"多感官之一"塞进具身 LLM、强调主动交互闭环;VTV-LLM 则专攻触觉这一条模态的深度理解(时序、跨传感器、细粒度属性、可比较推理)。两者合起来勾勒了"触觉 + 语言"的两种走法:广度集成 vs 深度专精。
5. 传感器基础:触觉与听觉怎么"采"
5.1 视触觉(vision-based tactile)传感器
这是当前触觉学习的主流硬件,原理是用一块可形变弹性体(凝胶)做接触介质,背后一个微型相机拍下凝胶被压出的形变,从而把"触觉"转化为"图像"——于是所有计算机视觉/深度学习算法都能直接用。
- GelSight(MIT 起源):高分辨率,能估计接触几何与受力;很多变体(GelSlim 等)。
- DIGIT(Meta AI × GelSight,2020/2021):小型化、低成本、可装在多指手上,是机器学习社区用得最多的型号;2024 年推出 Digit 360(>18 种感知特征)。
- Tac3D 等:提供三维形变/力场估计。
视触觉传感器的优点是"信息密度高、可直接复用视觉模型",缺点是各家输出不标准化——这正是 UniTouch、TLV-CoRe 等要解决的"跨传感器泛化"问题。
5.2 听觉:接触式麦克风与撞击声
撞击声携带材质、结构、尺寸信息,且极具判别性且能捕捉"视觉看不到的瞬时事件"。采集上常用接触式麦克风(contact microphone)(如 See Hear Feel),物理上则可由声学仿真(如 ObjectFolder 的 AudioNet、SoundSpaces 的房间脉冲响应)合成。
6. 仿真与数据生成:触觉/声音"造数据"
真实触觉数据采集昂贵(要机械臂逐点接触),所以仿真是这个方向的命脉。视触觉仿真有一条清晰的演进线:
| 仿真器 | 年份/会议 | 类型 | 关键特点 |
|---|---|---|---|
| TACTO | 2020(RAL/IROS) | 渲染式 | 高速渲染 DIGIT/OmniTact 触觉图像(数百 FPS),接触动力学交给 PyBullet 等外部物理引擎 |
| Taxim | 2021(RAL 2022) | 示例式/数据驱动 | 用多项式查找表建模光学响应 + 弹性叠加原理建模 marker 运动;<100 个真实标定点即可,CPU 可跑 |
| DiffTactile | ICLR 2024 | 物理式可微 | FEM 软体模型 + 多材质仿真(刚/弹/弹塑性);可微性支持梯度优化做 sim2real 标定与技能学习 |
值得注意的是 DiffTactile 正是 MultiPLY 触觉信号的来源,且其作者(Zilin Si)也是 Taxim 的主导者,呈现清晰的研究传承;DiffTactile 隶属 Genesis-Embodied-AI 生态。更新的 DOT-Sim 进一步用 MPM(物质点法)建模软体传感器,提升物理精度。
声学方面,撞击声可由 ObjectFolder 的隐式声场查询得到,环境/空间化音频则可用 SoundSpaces 式的房间脉冲响应(RIR)卷积生成(MultiPLY 仿真器即如此)。
7. 数据集谱系(一张表看懂)
| 数据集 | 年份/会议 | 模态 | 规模 | 传感器/来源 | 特点 |
|---|---|---|---|---|---|
| ObjectFolder 1.0 | CoRL 2021 | 视/听/触 | 100 虚拟物体 | DIGIT(触觉) | 隐式神经 Object File |
| ObjectFolder 2.0 | CVPR 2022 | 视/听/触 | 1000 虚拟物体 | 仿真 | 实时渲染、sim2real |
| ObjectFolder Real | CVPR 2023 | 视/听/触 | 100 真实物体 | Franka + GelSight | 真实多感官测量、10 任务基准 |
| SSVTP | RSS 2023 | 视-触 | ~4.5k 对齐对 | UR5 + DIGIT | 机器人自采、空间对齐 |
| Touch and Go (TAG) | NeurIPS 2022 | 视-触 | in-the-wild | 人采 + GelSight | 自然场景、真实物体 |
| VisGel | (早期) | 视-触 | ~大规模 | GelSight | 后续多个语言数据集的视触来源 |
| PhysiCLeAR(Octopi) | RSS 2024 | 触-语 | 408 视频/74 物体 | GelSight | 硬度/粗糙/凹凸属性标注 |
| TVL | ICML 2024 | 触-视-语 | 44K 对 | SSVTP+HCT;GPT-4V 伪标注 | 三模态对齐 |
| TLV | 2024 | 触-语-视 | ~19.8k 条 | VisGel + 人机协作标注 | 句级描述 |
| Touch100k | 2024(Inf. Fusion) | 触-语-视 | ~100k 条 | TAG+VisGel;GPT-4V | 多粒度触觉描述 |
| VTV150K(VTV-LLM) | NeurIPS 2025 | 视-触(视频)-语 | 150k 帧/100 物体 | GelSight Mini/DIGIT/Tac3D | 跨传感器、4 属性、QA |
一个清晰的趋势:从"视-触成对"→"加上语言"→"视频化、跨传感器、问答化",数据正在朝"能直接训练触觉大模型"的方向演进。
8. 表示学习:把触觉对齐到视觉与语言
核心问题:触觉信号怎么学到一个能和视觉、语言互通的表示?四种代表性思路:
- 自监督跨模态对比(机器人自采)——SSVTP(RSS 2023):让机器人自动采集空间对齐的视-触图像对,用跨模态对比损失学共享隐空间,免人工标注;下游 5 个定位/跟随任务取得 73–100% 成功率。
- 自然场景视-触学习——Touch and Go(NeurIPS 2022):人手持 GelSight 在真实世界探物 + 录第一视角视频,做自监督视触特征、触觉驱动图像风格化、触觉未来帧预测。
- 绑定到视觉锚点——UniTouch(CVPR 2024,"Binding Touch to Everything"):把触觉 embedding 对齐到已与多模态关联的预训练图像 embedding(ImageBind 式),并用**可学习的"传感器特定 token"**同时吃多种异构传感器;从而零样本做材质识别、抓取稳定性预测、触觉图像问答,还能接 diffusion 做触觉→图像生成。
- 三模态成对对比 + 生成——TVL(ICML 2024,UC Berkeley/Meta):不把一切绑到视觉,而是在触/视/语三模态间两两对比;用 44K 对(10% 人工 + 90% GPT-4V 伪标注)训练触觉编码器,再微调 LLaMA2-7B 生成触觉描述;分类 +29%,触视理解超 GPT-4V +12%。
延伸:Touch100k / TLV-Link 用课程学习把触-语-视对齐做到 100k 规模;TLV-CoRe(2026)提出 Sensor-Aware Modulator 统一不同传感器特征,专攻跨传感器鲁棒性。
9. 触觉/多感官接入语言与 LLM
这是与 MultiPLY 最近的一圈,可按"理解 → 推理 → 动作"排列:
- 触觉物理属性推理——Octopi(RSS 2024):用 GelSight 触觉视频 + VLM,最小语言微调即可预测并推理物体物理属性(硬度/粗糙/凹凸)。经典例子:摸两个牛油果,结合触觉(更软)+ 常识(更软=更熟)选出更熟的那个——展示了"触觉 + 常识推理"的闭环。
- 触觉视频大模型——VTV-LLM(NeurIPS 2025):见第 4 节,跨传感器、时序、可比较推理。
- 触觉生成式语言模型——TVL:见第 8 节,LLaMA2 生成触觉描述。
- 触觉进入 VLA(动作)——Tactile-VLA / VTLA:把触觉接入"视觉-语言-动作"模型,用混合位置-力控制器 + 触觉反馈推理,做插入等接触密集型操作。
- 集大成的具身多感官 LLM——MultiPLY:把视/听/触/温作为状态 token、配动作 token,形成主动交互闭环(详见配套文档)。
一句话对比:Octopi/VTV-LLM 专注"触觉→语言理解与推理";TVL 专注"触觉表示 + 描述生成";Tactile-VLA 把触觉接到动作;MultiPLY 把它们整合进具身 3D 智能体。
10. 多感官机器人操作:为什么需要不止一种感官
回到机器人本身——多感官的价值在操作任务上最直观:
- See, Hear, and Feel(CoRL 2022,Hao Li 等):用相机(看)+ 接触式麦克风(听)+ 视触觉传感器(触),自注意力融合三模态。在**密集装填(dense packing)与倒水(pouring)**两个难任务上验证:视觉给全局但易遮挡,音频给关键时刻的即时反馈(甚至是看不见的),触觉给精确局部几何——三者缺一不可。
- MidasTouch(CoRL 2022):纯触觉全局定位——传感器在物体表面滑动,用粒子滤波 + 触觉码网络估计位姿分布,无需视觉先验;并发布 YCB-Slide 数据集。说明触觉单模态也能解决"我现在摸到的是物体哪个部位"。
- 声音引导探索:如"Impact Makes a Sound"指出声音高度判别且常被忽视;AuRL 用接触麦克风的声音做自监督学习动态操作。
这些工作共同说明:遮挡、瞬时事件、精细局部几何这三类信息分别由视觉、听觉、触觉最擅长覆盖,多感官融合不是锦上添花而是任务刚需。
11. 开放问题与趋势
- 跨传感器泛化:GelSight / DIGIT / Tac3D 输出不标准,模型换个传感器就掉点。UniTouch 的传感器 token、TLV-CoRe 的 Sensor-Aware Modulator、VTV150K 的跨传感器数据都是尝试,但远未解决。
- Sim2Real:触觉/声学仿真与真实的差距仍大;DiffTactile 的可微标定、ObjectFolder 的 neural↔real 基准是方向,但真实触觉的噪声、磨损、标定漂移仍棘手。
- 数据稀缺与标注:触觉天然缺语言标签,目前大量依赖 GPT-4V 伪标注(TVL、Touch100k),质量与偏置存疑。
- 时序与动态:多数工作仍偏静态接触;VTV-LLM 强调视频时序是重要一步,但动态滑动/力控的建模仍欠缺。
- 温度等"长尾模态":温度、本体感觉等被 MultiPLY 列入但少有专门数据与模型(MultiPLY 代码里温度模态甚至未完整释出)。
- 从理解到动作的闭环:Tactile-VLA、MultiPLY 起步,但"主动决定去摸哪、摸完怎么改计划"的交互式策略仍是前沿。
- 统一的多感官基础模型:把视/听/触/温 + 语言 + 动作统一在一个模型里(MultiPLY 的愿景),数据、表示、训练范式都还在早期。
12. 与 MultiPLY 的呼应
把本方向的积木对回 MultiPLY,就能看清它"站在巨人肩上"的具体位置:
- 数据底座 ← ObjectFolder(撞击声 + 材质 + 物体库);
- 触觉信号 ← DiffTactile(可微触觉仿真);
- 声学空间化 ← SoundSpaces 式 RIR 卷积;
- 触觉/多感官 + 语言范式 ← Octopi / TVL / VTV-LLM 的同代探索;
- 多感官操作动机 ← See Hear Feel 证明的"三感官互补";
- MultiPLY 的增量 = 把这些整合进具身 3D 智能体 + 主动交互闭环(动作 token / 状态 token)+ LLM。
换句话说,本方向回答的是"每一种感官怎么采、怎么表示、怎么对齐语言",而 MultiPLY 回答的是"如何让一个 LLM 智能体主动调度这些感官去完成任务"。
13. 论文与资源清单
锚点
- ObjectFolder 1.0(CoRL 2021)https://arxiv.org/abs/2109.07991
- ObjectFolder 2.0(CVPR 2022)https://arxiv.org/abs/2204.02389
- ObjectFolder Benchmark / Real(CVPR 2023)https://arxiv.org/abs/2306.00956
- VTV-LLM(NeurIPS 2025)https://arxiv.org/abs/2505.22566
触觉/多感官 + 语言与 LLM
- Octopi(RSS 2024)https://arxiv.org/abs/2405.02794
- TVL: Touch-Vision-Language Dataset(ICML 2024)https://arxiv.org/abs/2402.13232
- UniTouch: Binding Touch to Everything(CVPR 2024)https://arxiv.org/abs/2401.18084
- TLV: Touch-Language-Vision Dataset(2024)https://arxiv.org/abs/2403.09813
- Touch100k(2024)https://arxiv.org/abs/2406.03813
- TLV-CoRe(2026)https://arxiv.org/abs/2511.11512
- Tactile-VLA(2025)https://arxiv.org/abs/2507.09160
视触觉表示学习与数据集
- SSVTP(RSS 2023)https://arxiv.org/abs/2209.13042
- Touch and Go(NeurIPS 2022)https://arxiv.org/abs/2211.12498
传感器与仿真
- TACTO 仿真器https://arxiv.org/abs/2012.08456
- Taxim 仿真器(GelSight)https://arxiv.org/abs/2109.04027
- DiffTactile(ICLR 2024,MultiPLY 触觉来源)https://arxiv.org/abs/2403.08716
多感官机器人操作
- See, Hear, and Feel(CoRL 2022)https://arxiv.org/abs/2212.03858
- MidasTouch(CoRL 2022)https://arxiv.org/abs/2210.14210
- Impact Makes a Sound(2022)https://arxiv.org/abs/2208.02680
14. 硬件方案:多感官数据采集设备选型(国际主流 vs 中国平替)
目标场景:搭建一套能采集视觉 / 深度 / 触觉 / 撞击声 / 温度的物体级多感官数据采集装置(对标 ObjectFolder Real、TVL、VTV150K 的数据规格)。 选型基调:性能 / 生态优先——主推社区成熟、论文复现友好的国际主流器件,同时为每一类给出中国平替,便于成本敏感时替换。 价格为公开渠道的大致参考,会随时间与汇率波动,仅供量级判断。
14.0 一套采集装置需要哪些"感官硬件"
把多感官数据采集拆成"感官通道 + 交互执行 + 同步"三部分:
- 感官通道:① 视触觉/触觉传感器(触)② RGB-D 相机(视 + 点云)③ 接触式麦克风 + 麦克风(听,尤其撞击声)④ 热成像/温度(温)。
- 交互执行("主动采集"的关键,对标 ObjectFolder Real 用 Franka + GelSight 逐点接触):⑤ 机械臂 ⑥ 夹爪/灵巧手 ⑦ 六维力/力矩传感器(控制接触力、保护传感器)。
- 同步与底座:转台、标定板、统一时间戳采集(硬件触发或 ROS 时间同步)。
下面逐类给出选型。
14.1 视触觉(光学)触觉传感器——"触觉相机"
把凝胶形变拍成图像,可直接复用视觉模型,是当前触觉学习数据采集的首选。强烈建议数据采集主力选 GelSight Mini 或 DIGIT——因为 ObjectFolder、Touch and Go、TVL、PhysiCLeAR、VTV150K 等数据集大多基于它们,复现/迁移最顺。
| 型号 | 厂商/产地 | 关键规格 | 参考价 | 备注 |
|---|---|---|---|---|
| GelSight Mini | GelSight(美) | 超人类分辨率 2D/3D,浏览器即插即用,提供 ROS/Python | ~$499 | 生态最成熟、采集首选 |
| DIGIT | Meta×GelSight(美) | 小型化、USB-3、可装多指手,开源(digit.ml) | 低成本/开源 | 论文用得最多、适合上手 |
| Digit 360 | Meta×GelSight(美) | 指尖形、~830 万 taxel、可测 1mN、含振动/热/气味 | 科研早期申请 | 最前沿、面向多模态触觉研究 |
| DM-Tac W / F | 戴盟 Daimon(深圳) | 多维高分辨率视触觉、CE/FCC、>500 万次按压寿命 | 询价 | 中国平替,主打高频高分辨率 |
| GF225 | 纬钛 WTac(中国) | 10µm 级分辨率、可同测法向/切向力 | 询价 | 中国平替,分辨率高 |
14.2 多维力阵列 / 电子皮肤 / 仿生触觉
当需要法向+切向力、温度、振动等更"物理量化"的触觉(而非纯图像),用阵列式/仿生传感器。这一类中国厂商已相当强(人形机器人热潮推动),可大胆用国产。
| 型号 | 厂商/产地 | 原理 | 关键规格 | 备注 |
|---|---|---|---|---|
| BioTac | SynTouch(美) | 液阻 + 热敏 + 水听器 | 测法向/切向力、振动、温度梯度,仿人指尖 | 经典仿生、多模态 |
| uSkin | XELA Robotics(日) | 霍尔阵列 + 磁体 | 3 轴力分布阵列,可贴/拧到手指手掌 | 分布式多点 |
| ReSkin | Meta/学术(美) | 磁性软皮肤 | <$30、2–3mm 薄、400Hz、1mm 空间分辨、可更换 | 极低成本、自采友好 |
| PX 多维触觉 / DexH | 帕西尼 PaXini(深圳) | 6D 霍尔阵列 | 第三代 15 维感知,单价降至数千元;曾用于英伟达 CES 展示机器人 | 中国平替,多维+灵巧手生态 |
| TS 指尖触觉 | 他山 TASHAN(中国) | 电容 + 触觉 AI 芯片 | 0.01N 力分辨,含接近觉/三维力/纹理;自研类脑触觉芯片 | 中国平替,边缘智能 |
| 柔性触觉芯片 | 钛深 TacSense(深圳) | 柔性离电子(Iontronic) | 薄膜分布式压力、高灵敏;与优必选/大疆合作 | 中国平替,柔性大面积 |
14.3 RGB-D / 深度相机——视觉与点云
提供外观图像 + 深度点云(对标 ObjectFolder 的 VisionNet、3D 重建)。注意:Intel 已停止 RealSense 新品研发,长周期项目建议把 Orbbec(奥比中光)作为"未来可持续"的首选之一——它自研深度芯片、生态接近、价格更低。
| 型号 | 厂商/产地 | 原理 | 关键规格 | 参考价 |
|---|---|---|---|---|
| RealSense D405 / D435i / D455 | Intel(美) | 主动红外双目 | D405 近距操作首选;D455 FOV 90×65、0.6–6m;板载算深度 | ~$250–400(已停研,渠道库存) |
| Azure Kinect DK | Microsoft(美) | ToF | 大 FOV、高彩色分辨、30fps、3m 内骨架追踪佳 | ~$400 |
| ZED 2 / ZED X | Stereolabs(美) | 被动双目 + GPU 神经深度 | 户外可用、最远 ~20m,需 CUDA GPU | ~$450+ |
| Gemini 335 / Femto Bolt | Orbbec 奥比中光(深圳) | 主动双目 / ToF | Gemini 335 户外/复杂场景优于 D435i,FOV 更大;Femto Bolt 兼容 Azure Kinect SDK | ~¥1950 / ~$250 |
| Percipio 系列 | 图漾 PercipioXYZ(上海) | 主动双目 + 结构光辅助 | 工业级、环境适应性强 | 询价 |
14.4 热成像 / 温度——第四感官
温度是材质导热性的代理信号(MultiPLY 列为第四模态)。FLIR 的 Lepton/Boson 是集成生态标杆;但中国厂商在出货量上已全球领先,性价比高,平替力度可大。
| 型号 | 厂商/产地 | 关键规格 | 备注 |
|---|---|---|---|
| FLIR Lepton | Teledyne FLIR(美) | 微型 LWIR 模组,160×120 / 80×60,可辐射测温 | 集成生态最佳(多平台 SDK) |
| FLIR Boson | Teledyne FLIR(美) | 12µm 非制冷、640 分辨率,性能参考级 | 高端核心 |
| 艾睿 / Micro III 等模组 | 睿创微纳 InfiRay/Raytron(烟台) | 模组/机芯齐全,独立测评对比 FLIR 表现接近 | 中国平替,出货量大 |
| HIKMICRO 模组 | 海康微影(杭州) | MEMS 自研,探测器/机芯/模组全栈 | 中国平替,供应链完整 |
| Guide 高德 | 高德红外/高德智感(武汉) | 中国最大、全球第二大红外探测器企业 | 中国平替,自研探测器 |
提示:高端探测器精度上国产仍略逊 FLIR,但对"物体相对温度/材质区分"这类数据采集足够。
14.5 音频——撞击声与环境声
对标 ObjectFolder 的 AudioNet(撞击声)。两类麦克风互补:接触式麦克风(压电 piezo)采"敲击/接触的结构声",麦克风阵列采"空间环境声 + 声源定位"。
- 接触式麦克风(撞击声主力):压电片把表面振动转成电信号,能隔离空气噪声、专捕接触/撞击声。注意 piezo 频响非线性、有谐振着色,采集时需做阻抗匹配/滤波。国际可选 DPA、Shure 等专业贴片式;低成本可用通用压电片 + 前置放大。
- 麦克风阵列(环境声/定位):如 8 麦阵列可做声源到达方向估计(DoA)。开源生态常用 ReSpeaker 系列阵列(带 ROS 接口)。采集时遵循"stop-perceive-act"(采集瞬间停住)以减少自运动噪声。
14.6 机械臂——"主动接触"的执行主体
ObjectFolder Real 用 Franka + GelSight 逐点接触采集真实触觉。研究级采集强烈建议选带关节力矩、1kHz 低层控制、ROS2 生态好的臂——这对"力控接触不压坏触觉传感器"至关重要。
| 型号 | 厂商/产地 | 关键规格 | 参考价 | 备注 |
|---|---|---|---|---|
| Franka Research 3 | Franka(德) | 7-DOF、每关节力矩、1kHz、低层接口 | ~$25–30K | 学术操作研究事实标准 |
| Kinova Gen3 | Kinova(加) | 7-DOF、每关节力矩、ROS2、30 分钟上手 | ~$28K | 研究级、轻量便携 |
| UR5e | Universal Robots(丹麦) | 5kg/850mm、工业可靠性标杆 | ~$35K | 标配无关节力矩 |
| RealMan RM65-B | 睿尔曼(北京) | 6-DOF、整臂 7.2kg、负载 5kg(峰值 9kg)、610mm、ROS | 显著更低 | 中国平替,国内具身/模仿学习常用 |
| JAKA / AUBO / Dobot | 节卡/遨博/越疆(中国) | 协作臂,±0.02–0.1mm,负载/易用性强 | 较低 | 中国平替,工业生态成熟 |
取舍:Franka/Kinova 强在低层力矩控制 + 开放研究接口;多数国产协作臂历史上偏工业易用/负载/价格,研究级力控 API 稍弱,但 RealMan 等已专攻具身研究位。
14.7 末端执行器——夹爪与灵巧手
采集时用来"持握触觉传感器去接触物体"或"做抓取交互"。若只为给传感器做接触,二指夹爪足矣;若要采集灵巧操作数据,再上灵巧手。
| 型号 | 厂商/产地 | 关键规格 | 参考价 | 备注 |
|---|---|---|---|---|
| Robotiq 2F-85 | Robotiq(加) | 二指自适应、行程 85mm、握力 30–100N、负载 5kg、即插即用 | 中端 | 接触采集够用、最省心 |
| Allegro Hand | Wonik(韩) | 直驱四指研究标准、原生兼容 DIGIT | ~$16K | 研究常用,连续负载易过热 |
| Shadow Hand | Shadow Robot(英) | 24-DOF、>100 传感器、1kHz,最仿人 | >$100K | 最高保真,贵且维护重 |
| 因时 Inspire RH56 | 因时机器人(北京) | 6-DOF/12 关节、内置 6 路力传感、力位混合控制 | 较低 | 中国平替,已规模出货 |
| LinkerHand L20/L30 | 灵心巧手 Linkerbot(北京) | 21/22-DOF(研究版至 42-DOF),多传动 | ~¥5–10 万 | 中国平替,高自由度领先 |
| BrainCo Revo 2 | 强脑(杭州) | 11-DOF、383g、握力 50N、含 3D 触觉 | 较低 | 中国平替,超轻+触觉 |
14.8 六维力/力矩传感器——接触力闭环
装在臂腕与末端之间,用于控制接触力、保护脆弱的触觉凝胶、并把力觉作为一路数据。这一类国产成熟度高、性价比突出,坤维已可对标 ATI。
| 型号 | 厂商/产地 | 关键规格 | 参考价 | 备注 |
|---|---|---|---|---|
| ATI Nano 系列 | ATI(美) | 0.5% 精度、硅应变片,计量级 | 可达 ~¥10 万/个 | 行业龙头、最高精度 |
| Robotiq FT 300 | Robotiq(加) | 电容式、±300N/±30N·m、全数字 | 中端 | 高重复性而非高精度,UR 即插即用 |
| 坤维 Kunwei | 坤维科技(中国) | 0.5% 精度对标 ATI,协作机器人市占率 >80% | ~¥2 万+ | 中国平替首选 |
| 宇立 SRI | 宇立仪器(中国) | 9mm 全球最薄、汽车碰撞测试级 | 询价 | 中国平替,超薄/磨抛 |
| 鑫精诚 Forsentek/XJC | 鑫精诚(中国) | 结构解耦、3C 起家、高性价比 | 较低 | 中国平替,成本敏感 |
14.9 推荐配置(面向多感官数据采集)
配置 A —— 性能/生态优先(论文复现友好,推荐)
- 触觉:GelSight Mini ×1–2(主力)+ 选配 DIGIT 装夹爪指尖
- 视觉/点云:Intel RealSense D435i/D405(近距)或 ZED 2(大场景)
- 温度:FLIR Lepton/Boson 模组
- 音频:专业接触式麦克风(撞击声)+ ReSpeaker 麦阵(环境声)
- 机械臂:Franka Research 3(关节力矩 + 1kHz 力控)
- 末端:Robotiq 2F-85(接触采集)或 Allegro Hand(灵巧采集)
- 力觉:ATI Nano 或 坤维(力控闭环保护触觉传感器)
- 同步:转台 + 标定板 + ROS2 时间同步/硬件触发
配置 B —— 中国平替优先(成本可控,国产生态)
- 触觉:戴盟 DM-Tac / 纬钛 GF225(视触觉)+ 帕西尼 / 他山(多维力阵列)
- 视觉/点云:Orbbec Gemini 335 / Femto Bolt
- 温度:艾睿 InfiRay / 海康微影 / 高德 模组
- 音频:通用压电接触片 + 前置放大 + 国产麦阵
- 机械臂:睿尔曼 RM65-B 或 JAKA/遨博
- 末端:因时 RH56 / LinkerHand / BrainCo Revo 2
- 力觉:坤维 / 宇立 / 鑫精诚
14.10 采集与工程注意事项
- 力控保护:视触觉凝胶易磨损(DM-Tac 标称 >500 万次按压),务必用力矩臂或六维力传感器限制接触力。
- 跨传感器一致性:不同触觉传感器输出不可直接混用(VTV150K 跨 GelSight Mini/DIGIT/Tac3D 正是为此);若混采,需记录传感器型号并考虑 UniTouch/TLV-CoRe 式的跨传感器对齐。
- 多模态时间同步:撞击声是瞬时事件,必须与触觉/视觉精确对齐(硬件触发优于软件时间戳)。
- 标定:RGB-D 内外参、热像与可见光配准(MSX 式)、力传感器零偏,采集前都要标定。
- 数据规格对标:想直接对接现有工作,可参考 ObjectFolder Real(网格+视频+撞击声+触觉)、TVL(视-触成对 + 语言标注)、VTV150K(视触觉视频 + 4 属性 + QA)的字段组织。
15. 超声感知:测距与材质/厚度检测
本章把**超声(ultrasound)**作为一种独立的物体感知模态纳入综述。它的独特定位是:主动发射声波、非接触、且能"穿透"到次表面——正好补上视觉(怕遮挡/透明/暗光)与触觉(必须接触)的盲区,介于"被动听撞击声"和"主动接触"之间。 两个核心能力:① 测距(ranging)——隔空测物体距离/轮廓;② 测厚与材质识别——靠声速、声阻抗、回波结构反推材料厚度与种类。
15.0 为什么超声值得纳入多感官物体感知
- 非接触 + 不怕光:超声靠声波而非光,全黑、强光、烟尘下都能工作,且不受物体颜色/透明度影响(玻璃、透明塑料这些视觉/红外的"硬骨头",超声照测不误)。
- 可探次表面:声波能进入材料内部,从回波里读出厚度、分层、内部缺陷——这是纯表面模态(视觉、视触觉)做不到的。
- 材质判别的物理基础:不同材质的声速和声阻抗 Z=ρc(密度×声速)不同,回波的到达时间与幅度因此携带材质信息。
- 与本综述其他模态互补:视觉给外观、触觉给接触面微观几何、撞击声给"敲击后"的材质线索,而超声能在"接触之前"就隔空给出距离 + 材质预判。
15.1 测距:脉冲回波 / 飞行时间(ToF)
原理极简:发射一个超声脉冲,测它碰到目标反射回来的飞行时间(Time-of-Flight, ToF),距离 = 声速 × ToF ÷ 2。工程上常用**互相关(cross-correlation)**而非简单阈值来精确估计 ToF。
传感器从"大块头"走向 MEMS 化。传统压电换能器体积大、与空气声阻抗不匹配(需匹配层)。新一代 MEMS 微机械超声换能器有两类:
- PMUT(压电式):低驱动电压、低功耗、与空气声阻抗匹配好、工艺成本低——是空气中小型测距的主流;缺点是窄带,空气中高分辨 3D 测距能力有限。
- CMUT(电容式):带宽更好,但需要高 DC 偏压和亚微米间隙,限制了声功率与测距应用。
商用代表:TDK Chirp(PMUT)。把 PMUT + 超低功耗 SoC 封进 3.5×3.5mm 的微型封装:
- CH101:量程约 1.2m;CH201:量程达 5m;新一代 ICU-10201/20201 量程 5m、FOV 可配置。
- 亮点:毫米级精度、不受光照/颜色/透明度影响、大视场、功耗约 15µA(比红外 ToF 低约 500 倍),片上自主运算可让主控休眠。非常适合机器人避障、接近觉、液位检测。
- 局限:PMUT 窄带、空气衰减限制远距离(小型超声一般 ≤5m),多径/连续波在极近距离误差大(可用多频脉冲 MFPW 缓解),盲区需靠宽带设计压缩(已有把盲区降到 ~4.4mm、±0.3mm 误差的研究)。
15.2 测厚与材质识别
测厚(thickness gauging)
同样是 ToF:脉冲在材料里来回一趟,厚度 = 声速 × ToF ÷ 2。探头有三种主流形态:
- 单晶探头 + 延迟线(delay line):测薄/高精度材料;延迟线拉开发射与回波的时间间隔,避免太薄时回波分不开。
- 双晶探头(dual element,pitch-and-catch):一发一收成"V"形路径,对腐蚀、粗糙面信噪比更好,是腐蚀测厚主力。
- 回波-回波(echo-to-echo)/ 穿透涂层(THRU-COAT):用两次背壁回波的时间差测厚,从而忽略涂层只测基材;多层结构可用**去卷积(deconvolution)**分离各层厚度。
EMAT(电磁声换能器)——免耦合剂的特殊路线:靠线圈涡流 + 磁场在金属/铁磁体内直接激发超声(洛伦兹力或磁致伸缩),天然产生水平剪切波(SH 波)。优点是无需耦合剂、可隔着油漆/氧化层/空气层、耐高温(锅炉管在 >800°C 氧化层下仍可测),适合粗糙/高温/涂覆表面;缺点是频率低、对极薄/细分层分辨率受限、只能单晶、对点蚀检测弱、仪器更贵。
材质识别(material characterization)
物理上:回波幅度由界面两侧声阻抗失配决定,声速因材质而异——把回波信号喂给模型即可分类材质。
15.3 前沿:超声 + 机器学习
非接触超声 + ML 做材质识别正成为视觉的有力补充(不怕暗光/烟尘):
- 经典 ML:用经验模态分解(EMD)从回波提 16 维特征,喂 KNN / 决策树 / SVM,并配声学理论模型——显著提升机器人在黑暗/粉尘/危险环境下的材质识别。
- 深度学习:如 AE-CS-TCN 直接从原始回波联合学习空间/时序/多尺度特征(含空间注意力 + 时序卷积 + 跨尺度融合 + 交叉注意力),在机器人平台上做可复现的材质识别。
- 双模态 / 实时:一种同时测接近距离 + 材质的双模态超声系统对 13 种工业材料达 98% 分类准确率、测距误差 <3mm、毫秒级响应;也有柔性超声传感阵列兼顾接近觉与材质识别用于机器人安全控制。
- 多传感器数据集:MatSense2025(超声 + 毫米波)面向材质分类、无损检测与传感器融合研究。
深入阅读:本节有一份独立深度子专题《超声+ML材质识别_深度子专题.md》,详细展开物理可分性、信号特征、模型方法谱系、机器人 pre-touch 应用、数据流水线与核心挑战(距离/角度/温度/跨传感器泛化)。
15.4 与多感官框架 / MultiPLY 的关系
把超声放进本综述的模态地图,它是一种**"主动声学探测"模态**:
- 与"听"(被动撞击声,ObjectFolder 的 AudioNet)相比,超声是主动发射 + 接收,可控、可隔空、可探内部;
- 与"触"相比,超声无需接触就能给出距离与材质预判,可作为接触前的"预探测",降低碰坏脆弱触觉凝胶的风险;
- 在 MultiPLY 式的具身 LLM 框架里,超声天然可成为一个新的动作 token(如
<probe>超声探测)+ 状态 token(回波/距离/材质特征),让智能体"先隔空扫一下再决定要不要去摸/敲"。 - 在数据采集装置里(见第 14 章),超声可作为第五路传感通道,尤其适合采集"透明/暗色/内部结构"这类视觉与视触觉都吃力的样本。
15.5 硬件选型:国际主流 vs 中国平替
超声硬件分两条线:消费/机器人测距传感器(避障、接近觉)与工业测厚/无损检测(NDT)设备。
A. 测距 / 接近觉传感器(含 MEMS 超声 ToF)
| 型号/品牌 | 厂商/产地 | 特点 | 备注 |
|---|---|---|---|
| Chirp CH101 / CH201 / ICU 系列 | TDK(美/日) | PMUT MEMS ToF,3.5×3.5mm,1.2–5m,mm 级,15µA 超低功耗 | 机器人/无人机首选,生态新 |
| 车规/工业超声雷达 | Murata 村田(日) | 车载超声龙头,倒车雷达/避障 | 车规生态成熟 |
| MB 系列 | MaxBotix(美) | 测距/液位/接近,OEM 友好 | 模块化易集成 |
| UC/RU 系列 | Pepperl+Fuchs、SICK、Banner(欧美) | 工业级、IO-Link、可调声束 | 工业自动化标杆 |
| AK2 超声雷达 / 材质识别 / 水下测距传感器 | 奥迪威 Audiowell(广东) | 国产超声传感器龙头,已量产"材质识别传感器"与"水下测距传感器",车载与机器人布局 | 中国平替首选,与本主题高度契合 |
B. 测厚仪 / 无损检测(NDT)设备与探头
| 型号/品牌 | 厂商/产地 | 特点 | 备注 |
|---|---|---|---|
| 38DL PLUS / 39DL PLUS | Evident(原 Olympus,日/美) | 测厚 0.08–635mm,单/双晶、THRU-COAT/回波-回波、高分辨 0.001mm | 行业标杆(39DL 为新款,含 Wi-Fi/蓝牙) |
| 便携测厚仪 / 探伤仪 | Dakota、Elcometer、Baker Hughes(欧美) | 腐蚀测厚、涂层穿透 | 工业常用 |
| CTS 系列探伤仪 / CTS-409 EMAT 测厚 | 汕头超声 ST-NDT(广东) | "中国超声第一家",相控阵/3D 全聚焦/EMAT,免耦合剂电磁超声测厚 | 中国平替,NDT 全线 |
| HS 系列探伤 / HS F91 EMAT 测厚 / HS P9s 笔式测厚 | 武汉中科创新(汉威 HS) | 数字探伤、电磁超声测厚、应力检测、自动化检测系统 | 中国平替,产品线全 |
15.6 局限与工程注意事项
- 耦合剂:接触式压电测厚通常需耦合剂(凝胶/水);要免耦合剂选 EMAT(但分辨率、成本有代价)。
- 空气衰减与距离:空气中高频超声衰减快,小型 MEMS 测距一般 ≤5m;测厚则是贴合/近场。
- 分辨率与盲区:窄带 PMUT 分辨率有限,近距有盲区,需宽带设计或多频脉冲缓解。
- 难测目标:强吸声(海绵/泡沫)、镜面斜反射、极薄涂层等会削弱回波。
- 温度影响声速:声速随温度/介质变化,精密测距/测厚需做温度补偿与零点标定。
- 多径与串扰:复杂场景多径反射会污染 ToF,阵列/编码波形/互相关可改善。
来源(Sources)
- ObjectFolder 1.0 (2109.07991)
- ObjectFolder 2.0 (2204.02389)
- ObjectFolder Benchmark/Real (2306.00956)
- VTV-LLM (2505.22566)
- Octopi (2405.02794)
- TVL (2402.13232)
- UniTouch (2401.18084)
- TLV (2403.09813)
- Touch100k (2406.03813)
- TLV-CoRe (2511.11512)
- Tactile-VLA (2507.09160)
- SSVTP (2209.13042)
- Touch and Go (2211.12498)
- TACTO (2012.08456)
- Taxim (2109.04027)
- DiffTactile (2403.08716)
- See, Hear, and Feel (2212.03858)
- MidasTouch (2210.14210)
- Impact Makes a Sound (2208.02680)
硬件方案(第 14 节)来源:
- GelSight Mini / DIGIT / Digit 360 官方
- Meta DIGIT 开源平台
- ReSkin (2111.00071)
- XELA Robotics uSkin
- 帕西尼 PaXini 官网
- 因时机器人 Inspire-Robots 官网
- 人形机器人触觉传感器国内供应商盘点(艾邦机器人)
- 深度相机选型(RealSense/ZED/Orbbec, SVRC 2026)
- Teledyne FLIR Lepton OEM 模组
- InfiRay/FLIR/Seek 热像对比(Yole)
- Franka Research 3 官网
- 机器人臂价格指南 2026(SVRC)
- Robotiq FT-300 力矩传感器
- 六维力传感器国产替代深度报告(东方财富)
超声感知(第 15 节)来源: