Files
worldmodel/research/multiply/多感官物体感知与触觉_方向综述.md
T

44 KiB
Raw Blame History

多感官物体感知与触觉:方向综述

子方向:Multisensory Object Perception & Tactile Sensing 锚点论文:ObjectFolder 系列CoRL 2021 / CVPR 2022 / CVPR 2023)与 VTV-LLMNeurIPS 2025 定位:本综述以 MultiPLY 为出发点,系统梳理"让机器同时用视觉、听觉、触觉(乃至温度)感知物体"这一方向的传感器、仿真、数据集、表示学习、与大模型结合、以及机器人操作应用,面向研究者。 配套阅读:同目录《MultiPLY技术讲解.md》


1. 这个方向是什么,为什么重要

人类认识一个物体,从来不是只靠"看"。判断牛油果熟没熟要捏一捏(触觉硬度),判断杯子是空是满可以敲一敲(撞击声),判断锅烫不烫要靠温度。这些只有交互才能获得的物理属性,正是纯视觉模型的盲区——视觉能告诉你"这是个杯子",但说不准它的材质、软硬、温度、是否中空。

"多感官物体感知与触觉"这个方向,研究的就是如何让机器获得、表示并推理这些视觉之外的物体物理属性,核心模态是:

  • 触觉(tactile:接触面的微观几何、纹理、软硬、滑动/形变——最难也最关键的一环;
  • 听觉(audio / impact sound:敲击声携带材质、结构(实心/中空)、尺寸信息;
  • 温度(thermal:材质导热性的代理信号;
  • 它们与视觉、语言的对齐与融合。

这与 MultiPLY 的关系非常直接:MultiPLY 是"具身体 + 多感官 + LLM"的集成系统,而本方向提供它赖以成立的全部底层积木——MultiPLY 的撞击声与材质来自 ObjectFolder,触觉来自 DiffTactile,而把触觉/多感官接进语言模型的范式(Octopi、TVL、VTV-LLM)则是它的同代与后继。


2. 方向地图(Taxonomy

可以从五个正交维度理解这个方向的所有工作:

  1. 模态组合:触觉单模态 / 视-触 / 视-触-语 / 视-听-触 / 视-听-触-温。
  2. 数据来源:仿真(ObjectFolder、TACTO、Taxim、DiffTactilevs 真实采集(Touch and Go、SSVTP、ObjectFolder Real)。
  3. 表示与监督:自监督跨模态对比(SSVTP、Touch and Go/ 绑定到视觉锚点(UniTouchImageBind 式)/ 三模态成对对比(TVL/ 隐式神经场(ObjectFolder)。
  4. 与语言/LLM 的结合度:无语言(纯表示)→ 触觉-语言对齐(Touch100k、TLV)→ 触觉接入 LLM 做推理(Octopi、VTV-LLM)→ 接入动作(Tactile-VLA、MultiPLY)。
  5. 下游任务:材质/属性识别、跨模态检索、接触定位、抓取稳定性预测、形状重建、物理推理问答、操作控制。

下面先深入两条锚点线,再横向铺开传感器、仿真、数据集、表示学习、LLM 结合与机器人操作。


3. 锚点一:ObjectFolder 系列——多感官物体的"隐式神经数据库"

ObjectFolder 由斯坦福 / CMURuohan Gao、Jiajun Wu、Li Fei-Fei、Wenzhen Yuan 等)推动,三代演进,是整个方向最具影响力的数据基座。

3.1 核心思想:Object File 与隐式神经表示

它借用认知科学的 "Object File" 概念(Kahneman)——一个物体在某位置上被接收到的全部感官信息。ObjectFolder 把每个物体建模成一个紧凑的隐式神经网络,内含三个子网络:

  • VisionNet:给定相机视角/光照,渲染外观;
  • AudioNet:给定敲击位置/力度,给出撞击声;
  • TouchNet:给定接触位置/凝胶形变,给出触觉读数(按 DIGIT 传感器建模)。

关键设计是 "intrinsic(物体内禀)/ extrinsic(查询参数)分离":物体的内禀属性固化在网络权重里,用外参(视角、敲击点、接触点)去"查询"就能得到对应模态的感官信号。这让数据集既紧凑又灵活——存的是网络,不是海量渲染结果。

3.2 三代演进

代次 会议 物体数 关键进展
ObjectFolder 1.0 CoRL 2021 100(虚拟) 首次把视/听/触统一进隐式神经表示;4 个基准任务:实例识别、跨模态检索、3D 重建、机器人抓取
ObjectFolder 2.0 CVPR 2022 1000(虚拟) 规模 ×10、渲染快几个数量级、质量大幅提升;首次实现 sim2real(尺度估计、接触定位、形状重建三任务从虚拟物体迁移到真实物体)
ObjectFolder Benchmark + ObjectFolder Real CVPR 2023 +100(真实) 10 个标准化任务(围绕识别、重建、操作);用 Franka 机械臂 + GelSight 采集 100 个真实家用物体的网格、视频、撞击声、触觉,建立 neural↔real 对照基准

3.3 它为什么对 MultiPLY 至关重要

MultiPLY 的数据流水线里,ObjectFolder 提供了 1k 物体网格 + 以隐式神经场存储的撞击声 + 材质标注——智能体"敲击"<hit>)一个物体时听到的声音,正是查询 AudioNet 得到的。可以说没有 ObjectFolder 这类"可查询的多感官物体库"MultiPLY 的"主动交互取声"就无从谈起。


4. 锚点二:VTV-LLM——把触觉"视频"接进大语言模型

VTV-LLM: Universal Visuo-Tactile Video Understanding for Embodied InteractionNeurIPS 2025Yifan Xie 等)是首个面向通用视触觉视频(Visuo-Tactile Video)理解的多模态大语言模型,把触觉感知正式当作"跨模态推理"问题——让触觉视频与语言描述对齐,从而对物理属性做复杂推理。

4.1 为什么是"视频"而非"图像"

视触觉传感器(GelSight/DIGIT 等)本质是相机,但它的输出与自然图像差异巨大,且触觉本身是时序过程:按压、滑动、形变都在时间维度展开,存在帧间相关与时间冗余。所以 VTV-LLM 强调对触觉视频做鲁棒的时序表示,而非把它当静态图。

4.2 VTV150K 数据集

  • 规模150,000 视频帧,来自 100 个物体
  • 跨传感器:横跨 GelSight Mini、DIGIT、Tac3D 三种传感器(这点很重要——跨传感器泛化是触觉领域的老大难);
  • 属性标注:四个基础触觉属性——硬度(hardness)、凸起(protrusion)、弹性(elasticity)、摩擦(friction
  • 问答构造:用结构化模板 + 比较算子(more/less/most/least+ 属性选择器,生成约 10,000 条 QA 对,支持比较分析、场景决策等。

4.3 三阶段训练范式

  1. VTV enhancement:学习鲁棒的视触觉表示(针对触觉视频的特性做专门微调);
  2. VTV-text alignment:建立视触觉与语言的跨模态对应;
  3. text prompt finetuning:让模型用自然语言生成回答。

最终能做触觉特征评估、表面特征区分、触觉场景分析等具身交互任务。

4.4 它在谱系中的位置

VTV-LLM 与 MultiPLY 是互补的:MultiPLY 把触觉作为"多感官之一"塞进具身 LLM、强调主动交互闭环;VTV-LLM 则专攻触觉这一条模态的深度理解(时序、跨传感器、细粒度属性、可比较推理)。两者合起来勾勒了"触觉 + 语言"的两种走法:广度集成 vs 深度专精。


5. 传感器基础:触觉与听觉怎么"采"

5.1 视触觉(vision-based tactile)传感器

这是当前触觉学习的主流硬件,原理是用一块可形变弹性体(凝胶)做接触介质,背后一个微型相机拍下凝胶被压出的形变,从而把"触觉"转化为"图像"——于是所有计算机视觉/深度学习算法都能直接用。

  • GelSight(MIT 起源):高分辨率,能估计接触几何与受力;很多变体(GelSlim 等)。
  • DIGITMeta AI × GelSight2020/2021):小型化、低成本、可装在多指手上,是机器学习社区用得最多的型号;2024 年推出 Digit 360>18 种感知特征)。
  • Tac3D 等:提供三维形变/力场估计。

视触觉传感器的优点是"信息密度高、可直接复用视觉模型",缺点是各家输出不标准化——这正是 UniTouch、TLV-CoRe 等要解决的"跨传感器泛化"问题。

5.2 听觉:接触式麦克风与撞击声

撞击声携带材质、结构、尺寸信息,且极具判别性且能捕捉"视觉看不到的瞬时事件"。采集上常用接触式麦克风(contact microphone(如 See Hear Feel),物理上则可由声学仿真(如 ObjectFolder 的 AudioNet、SoundSpaces 的房间脉冲响应)合成。


6. 仿真与数据生成:触觉/声音"造数据"

真实触觉数据采集昂贵(要机械臂逐点接触),所以仿真是这个方向的命脉。视触觉仿真有一条清晰的演进线:

仿真器 年份/会议 类型 关键特点
TACTO 2020RAL/IROS 渲染式 高速渲染 DIGIT/OmniTact 触觉图像(数百 FPS),接触动力学交给 PyBullet 等外部物理引擎
Taxim 2021RAL 2022 示例式/数据驱动 用多项式查找表建模光学响应 + 弹性叠加原理建模 marker 运动;<100 个真实标定点即可,CPU 可跑
DiffTactile ICLR 2024 物理式可微 FEM 软体模型 + 多材质仿真(刚/弹/弹塑性);可微性支持梯度优化做 sim2real 标定与技能学习

值得注意的是 DiffTactile 正是 MultiPLY 触觉信号的来源,且其作者(Zilin Si)也是 Taxim 的主导者,呈现清晰的研究传承;DiffTactile 隶属 Genesis-Embodied-AI 生态。更新的 DOT-Sim 进一步用 MPM(物质点法)建模软体传感器,提升物理精度。

声学方面,撞击声可由 ObjectFolder 的隐式声场查询得到,环境/空间化音频则可用 SoundSpaces 式的房间脉冲响应(RIR)卷积生成(MultiPLY 仿真器即如此)。


7. 数据集谱系(一张表看懂)

数据集 年份/会议 模态 规模 传感器/来源 特点
ObjectFolder 1.0 CoRL 2021 视/听/触 100 虚拟物体 DIGIT(触觉) 隐式神经 Object File
ObjectFolder 2.0 CVPR 2022 视/听/触 1000 虚拟物体 仿真 实时渲染、sim2real
ObjectFolder Real CVPR 2023 视/听/触 100 真实物体 Franka + GelSight 真实多感官测量、10 任务基准
SSVTP RSS 2023 视-触 ~4.5k 对齐对 UR5 + DIGIT 机器人自采、空间对齐
Touch and Go (TAG) NeurIPS 2022 视-触 in-the-wild 人采 + GelSight 自然场景、真实物体
VisGel (早期) 视-触 ~大规模 GelSight 后续多个语言数据集的视触来源
PhysiCLeAROctopi RSS 2024 触-语 408 视频/74 物体 GelSight 硬度/粗糙/凹凸属性标注
TVL ICML 2024 触-视-语 44K 对 SSVTP+HCTGPT-4V 伪标注 三模态对齐
TLV 2024 触-语-视 ~19.8k 条 VisGel + 人机协作标注 句级描述
Touch100k 2024Inf. Fusion 触-语-视 ~100k 条 TAG+VisGelGPT-4V 多粒度触觉描述
VTV150KVTV-LLM NeurIPS 2025 视-触(视频)-语 150k 帧/100 物体 GelSight Mini/DIGIT/Tac3D 跨传感器、4 属性、QA

一个清晰的趋势:从"视-触成对"→"加上语言"→"视频化、跨传感器、问答化",数据正在朝"能直接训练触觉大模型"的方向演进。


8. 表示学习:把触觉对齐到视觉与语言

核心问题:触觉信号怎么学到一个能和视觉、语言互通的表示?四种代表性思路:

  • 自监督跨模态对比(机器人自采)——SSVTPRSS 2023):让机器人自动采集空间对齐的视-触图像对,用跨模态对比损失学共享隐空间,免人工标注;下游 5 个定位/跟随任务取得 73–100% 成功率。
  • 自然场景视-触学习——Touch and GoNeurIPS 2022):人手持 GelSight 在真实世界探物 + 录第一视角视频,做自监督视触特征、触觉驱动图像风格化、触觉未来帧预测。
  • 绑定到视觉锚点——UniTouchCVPR 2024"Binding Touch to Everything"):把触觉 embedding 对齐到已与多模态关联的预训练图像 embeddingImageBind 式),并用**可学习的"传感器特定 token"**同时吃多种异构传感器;从而零样本做材质识别、抓取稳定性预测、触觉图像问答,还能接 diffusion 做触觉→图像生成。
  • 三模态成对对比 + 生成——TVLICML 2024UC Berkeley/Meta):不把一切绑到视觉,而是在触/视/语三模态间两两对比;用 44K 对(10% 人工 + 90% GPT-4V 伪标注)训练触觉编码器,再微调 LLaMA2-7B 生成触觉描述;分类 +29%,触视理解超 GPT-4V +12%。

延伸:Touch100k / TLV-Link 用课程学习把触-语-视对齐做到 100k 规模;TLV-CoRe2026)提出 Sensor-Aware Modulator 统一不同传感器特征,专攻跨传感器鲁棒性。


9. 触觉/多感官接入语言与 LLM

这是与 MultiPLY 最近的一圈,可按"理解 → 推理 → 动作"排列:

  • 触觉物理属性推理——OctopiRSS 2024):用 GelSight 触觉视频 + VLM,最小语言微调即可预测并推理物体物理属性(硬度/粗糙/凹凸)。经典例子:摸两个牛油果,结合触觉(更软)+ 常识(更软=更熟)选出更熟的那个——展示了"触觉 + 常识推理"的闭环。
  • 触觉视频大模型——VTV-LLMNeurIPS 2025):见第 4 节,跨传感器、时序、可比较推理。
  • 触觉生成式语言模型——TVL:见第 8 节,LLaMA2 生成触觉描述。
  • 触觉进入 VLA(动作)——Tactile-VLA / VTLA:把触觉接入"视觉-语言-动作"模型,用混合位置-力控制器 + 触觉反馈推理,做插入等接触密集型操作。
  • 集大成的具身多感官 LLM——MultiPLY:把视/听/触/温作为状态 token、配动作 token,形成主动交互闭环(详见配套文档)。

一句话对比Octopi/VTV-LLM 专注"触觉→语言理解与推理"TVL 专注"触觉表示 + 描述生成"Tactile-VLA 把触觉接到动作;MultiPLY 把它们整合进具身 3D 智能体。


10. 多感官机器人操作:为什么需要不止一种感官

回到机器人本身——多感官的价值在操作任务上最直观:

  • See, Hear, and FeelCoRL 2022Hao Li 等):用相机(看)+ 接触式麦克风(听)+ 视触觉传感器(触),自注意力融合三模态。在**密集装填(dense packing倒水(pouring)**两个难任务上验证:视觉给全局但易遮挡,音频给关键时刻的即时反馈(甚至是看不见的),触觉给精确局部几何——三者缺一不可。
  • MidasTouchCoRL 2022):纯触觉全局定位——传感器在物体表面滑动,用粒子滤波 + 触觉码网络估计位姿分布,无需视觉先验;并发布 YCB-Slide 数据集。说明触觉单模态也能解决"我现在摸到的是物体哪个部位"。
  • 声音引导探索:如"Impact Makes a Sound"指出声音高度判别且常被忽视;AuRL 用接触麦克风的声音做自监督学习动态操作。

这些工作共同说明:遮挡、瞬时事件、精细局部几何这三类信息分别由视觉、听觉、触觉最擅长覆盖,多感官融合不是锦上添花而是任务刚需。


11. 开放问题与趋势

  • 跨传感器泛化GelSight / DIGIT / Tac3D 输出不标准,模型换个传感器就掉点。UniTouch 的传感器 token、TLV-CoRe 的 Sensor-Aware Modulator、VTV150K 的跨传感器数据都是尝试,但远未解决。
  • Sim2Real:触觉/声学仿真与真实的差距仍大;DiffTactile 的可微标定、ObjectFolder 的 neural↔real 基准是方向,但真实触觉的噪声、磨损、标定漂移仍棘手。
  • 数据稀缺与标注:触觉天然缺语言标签,目前大量依赖 GPT-4V 伪标注(TVL、Touch100k),质量与偏置存疑。
  • 时序与动态:多数工作仍偏静态接触;VTV-LLM 强调视频时序是重要一步,但动态滑动/力控的建模仍欠缺。
  • 温度等"长尾模态":温度、本体感觉等被 MultiPLY 列入但少有专门数据与模型(MultiPLY 代码里温度模态甚至未完整释出)。
  • 从理解到动作的闭环Tactile-VLA、MultiPLY 起步,但"主动决定去摸哪、摸完怎么改计划"的交互式策略仍是前沿。
  • 统一的多感官基础模型:把视/听/触/温 + 语言 + 动作统一在一个模型里(MultiPLY 的愿景),数据、表示、训练范式都还在早期。

12. 与 MultiPLY 的呼应

把本方向的积木对回 MultiPLY,就能看清它"站在巨人肩上"的具体位置:

  • 数据底座 ← ObjectFolder(撞击声 + 材质 + 物体库);
  • 触觉信号 ← DiffTactile(可微触觉仿真);
  • 声学空间化 ← SoundSpaces 式 RIR 卷积;
  • 触觉/多感官 + 语言范式 ← Octopi / TVL / VTV-LLM 的同代探索;
  • 多感官操作动机 ← See Hear Feel 证明的"三感官互补";
  • MultiPLY 的增量 = 把这些整合进具身 3D 智能体 + 主动交互闭环(动作 token / 状态 token+ LLM

换句话说,本方向回答的是"每一种感官怎么采、怎么表示、怎么对齐语言",而 MultiPLY 回答的是"如何让一个 LLM 智能体主动调度这些感官去完成任务"。


13. 论文与资源清单

锚点

触觉/多感官 + 语言与 LLM

视触觉表示学习与数据集

传感器与仿真

多感官机器人操作


14. 硬件方案:多感官数据采集设备选型(国际主流 vs 中国平替)

目标场景:搭建一套能采集视觉 / 深度 / 触觉 / 撞击声 / 温度的物体级多感官数据采集装置(对标 ObjectFolder Real、TVL、VTV150K 的数据规格)。 选型基调:性能 / 生态优先——主推社区成熟、论文复现友好的国际主流器件,同时为每一类给出中国平替,便于成本敏感时替换。 价格为公开渠道的大致参考,会随时间与汇率波动,仅供量级判断。

14.0 一套采集装置需要哪些"感官硬件"

把多感官数据采集拆成"感官通道 + 交互执行 + 同步"三部分:

  • 感官通道:① 视触觉/触觉传感器(触)② RGB-D 相机(视 + 点云)③ 接触式麦克风 + 麦克风(听,尤其撞击声)④ 热成像/温度(温)。
  • 交互执行("主动采集"的关键,对标 ObjectFolder Real 用 Franka + GelSight 逐点接触):⑤ 机械臂 ⑥ 夹爪/灵巧手 ⑦ 六维力/力矩传感器(控制接触力、保护传感器)。
  • 同步与底座:转台、标定板、统一时间戳采集(硬件触发或 ROS 时间同步)。

下面逐类给出选型。

14.1 视触觉(光学)触觉传感器——"触觉相机"

把凝胶形变拍成图像,可直接复用视觉模型,是当前触觉学习数据采集的首选。强烈建议数据采集主力选 GelSight Mini 或 DIGIT——因为 ObjectFolder、Touch and Go、TVL、PhysiCLeAR、VTV150K 等数据集大多基于它们,复现/迁移最顺。

型号 厂商/产地 关键规格 参考价 备注
GelSight Mini GelSight(美) 超人类分辨率 2D/3D,浏览器即插即用,提供 ROS/Python ~$499 生态最成熟、采集首选
DIGIT Meta×GelSight(美) 小型化、USB-3、可装多指手,开源(digit.ml) 低成本/开源 论文用得最多、适合上手
Digit 360 Meta×GelSight(美) 指尖形、~830 万 taxel、可测 1mN、含振动/热/气味 科研早期申请 最前沿、面向多模态触觉研究
DM-Tac W / F 戴盟 Daimon(深圳) 多维高分辨率视触觉、CE/FCC、>500 万次按压寿命 询价 中国平替,主打高频高分辨率
GF225 纬钛 WTac(中国) 10µm 级分辨率、可同测法向/切向力 询价 中国平替,分辨率高

14.2 多维力阵列 / 电子皮肤 / 仿生触觉

当需要法向+切向力、温度、振动等更"物理量化"的触觉(而非纯图像),用阵列式/仿生传感器。这一类中国厂商已相当强(人形机器人热潮推动),可大胆用国产。

型号 厂商/产地 原理 关键规格 备注
BioTac SynTouch(美) 液阻 + 热敏 + 水听器 测法向/切向力、振动、温度梯度,仿人指尖 经典仿生、多模态
uSkin XELA Robotics(日) 霍尔阵列 + 磁体 3 轴力分布阵列,可贴/拧到手指手掌 分布式多点
ReSkin Meta/学术(美) 磁性软皮肤 <$30、23mm 薄、400Hz、1mm 空间分辨、可更换 极低成本、自采友好
PX 多维触觉 / DexH 帕西尼 PaXini(深圳) 6D 霍尔阵列 第三代 15 维感知,单价降至数千元;曾用于英伟达 CES 展示机器人 中国平替,多维+灵巧手生态
TS 指尖触觉 他山 TASHAN(中国) 电容 + 触觉 AI 芯片 0.01N 力分辨,含接近觉/三维力/纹理;自研类脑触觉芯片 中国平替,边缘智能
柔性触觉芯片 钛深 TacSense(深圳) 柔性离电子(Iontronic 薄膜分布式压力、高灵敏;与优必选/大疆合作 中国平替,柔性大面积

14.3 RGB-D / 深度相机——视觉与点云

提供外观图像 + 深度点云(对标 ObjectFolder 的 VisionNet、3D 重建)。注意:Intel 已停止 RealSense 新品研发,长周期项目建议把 Orbbec(奥比中光)作为"未来可持续"的首选之一——它自研深度芯片、生态接近、价格更低。

型号 厂商/产地 原理 关键规格 参考价
RealSense D405 / D435i / D455 Intel(美) 主动红外双目 D405 近距操作首选;D455 FOV 90×65、0.66m;板载算深度 ~$250400(已停研,渠道库存)
Azure Kinect DK Microsoft(美) ToF 大 FOV、高彩色分辨、30fps、3m 内骨架追踪佳 ~$400
ZED 2 / ZED X Stereolabs(美) 被动双目 + GPU 神经深度 户外可用、最远 ~20m,需 CUDA GPU ~$450+
Gemini 335 / Femto Bolt Orbbec 奥比中光(深圳) 主动双目 / ToF Gemini 335 户外/复杂场景优于 D435iFOV 更大;Femto Bolt 兼容 Azure Kinect SDK ~¥1950 / ~$250
Percipio 系列 图漾 PercipioXYZ(上海) 主动双目 + 结构光辅助 工业级、环境适应性强 询价

14.4 热成像 / 温度——第四感官

温度是材质导热性的代理信号(MultiPLY 列为第四模态)。FLIR 的 Lepton/Boson 是集成生态标杆;但中国厂商在出货量上已全球领先,性价比高,平替力度可大。

型号 厂商/产地 关键规格 备注
FLIR Lepton Teledyne FLIR(美) 微型 LWIR 模组,160×120 / 80×60,可辐射测温 集成生态最佳(多平台 SDK
FLIR Boson Teledyne FLIR(美) 12µm 非制冷、640 分辨率,性能参考级 高端核心
艾睿 / Micro III 等模组 睿创微纳 InfiRay/Raytron(烟台) 模组/机芯齐全,独立测评对比 FLIR 表现接近 中国平替,出货量大
HIKMICRO 模组 海康微影(杭州) MEMS 自研,探测器/机芯/模组全栈 中国平替,供应链完整
Guide 高德 高德红外/高德智感(武汉) 中国最大、全球第二大红外探测器企业 中国平替,自研探测器

提示:高端探测器精度上国产仍略逊 FLIR,但对"物体相对温度/材质区分"这类数据采集足够。

14.5 音频——撞击声与环境声

对标 ObjectFolder 的 AudioNet(撞击声)。两类麦克风互补:接触式麦克风(压电 piezo)采"敲击/接触的结构声"麦克风阵列采"空间环境声 + 声源定位"

  • 接触式麦克风(撞击声主力):压电片把表面振动转成电信号,能隔离空气噪声、专捕接触/撞击声。注意 piezo 频响非线性、有谐振着色,采集时需做阻抗匹配/滤波。国际可选 DPA、Shure 等专业贴片式;低成本可用通用压电片 + 前置放大。
  • 麦克风阵列(环境声/定位):如 8 麦阵列可做声源到达方向估计(DoA)。开源生态常用 ReSpeaker 系列阵列(带 ROS 接口)。采集时遵循"stop-perceive-act"(采集瞬间停住)以减少自运动噪声。

14.6 机械臂——"主动接触"的执行主体

ObjectFolder Real 用 Franka + GelSight 逐点接触采集真实触觉。研究级采集强烈建议选带关节力矩、1kHz 低层控制、ROS2 生态好的臂——这对"力控接触不压坏触觉传感器"至关重要。

型号 厂商/产地 关键规格 参考价 备注
Franka Research 3 Franka(德) 7-DOF、每关节力矩、1kHz、低层接口 ~$2530K 学术操作研究事实标准
Kinova Gen3 Kinova(加) 7-DOF、每关节力矩、ROS2、30 分钟上手 ~$28K 研究级、轻量便携
UR5e Universal Robots(丹麦) 5kg/850mm、工业可靠性标杆 ~$35K 标配无关节力矩
RealMan RM65-B 睿尔曼(北京) 6-DOF、整臂 7.2kg、负载 5kg(峰值 9kg)、610mm、ROS 显著更低 中国平替,国内具身/模仿学习常用
JAKA / AUBO / Dobot 节卡/遨博/越疆(中国) 协作臂,±0.02–0.1mm,负载/易用性强 较低 中国平替,工业生态成熟

取舍:Franka/Kinova 强在低层力矩控制 + 开放研究接口;多数国产协作臂历史上偏工业易用/负载/价格,研究级力控 API 稍弱,但 RealMan 等已专攻具身研究位。

14.7 末端执行器——夹爪与灵巧手

采集时用来"持握触觉传感器去接触物体"或"做抓取交互"。若只为给传感器做接触,二指夹爪足矣;若要采集灵巧操作数据,再上灵巧手。

型号 厂商/产地 关键规格 参考价 备注
Robotiq 2F-85 Robotiq(加) 二指自适应、行程 85mm、握力 30–100N、负载 5kg、即插即用 中端 接触采集够用、最省心
Allegro Hand Wonik(韩) 直驱四指研究标准、原生兼容 DIGIT ~$16K 研究常用,连续负载易过热
Shadow Hand Shadow Robot(英) 24-DOF、>100 传感器、1kHz,最仿人 >$100K 最高保真,贵且维护重
因时 Inspire RH56 因时机器人(北京) 6-DOF/12 关节、内置 6 路力传感、力位混合控制 较低 中国平替,已规模出货
LinkerHand L20/L30 灵心巧手 Linkerbot(北京) 21/22-DOF(研究版至 42-DOF),多传动 ~¥510 万 中国平替,高自由度领先
BrainCo Revo 2 强脑(杭州) 11-DOF、383g、握力 50N、含 3D 触觉 较低 中国平替,超轻+触觉

14.8 六维力/力矩传感器——接触力闭环

装在臂腕与末端之间,用于控制接触力、保护脆弱的触觉凝胶、并把力觉作为一路数据。这一类国产成熟度高、性价比突出,坤维已可对标 ATI。

型号 厂商/产地 关键规格 参考价 备注
ATI Nano 系列 ATI(美) 0.5% 精度、硅应变片,计量级 可达 ~¥10 万/个 行业龙头、最高精度
Robotiq FT 300 Robotiq(加) 电容式、±300N/±30N·m、全数字 中端 高重复性而非高精度,UR 即插即用
坤维 Kunwei 坤维科技(中国) 0.5% 精度对标 ATI,协作机器人市占率 >80% ~¥2 万+ 中国平替首选
宇立 SRI 宇立仪器(中国) 9mm 全球最薄、汽车碰撞测试级 询价 中国平替,超薄/磨抛
鑫精诚 Forsentek/XJC 鑫精诚(中国) 结构解耦、3C 起家、高性价比 较低 中国平替,成本敏感

14.9 推荐配置(面向多感官数据采集)

配置 A —— 性能/生态优先(论文复现友好,推荐)

  • 触觉:GelSight Mini ×12(主力)+ 选配 DIGIT 装夹爪指尖
  • 视觉/点云:Intel RealSense D435i/D405(近距)或 ZED 2(大场景)
  • 温度:FLIR Lepton/Boson 模组
  • 音频:专业接触式麦克风(撞击声)+ ReSpeaker 麦阵(环境声)
  • 机械臂:Franka Research 3(关节力矩 + 1kHz 力控)
  • 末端:Robotiq 2F-85(接触采集)或 Allegro Hand(灵巧采集)
  • 力觉:ATI Nano坤维(力控闭环保护触觉传感器)
  • 同步:转台 + 标定板 + ROS2 时间同步/硬件触发

配置 B —— 中国平替优先(成本可控,国产生态)

  • 触觉:戴盟 DM-Tac / 纬钛 GF225(视触觉)+ 帕西尼 / 他山(多维力阵列)
  • 视觉/点云:Orbbec Gemini 335 / Femto Bolt
  • 温度:艾睿 InfiRay / 海康微影 / 高德 模组
  • 音频:通用压电接触片 + 前置放大 + 国产麦阵
  • 机械臂:睿尔曼 RM65-BJAKA/遨博
  • 末端:因时 RH56 / LinkerHand / BrainCo Revo 2
  • 力觉:坤维 / 宇立 / 鑫精诚

14.10 采集与工程注意事项

  • 力控保护:视触觉凝胶易磨损(DM-Tac 标称 >500 万次按压),务必用力矩臂或六维力传感器限制接触力。
  • 跨传感器一致性:不同触觉传感器输出不可直接混用(VTV150K 跨 GelSight Mini/DIGIT/Tac3D 正是为此);若混采,需记录传感器型号并考虑 UniTouch/TLV-CoRe 式的跨传感器对齐。
  • 多模态时间同步:撞击声是瞬时事件,必须与触觉/视觉精确对齐(硬件触发优于软件时间戳)。
  • 标定:RGB-D 内外参、热像与可见光配准(MSX 式)、力传感器零偏,采集前都要标定。
  • 数据规格对标:想直接对接现有工作,可参考 ObjectFolder Real(网格+视频+撞击声+触觉)、TVL(视-触成对 + 语言标注)、VTV150K(视触觉视频 + 4 属性 + QA)的字段组织。

15. 超声感知:测距与材质/厚度检测

本章把**超声(ultrasound)**作为一种独立的物体感知模态纳入综述。它的独特定位是:主动发射声波、非接触、且能"穿透"到次表面——正好补上视觉(怕遮挡/透明/暗光)与触觉(必须接触)的盲区,介于"被动听撞击声"和"主动接触"之间。 两个核心能力:① 测距(ranging——隔空测物体距离/轮廓;② 测厚与材质识别——靠声速、声阻抗、回波结构反推材料厚度与种类。

15.0 为什么超声值得纳入多感官物体感知

  • 非接触 + 不怕光:超声靠声波而非光,全黑、强光、烟尘下都能工作,且不受物体颜色/透明度影响(玻璃、透明塑料这些视觉/红外的"硬骨头",超声照测不误)。
  • 可探次表面:声波能进入材料内部,从回波里读出厚度、分层、内部缺陷——这是纯表面模态(视觉、视触觉)做不到的。
  • 材质判别的物理基础:不同材质的声速声阻抗 Z=ρc(密度×声速)不同,回波的到达时间与幅度因此携带材质信息。
  • 与本综述其他模态互补:视觉给外观、触觉给接触面微观几何、撞击声给"敲击后"的材质线索,而超声能在"接触之前"就隔空给出距离 + 材质预判

15.1 测距:脉冲回波 / 飞行时间(ToF)

原理极简:发射一个超声脉冲,测它碰到目标反射回来的飞行时间(Time-of-Flight, ToF,距离 = 声速 × ToF ÷ 2。工程上常用**互相关(cross-correlation**而非简单阈值来精确估计 ToF。

传感器从"大块头"走向 MEMS 化。传统压电换能器体积大、与空气声阻抗不匹配(需匹配层)。新一代 MEMS 微机械超声换能器有两类:

  • PMUT(压电式):低驱动电压、低功耗、与空气声阻抗匹配好、工艺成本低——是空气中小型测距的主流;缺点是窄带,空气中高分辨 3D 测距能力有限。
  • CMUT(电容式):带宽更好,但需要高 DC 偏压和亚微米间隙,限制了声功率与测距应用。

商用代表:TDK ChirpPMUT。把 PMUT + 超低功耗 SoC 封进 3.5×3.5mm 的微型封装:

  • CH101:量程约 1.2mCH201:量程达 5m;新一代 ICU-10201/20201 量程 5m、FOV 可配置。
  • 亮点:毫米级精度、不受光照/颜色/透明度影响、大视场、功耗约 15µA(比红外 ToF 低约 500 倍),片上自主运算可让主控休眠。非常适合机器人避障、接近觉、液位检测
  • 局限:PMUT 窄带、空气衰减限制远距离(小型超声一般 ≤5m),多径/连续波在极近距离误差大(可用多频脉冲 MFPW 缓解),盲区需靠宽带设计压缩(已有把盲区降到 ~4.4mm、±0.3mm 误差的研究)。

15.2 测厚与材质识别

测厚(thickness gauging

同样是 ToF:脉冲在材料里来回一趟,厚度 = 声速 × ToF ÷ 2。探头有三种主流形态:

  • 单晶探头 + 延迟线(delay line:测薄/高精度材料;延迟线拉开发射与回波的时间间隔,避免太薄时回波分不开。
  • 双晶探头(dual elementpitch-and-catch:一发一收成"V"形路径,对腐蚀、粗糙面信噪比更好,是腐蚀测厚主力。
  • 回波-回波(echo-to-echo/ 穿透涂层(THRU-COAT:用两次背壁回波的时间差测厚,从而忽略涂层只测基材;多层结构可用**去卷积(deconvolution**分离各层厚度。

EMAT(电磁声换能器)——免耦合剂的特殊路线:靠线圈涡流 + 磁场在金属/铁磁体内直接激发超声(洛伦兹力或磁致伸缩),天然产生水平剪切波(SH 波)。优点是无需耦合剂、可隔着油漆/氧化层/空气层、耐高温(锅炉管在 >800°C 氧化层下仍可测),适合粗糙/高温/涂覆表面;缺点是频率低、对极薄/细分层分辨率受限、只能单晶、对点蚀检测弱、仪器更贵。

材质识别(material characterization

物理上:回波幅度由界面两侧声阻抗失配决定,声速因材质而异——把回波信号喂给模型即可分类材质。

15.3 前沿:超声 + 机器学习

非接触超声 + ML 做材质识别正成为视觉的有力补充(不怕暗光/烟尘):

  • 经典 ML:用经验模态分解(EMD)从回波提 16 维特征,喂 KNN / 决策树 / SVM,并配声学理论模型——显著提升机器人在黑暗/粉尘/危险环境下的材质识别。
  • 深度学习:如 AE-CS-TCN 直接从原始回波联合学习空间/时序/多尺度特征(含空间注意力 + 时序卷积 + 跨尺度融合 + 交叉注意力),在机器人平台上做可复现的材质识别。
  • 双模态 / 实时:一种同时测接近距离 + 材质的双模态超声系统对 13 种工业材料达 98% 分类准确率、测距误差 <3mm、毫秒级响应;也有柔性超声传感阵列兼顾接近觉与材质识别用于机器人安全控制。
  • 多传感器数据集MatSense2025(超声 + 毫米波)面向材质分类、无损检测与传感器融合研究。

深入阅读:本节有一份独立深度子专题《超声+ML材质识别_深度子专题.md》,详细展开物理可分性、信号特征、模型方法谱系、机器人 pre-touch 应用、数据流水线与核心挑战(距离/角度/温度/跨传感器泛化)。

15.4 与多感官框架 / MultiPLY 的关系

把超声放进本综述的模态地图,它是一种**"主动声学探测"模态**

  • 与"听"(被动撞击声,ObjectFolder 的 AudioNet)相比,超声是主动发射 + 接收,可控、可隔空、可探内部;
  • 与"触"相比,超声无需接触就能给出距离与材质预判,可作为接触前的"预探测",降低碰坏脆弱触觉凝胶的风险;
  • 在 MultiPLY 式的具身 LLM 框架里,超声天然可成为一个新的动作 token(如 <probe> 超声探测)+ 状态 token(回波/距离/材质特征),让智能体"先隔空扫一下再决定要不要去摸/敲"。
  • 在数据采集装置里(见第 14 章),超声可作为第五路传感通道,尤其适合采集"透明/暗色/内部结构"这类视觉与视触觉都吃力的样本。

15.5 硬件选型:国际主流 vs 中国平替

超声硬件分两条线:消费/机器人测距传感器(避障、接近觉)与工业测厚/无损检测(NDT)设备

A. 测距 / 接近觉传感器(含 MEMS 超声 ToF)

型号/品牌 厂商/产地 特点 备注
Chirp CH101 / CH201 / ICU 系列 TDK(美/日) PMUT MEMS ToF3.5×3.5mm1.25mmm 级,15µA 超低功耗 机器人/无人机首选,生态新
车规/工业超声雷达 Murata 村田(日) 车载超声龙头,倒车雷达/避障 车规生态成熟
MB 系列 MaxBotix(美) 测距/液位/接近,OEM 友好 模块化易集成
UC/RU 系列 Pepperl+Fuchs、SICK、Banner(欧美) 工业级、IO-Link、可调声束 工业自动化标杆
AK2 超声雷达 / 材质识别 / 水下测距传感器 奥迪威 Audiowell(广东) 国产超声传感器龙头,已量产"材质识别传感器"与"水下测距传感器",车载与机器人布局 中国平替首选,与本主题高度契合

B. 测厚仪 / 无损检测(NDT)设备与探头

型号/品牌 厂商/产地 特点 备注
38DL PLUS / 39DL PLUS Evident(原 Olympus,日/美) 测厚 0.08635mm,单/双晶、THRU-COAT/回波-回波、高分辨 0.001mm 行业标杆(39DL 为新款,含 Wi-Fi/蓝牙)
便携测厚仪 / 探伤仪 Dakota、Elcometer、Baker Hughes(欧美) 腐蚀测厚、涂层穿透 工业常用
CTS 系列探伤仪 / CTS-409 EMAT 测厚 汕头超声 ST-NDT(广东) "中国超声第一家",相控阵/3D 全聚焦/EMAT,免耦合剂电磁超声测厚 中国平替,NDT 全线
HS 系列探伤 / HS F91 EMAT 测厚 / HS P9s 笔式测厚 武汉中科创新(汉威 HS 数字探伤、电磁超声测厚、应力检测、自动化检测系统 中国平替,产品线全

15.6 局限与工程注意事项

  • 耦合剂:接触式压电测厚通常需耦合剂(凝胶/水);要免耦合剂选 EMAT(但分辨率、成本有代价)。
  • 空气衰减与距离:空气中高频超声衰减快,小型 MEMS 测距一般 ≤5m;测厚则是贴合/近场。
  • 分辨率与盲区:窄带 PMUT 分辨率有限,近距有盲区,需宽带设计或多频脉冲缓解。
  • 难测目标:强吸声(海绵/泡沫)、镜面斜反射、极薄涂层等会削弱回波。
  • 温度影响声速:声速随温度/介质变化,精密测距/测厚需做温度补偿与零点标定。
  • 多径与串扰:复杂场景多径反射会污染 ToF,阵列/编码波形/互相关可改善。

来源(Sources

硬件方案(第 14 节)来源:

超声感知(第 15 节)来源: