TenStep

Heterogeneous Tactile Transformer

论文 2026-06-29 Tactile Representation

Heterogeneous Tactile Transformer

Jianxin Bi · Qiang Wang · Jayaram Reddy · Kelvin Lin · Soibkhon Khajikhanov · Ruihan Gao · Harold Soh

National University of Singapore

一句话结论

HTT 是面向异构触觉传感器的自监督预训练框架:四种传感器共享同一个 Transformer trunk,靠 masked reconstruction + 双向跨模态预测把光学和阵列信号对齐到同一潜空间,并在未见过的新传感器上验证可迁移。

摘要

中文摘要

触觉传感器天然异构:在一种传感器上训练的模型不能直接用于另一种,这限制了从大规模多样化触觉数据中学习接触丰富的操作策略。为弥合这一差距,本文提出异构触觉 Transformer(HTT),一个跨异构触觉传感器学习共享表示的框架。HTT 由传感器专属编码器与一个共享 Transformer trunk 组成,通过逐模态的遮蔽重建和成对传感器之间的跨模态对齐进行预训练。预训练使用新构建的异构成对触觉(HPT)数据集,包含四种视觉式与阵列式触觉传感器同步采得的 160 万对帧。在多种触觉感知和真实操作任务上,HTT 学到了可迁移表示,能适配新任务和训练时未见过的新传感器。数据集、代码与模型权重将于发表时公开。

英文摘要

Tactile sensors are inherently heterogeneous: a model trained on one sensor cannot be directly used on another, which limits learning contact-rich manipulation policies from diverse tactile data at scale. To bridge this gap, we propose the Heterogeneous Tactile Transformer (HTT), a framework that learns shared tactile representations across heterogeneous sensors. HTT consists of sensor-specific encoders and a shared transformer trunk, and is pretrained with per-modality masked reconstruction together with cross-modal alignment between paired sensors. Pretraining uses our novel Heterogeneous Paired Tactile (HPT) dataset, containing 1.6M synchronized paired frames across four vision- and array-based tactile sensors. Across distinct tactile perception and real-world manipulation tasks, HTT is shown to learn transferable representations that adapt to new tasks and previously unseen sensors. Dataset, code, and model checkpoints will be released upon publication.

直观理解

四种触觉传感器(两光学的 GelSight Mini/9DTact、两阵列的 Xela/Tac-02)装在同一只 UMI 夹爪两侧同步采数据。每路信号先经过各自的 patchify + sensor-specific encoder 进入一个共享 Transformer trunk,再以"重建自己被遮蔽的部分 + 跨传感器预测被遮蔽的目标 embedding"的双重目标做自监督预训练。下游用同一套 backbone 在物体分类、力估计、滑移检测、真机螺丝刀/抓豆腐任务上微调。

架构总览

Figure 1: Heterogeneous Tactile Transformer 架构总览

Figure 1: Heterogeneous Tactile Transformer 架构总览
Figure 1: Heterogeneous Tactile Transformer 架构总览

背景与问题

为什么做

触觉是接触丰富操作(抓取易碎、精密装配、材质识别)的关键观测,但触觉传感器天然异构:光学式(GelSight 类)能给稠密空间/几何信息但相机帧率受限;阵列式(taxel)能给出高频力/压信号但空间分辨率低。两类信号是互补的,但原始数据结构一个是图像、另一个是时序,难以用一个 backbone 直接学习可迁移表示。

问题缺口

已有的触觉自监督方法(基于 MAE 的 T3、SITR 等)几乎都只在光学触觉数据上预训练。一旦换到阵列传感器或需要力/滑移线索的下游任务,这些 backbone 不可用;把多模数据各自独立训练又浪费了"同一次接触其实被多传感器同时记录"这一关键监督信号。要的不是某一个传感器最强的 backbone,而是一个能跨传感器共享潜空间、又能容纳新传感器的统一 backbone。

方法

方法概述

HTT 是一个 MAE 风格的自监督预训练框架,结构上是「传感器专属 encoder + 共享 Transformer trunk + 传感器专属 decoder + 跨模态预测器」四件套,训练目标是"每路重建自己被遮蔽的 patch + 跨传感器互预测被遮蔽的目标 embedding"。

核心机制

同一接触被多个传感器同步记录 → 把每个传感器当作一个 modality → 在共享 trunk 的潜空间里通过"预测对侧被遮蔽的 embedding"建立双向跨模态约束,使得每个传感器的局部细节和跨传感器的语义对齐都进入同一表示。

方法拆解

  • 输入统一化:每个训练实例是一个 τ = 0.2 s 的同步时间窗;光学帧缩放到 224×224 后用 ViT 风格 patchify;阵列式传感器把高频多维时序列切成非重叠时间 patch;所有模态在进入模型前都先减去无接触参考帧。
  • 四组件架构:
  • Encoder $\mathcal{E}_i$:传感器专属,光学用 ViT、阵列用 self-attention transformer,把 token 编码为统一维度 embedding。
  • Shared Trunk $\mathcal{T}$:所有传感器共用一个 Transformer trunk,处理统一维度的 token embedding。
  • Decoder $\mathcal{D}i$:传感器专属,从可见 token 经过 trunk 后的 embedding 重建被遮蔽 token,标准 MAE 目标 $\mathcal{L}{\text{MAE}} = \mathbb{E}_{i\sim\mathcal{I}}|\mathcal{D}_i(\mathcal{T}(\mathcal{E}_i(\mathbf{x}^i_v))) - \mathrm{norm}(\mathbf{x}^i_m)|_2^2$。
  • Predictor $\mathcal{P}_{i\to j}$:跨模态预测器(cross-attention transformer),从源传感器完整 embedding + 目标传感器可见 embedding 预测目标被遮蔽的 embedding,对每对传感器做双向。
  • 跨模态对齐:成对传感器 (i, j) 上做双向跨模态预测,把"补全对侧被遮蔽的部分"作为额外监督;这强制 trunk 学到能跨传感器迁移的潜空间。
  • 训练数据:HPT 包含 1.6M 同步帧,用两对 sensor pair(Xela↔9DTact, TAC-02↔GS Mini)装在 UMI 夹爪两侧做 press/twist/slide 三种动作采集,预训练集和评测集无重叠。
  • 数据子集:除预训练 paired unlabeled interaction 数据外,评测另设物体分类(20 类日常物体)、力估计(4 种 probe geometry + 6D F/T 真值,范围 0–40 N 法向 / 0–14 N 剪切)、滑移检测(用 Page CUSUM 把 6D 力时间序列切成 static / incipient / gross slip,分布 13.6% / 1.2% / 85.2%,稀有类极不均衡)。
Figure 2: 力/滑移数据采集与数据集统计。A1 探针平台 + 6D F/T;A2 四种 probe geometry;B1 力范围;B2 滑移标签分布严重不均衡。
Figure 2: 力/滑移数据采集与数据集统计。A1 探针平台 + 6D F/T;A2 四种 probe geometry;B1 力范围;B2 滑移标签分布严重不均衡。

关键要点

  • 共享 trunk 只负责跨传感器语义,输入编码器和重建解码器仍保持传感器专属;这种分工避免用一种 tokenization 强行统一图像式和阵列式触觉。
  • 跨模态监督来自同一次接触的同步配对数据,不需要人工标签;masked reconstruction 保留模态内部细节,双向预测再对齐不同传感器的潜表示。
  • 对齐并非对所有传感器都单调增益:光学侧提升明显,Xela 等稀疏阵列侧可能因信息不对称而退化,因此下游采用前仍需逐传感器验证。

结果

  • 物体分类(4 传感器 20 类 top-1 acc,表 1):HTT 在 9DTact 上 94.84 ± 1.61%、GSMini 上 91.35 ± 1.08%,比最强光学 baseline SITR 分别高 13.5% / 17%;Xela 52.41%、TAC-02 26.20%,对阵列传感器是首次给出可比结果(baseline T3/SITR 不能用)。MAE(只重建,不对齐)在 9DTact 上 90.08%——加跨模态对齐再涨 4.8%,证明对齐项本身对光学侧有增益。
  • 力估计(3D 力 MAE,表 2/4):HTT 在 Xela、9DTact、GSMini 上均给出与 MAE-only 接近或更低的整体 MAE,但 TAC-02 略差(异构能力不均衡)。剪切分量上对齐带来的提升最明显。
  • 滑移检测(macro-F1,表 2/5):滑移标签严重不均衡(static 13.6% / incipient 1.2% / slide 85.2%),HTT 在多数传感器上 macro-F1 优于 baseline;阵列侧提升比光学侧更显著,因为 incipient slip 这种弱信号恰恰是阵列传感器的强项。
  • 真实机器人任务(表 3):在 toy screw 和 grasp tofu 上用 HTT 编码器作为策略 backbone,平均 50 个 rollout × 3 seed 的任务成功率显著优于 Scratch、MAE-only 和光学专用 baseline,且使用的是 pretraining 时未出现的 Sharpa 手指触觉传感器——直接验证 Q5(对新传感器的迁移)。
  • 消融对比:HTT vs MAE(ours)vs Scratch 三档干净分离 MAE 自监督和跨模态对齐各自贡献:MAE 主要提升所有传感器分类;跨模态对齐对光学侧进一步提升、对阵列侧在小数据下会略有牺牲(信息不对称的代价)。

洞察

  • "成对 + 跨模态预测"是把异构传感器塞进同一个 trunk 的可行套路:和语言-图像 CLIP 不同,这里监督信号来自"同一接触的多视角同步记录",无需人工标注,比所有传感器独立做 MAE 都更便宜地把 trunk 推向跨传感器共享语义。
  • 共享 trunk + sensor-specific encoder/decoders 的解耦:保留了每个传感器的局部细节(解码器专属),同时在 trunk 上建立共享语义——这是"既能重建又能对齐"的关键。
  • 信息不对称是真实代价:光学富信息传感器从对齐中获益明显,阵列稀疏信号反而可能在双向预测里被光学淹没(Xela 出现 −4.3%)。这暗示跨模态对齐需要 imbalance-aware 的损失设计,或在训练时对信息密度低的 modality 加权。
  • 相对 Tactile Genesis(仿真平台对比触觉抽象选择):HTT 不选硬件配置,而是为已经存在的异构硬件学共享 backbone;两者互补。
  • 相对 T3 / SITR 等光学专用 MAE:HTT 是首个把跨模态对齐显式加入 MAE 框架并同时覆盖光学 + 阵列的触觉 backbone。
  • 相对通用多模态基础模型(CLIP / ImageBind):监督信号是"同一接触的多传感器同步"而不是"图像-文本对",没有文本侧,更接近 sensor-only 多模态对齐。
  • "成对多模态 + masked autoencoder + 跨模态预测"模板可以直接套到其他多模态机器人感知(视觉+触觉、触觉+本体等)。
  • 对触觉下游任务,使用时序窗 + 减参考帧的统一输入规范,是让不同传感器在 backbone 里行为可比的简单有效手段。
  • 在迁移到未见过的新传感器时,"只用 encoder + trunk、换掉 sensor-specific 输入适配"是低成本路径。

风险与判断

局限

  • 跨模态对齐在光学-阵列配对上带来 Xela 分类准确率 −4.3% 的回退,信息密度不均衡下双向预测会偏向富信息模态,损失设计未做 imbalance 校正。
  • 仅在 4 种传感器 + 2 对 sensor pair 上验证,未涵盖电容、压电、视触融合等其他触觉模态;传感器泛化结论限于论文范围内。
  • HPT 数据全部在 UMI 夹爪 + 桌面接触场景下采集,复杂接触(高速冲击、柔性物体、多指协同)的迁移性未验证。
  • 滑移检测数据集 incipient slip 仅 1.2%,极不均衡,评测 macro-F1 虽改善但在实际部署中误报成本可能仍高。
  • 全部实验基于单时间窗 τ = 0.2 s,没有显式建模更长程时序依赖。

适用场景

  • 给已有多种触觉传感器(特别是光学 + 阵列混合)的机器人平台训练一个共享 backbone。
  • 缺少大规模标注触觉数据时,需要自监督预训练来冷启动下游感知任务(分类、力、滑移)。
  • 触觉传感器未来会迭代,希望 backbone 能跨硬件版本迁移。
  • 仿真(ManiFeel)+ 真实机器人端到端策略学习,触觉编码器作为策略观测的一部分。

最终判断

  • 是一篇值得记入知识库的论文:把"异构触觉 + 自监督"这件事做到了能落地于下游感知和真机操作的程度,数据集 HPT 也公开。
  • 学术增量:把多模态 MAE 的思路搬到触觉域并补了"成对同步数据 + 双向跨模态预测"这个新组合;不是纯架构创新,但是工程上有用的"开箱即用 backbone"。
  • 对当前具身智能研究的实际价值:中等偏高。短期内会成为"异构触觉预训练"的参照 baseline,未来若 Tactile Genesis + HTT 类工作成熟,会推动"触觉 backbone + 策略"成为标准组件,类似 vision-language 的 ViT/CLIP 路径。
  • 跟踪价值:① 是否会扩展到视触融合、电容式触觉;② imbalance-aware 对齐是否能补回阵列侧的损失;③ 是否会被纳入 VLA 或具身 foundation model 作为标准触觉编码器。

Tactile Representation

触觉与力觉如何从传感设计、跨硬件共享表示,进入预训练策略的持续适配、快慢控制与执行期流式闭环。

打开主题

继续阅读

上一篇

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Qwen-RobotManip 的核心不是“再堆更多机器人数据”,而是先把不同机器人在**表示、运动和行为**三个层面拉到同一坐标系,再讨论规模化。论文最有价值的证据是:统一动作表示后,跨具身数据在 OOD 验证误差和下游成功率上才出现清晰的规模趋势;但“只用公开数据”的说法只适用于 manipulation corpus,完整训练还混入了含 proprietary data 的 VL 数据。

下一篇

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

这篇论文最值得记住的不是“给 VLA 加一条触觉输入”,而是它把新模态接入表述成 continual learning:在少量新 contact-rich 数据上学会用 force,同时尽量不破坏旧的视觉动作能力。MuSe 的价值在于,它用 multisensory future prediction 和 replay 证明,旧任务上即使没有力标注,也能把力学结构以可迁移的方式对齐进预训练策略;真正的短板则是仍依赖离线适配和专门的 compliance 控制接口,而不是端到端解决全闭环接触控制。