TenStep

Tactile Representation

材料 6 综述 1 更新 2026-08-30

触觉与力觉如何从传感设计、跨硬件共享表示,进入预训练策略的持续适配、快慢控制与执行期流式闭环。

正文

Tactile Representation

跟踪触觉与力觉从传感器选择、共享表示,到预训练策略适配和执行期反馈的完整接口链。

这条主题在讲什么

触觉是接触丰富操作的关键观测,但传感器天然异构:光学式(GelSight 类)给稠密空间信息但帧率受限,阵列式或 F/T 传感器给高频力学信号但空间结构更弱。问题也不止是学一个 backbone:旧的视觉策略通常没有触觉标签,动作生成器又可能在执行前一次性定稿。本主题因此追踪一条连续问题线——如何选传感信号、学习可迁移表示、把新模态接入已有策略并在执行时及时使用它。

为什么重要

  • 触觉是 vision-language-action 模型目前缺的那一路高密度接触信号
  • 没有可迁移的触觉 backbone,每次换传感器都要重训策略
  • 触觉仿真(Tactile Genesis 类)和真实采集(HTT 类 HPT)正在互相补齐基础设施
  • 即使表示可用,策略仍需同时解决旧数据缺失新模态、灾难性遗忘和反馈时效性

当前理解

子问题 代表材料 立场
触觉硬件配置(位置/分辨率/类型)如何选? tactile-genesis-exploring-tactile-sensors-at-scale-for-learning-dexterous-tasks 覆盖面积优先于分辨率;per-taxel 力/力矩在大多数灵巧任务里最稳健
异构传感器如何共享 backbone? 2606.29948-heterogeneous-tactile-transformer sensor-specific encoder + shared transformer trunk + 跨模态预测对齐;MAE 重建 + 双向跨模态预测
触觉 backbone 能否迁移到训练时未见的传感器? 2606.29948-heterogeneous-tactile-transformer 已在未出现的 Sharpa 触觉指尖上验证 toy screw / grasp tofu 上的成功率显著提升
旧数据没有 F/T 标注时,预训练策略如何吸收新模态而不遗忘? 2606.30988-multisensory-continual-learning-adapting-pretrained-visuomotor-policies-to-force Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force
高频力/触觉怎样决定动作的精确落点? Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation action-only encoder 学高层 latent,触觉/力只进入 decoder;低维瓶颈让实时接触信号承担亚毫米级位置细节。
高频触觉如何与低频 VLA 协同? t-rex-tactile-reactive-dexterous-manipulation T-Rex: Tactile-Reactive Dexterous Manipulation
动作 chunk 执行期间,最新触觉如何继续修改未来动作? 2608.25798-tacforcing-streaming-action-generation-with-execution-time-tactile-feedback TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback

关键设计要点

  • 统一输入规范:时序窗 τ + 减参考帧,让不同采样率、不同维度的传感器在 backbone 内行为可比。
  • 跨模态监督源:利用"同一次接触被多传感器同步记录"作为天然对齐信号,无需人工标注。
  • 解耦结构:sensor-specific encoder/decoder + shared trunk,让每个传感器保留局部细节、共享语义进入统一潜空间。
  • 非对称条件解码:RDP 让 action encoder 看不到力,只让 fast decoder 读取最新 wrench/触觉,并限制 latent 容量,使高层动作意图与接触期精确落点分工。
  • imbalance 风险:光学-阵列配对中,光学富信息会主导跨模态预测,阵列侧会出现 −4.3% 这种回退;需要 imbalance-aware 损失。
  • 持续适配接口:MuSe 用缺失模态 mask、旧数据 replay 和未来多感官预测,让没有 F/T 标签的预训练数据仍能约束新模态适配,避免只在新任务上微调造成旧能力塌陷。
  • 多速率控制接口:T-Rex 把低频视觉规划和高频触觉细化放在同一 flow 轨迹上,说明表示进入策略后还需要清楚的频率分工。
  • 时间作用域接口:触觉更新不应无条件广播给所有未来动作;TacForcing 用 EATA 让当前触觉只影响下一动作块,并把更远动作保留为待后续触觉修订的中间态。

当前判断

这几条路线不是互相替代的模型技巧,而是同一条系统链上的不同层:Tactile Genesis 决定“感什么”,HTT 解决“跨硬件怎样表示”,MuSe 解决“怎样把新模态接进已有策略且不忘旧能力”,T-Rex 与 TacForcing 再回答“执行时怎样及时改动作”。当前证据已经说明静态拼接不足,但还没有一个系统同时证明跨传感器迁移、持续适配、旧任务保持和低延迟闭环。

未解决问题

  • 异构 backbone 在纯阵列平台(无光学传感器)上是否仍可工作?
  • imbalance-aware 跨模态对齐是否能同时拿回阵列侧的损失?
  • 触觉 backbone 与 VLA 拼接的最优接口是什么(per-token fusion vs late fusion vs dual-stream)?
  • MuSe 的 replay + missing-modality mask 能否扩展到多个依次到来的新传感器,而不让回放成本随模态数量持续增长?
  • T-Rex 的双专家异步细化与 TacForcing 的单专家流式生成,在哪种算力、延迟和任务时域下各自更合适?
  • 单一流式专家已证明执行期更新与 EATA 有效,但论文尚未报告 block size、推理延迟、触觉采样延迟和等算力对比,不能据此判断真实闭环效率。
  • 触觉预训练需要多少跨传感器配对数据才能让 backbone 真正可迁移,而不是只适配原 4 种?

相关页面

相关材料

Tactile Genesis: Exploring Tactile Sensors at Scale for Learning Dexterous Tasks

Tactile Genesis 用大规模仿真比较触觉设计:先扩覆盖,再选类型,最后加分辨率。

Heterogeneous Tactile Transformer

HTT 是面向异构触觉传感器的自监督预训练框架:四种传感器共享同一个 Transformer trunk,靠 masked reconstruction + 双向跨模态预测把光学和阵列信号对齐到同一潜空间,并在未见过的新传感器上验证可迁移。

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

这篇论文最值得记住的不是“给 VLA 加一条触觉输入”,而是它把新模态接入表述成 continual learning:在少量新 contact-rich 数据上学会用 force,同时尽量不破坏旧的视觉动作能力。MuSe 的价值在于,它用 multisensory future prediction 和 replay 证明,旧任务上即使没有力标注,也能把力学结构以可迁移的方式对齐进预训练策略;真正的短板则是仍依赖离线适配和专门的 compliance 控制接口,而不是端到端解决全闭环接触控制。

Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation

RDP 的关键不是“把力塞进 Diffusion Policy”,而是把力放到正确的时间尺度和网络位置:低频 latent diffusion policy 负责生成约 0.67 秒的高层动作块,快速 asymmetric tokenizer 则以 24 FPS 读取最新触觉或六维 wrench,把潜在动作解码成末端相对位姿。模型不输出目标力、阻抗或力矩,学到的是“看到这种受力与任务阶段时,位置应该再压入、退出还是沿曲面移动一点”。 这正面回应“小位移很难学、策略浮在表面”的问题。论文观察到有效修正确实只有亚毫米级:削皮器受力突增时向上卸力,接近黄瓜末端时向下压入以继续贴面,双臂夹杯接触后向外修正以免压瘪。真正决定能否学到的不是位移绝对值,而是示范中是否有稳定的“力变化—微位移—接触结果”相关性,以及训练、推理和机器人执行是否在时间上对齐。

T-Rex: Tactile-Reactive Dexterous Manipulation

T-Rex 的关键贡献不是把触觉当作又一种静态输入,而是让现有 VLA 的低频视觉动作规划与高频触觉修正协同工作。它用 22889 小时人类第一视角视频预训练、100 小时触觉同步机器人数据中训练和约 100 条任务示范后训练,在 12 个真实双手灵巧任务上达到 65% 平均成功率,相比最强基线 EgoScale 的 35% 高出 30 个百分点。结果很强,但目前仍是单一硬件平台上的研究级验证。

TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback

TacForcing 解决的不是“VLA 能否看到触觉”,而是“动作块执行到一半时,最新触觉能否继续改写尚未执行的动作”。它把一个动作 chunk 拆成顺序完成的块,保留未来块的 flow-matching 中间态,并用执行后新采集的触觉继续细化;EATA 只让最新触觉影响下一块,避免它提前污染更远期动作。六个 UniVTAC 仿真任务平均成功率 65%,三个真机任务平均 69%,但 v1 的真机评测每任务仅 16 次,尚不足以证明跨硬件泛化或实时成本优势。

相关综述

触觉与力觉如何进入预训练机器人策略:表示、持续适配与执行闭环

五篇材料共同勾勒出触觉与力觉进入机器人基础策略的四层栈:传感设计、跨硬件表示、无遗忘持续适配,以及与动作生效时间对齐的执行闭环。