TenStep

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

Jaden Clark · Changhao Wang · Yihuai Gao · Seongheon Hong · Hojung Choi · Mark Cutkosky · Yifan Hou · Shuran Song

首要单位:Stanford University Stanford University

一句话结论

这篇论文最值得记住的不是“给 VLA 加一条触觉输入”,而是它把新模态接入表述成 continual learning:在少量新 contact-rich 数据上学会用 force,同时尽量不破坏旧的视觉动作能力。MuSe 的价值在于,它用 multisensory future prediction 和 replay 证明,旧任务上即使没有力标注,也能把力学结构以可迁移的方式对齐进预训练策略;真正的短板则是仍依赖离线适配和专门的 compliance 控制接口,而不是端到端解决全闭环接触控制。

摘要

中文摘要

本文研究一种多感官持续学习问题:机器人策略先在大规模视觉-动作数据上预训练,但这些数据没有力/力矩标注;随后需要在少量新任务的多感官数据上适配出接触能力,同时保留原有任务表现。作者提出 MuSe,通过早期 token 融合与后期 cross-attention 融合把高频 force-torque 观测接入预训练 visuomotor world model,并联合预测未来动作、未来视频和未来力信号。训练时,预训练任务上的缺失力信号用可学习 mask token 替代,并配合 experience replay 防止遗忘。实验显示,MuSe 在前向迁移、后向迁移和跨模态力预测上都优于弱融合、无 replay 和 diffusion policy 基线,并能把预测力信号作为 adaptive compliance 控制的虚拟目标用于真机接触操作。

英文摘要

Robot manipulation often relies on sensory feedback beyond vision, particularly in contact-rich settings where force, tactile, or audio signals reveal interaction states that are not directly observable from images. However, these modalities are often hardware- and task-specific, and large-scale multisensory robot datasets remain scarce. As a result, it is impractical to pretrain policies with every sensor they may encounter. We study multisensory continual learning: adapting a pretrained robot policy to new tasks with newly introduced modalities while preserving performance under the original sensor suite. We propose MultiSensory World Model (MuSe), which incorporates limited multisensory data into pretrained vision-only policies through multi-stage fusion, multisensory future prediction, and experience replay over pretraining data. We instantiate MuSe by augmenting a pretrained vision-only policy with force-torque sensing and evaluate it on real-world manipulation tasks. Our experiments show that MuSe performs strongly on contact-rich finetuning tasks while preserving, and in some cases improving, performance on the original pretraining tasks. These results suggest that a modest multisensory dataset can improve general robot capabilities beyond the finetuning distribution. Project website: https://jadenvc.github.io/multisensory-continual-learning/

直观理解

可以把 MuSe 理解成给一个已经会“看着做”的机器人老师补上一层接触常识。它不是直接拿少量力觉数据硬微调整套策略,而是让模型一边继续记住旧任务的视频世界,一边学会从视觉和动作上下文推断未来会感到多大的力,再把这份预测过的接触轨迹交给下游 compliance controller 去吸收执行偏差。

主要图

主要图

主要图
主要图

背景与问题

为什么做

机器人基础策略如今已经能通过大规模 vision-action 预训练获得较好的视觉泛化,但大量真实有价值的接触操作——擦拭、插接、按压、peg-in-hole、抓取后接触修正——都依赖高频力/力矩反馈。问题在于,历史预训练数据通常没有力传感器标注,而重新大规模采集多感官数据又昂贵且任务覆盖窄。如果每次引入新传感器都从头训练,就会丢掉已有 visuomotor 先验;如果只在新任务上强行微调,又很容易遗忘旧任务,形成一个典型的 multisensory continual learning 难题。

问题缺口

现有把触觉或力觉接进机器人策略的方法,大多默认从一开始就有多感官训练数据,或者只关注新任务上的 specialist 提升,而不回答“如何把新模态无缝嫁接到一个已经预训练好的视觉动作策略上”。这带来三层缺口:第一,预训练阶段旧数据没有力标签,模型如何避免把缺失模态当噪声;第二,适配新感官后如何保持旧任务能力,避免 catastrophic forgetting;第三,即便模型学会预测力,怎样把它转化为执行期真正有用的接触控制信号,而不是只停留在表征层面对齐。

方法

方法概述

MuSe 把“预训练视觉动作策略如何安全吸收新触觉模态”拆成多阶段融合、跨模态未来预测和 experience replay 三件事:先用 token 级早融合和 cross-attention late fusion 把高频 force-torque 接进既有 visuomotor backbone,再联合预测动作、未来视频与未来力信号,让模型不仅学会控制,也学会在原先没有触觉监督的旧任务上补全接触动力学,从而在 forward transfer 与 backward transfer 上同时优于不带 replay、弱融合和 diffusion-policy 基线。

核心机制

MuSe 以预训练的 MAR-Large visuomotor world model 为骨干,把 multisensory adaptation 设计成“结构化接入 + 未来预测 + replay 保形”三件配套机制。结构上,它先用 modality-specific encoder 编码图像、语言、动作、状态与双指 force-torque 历史,再在 token 级做 early fusion,同时额外加入一组对 F/T history 做 late fusion 的 cross-attention adapter,让模型既能把力信号当作时序上下文融入全局,又能保留一条专门服务接触细节的高带宽旁路。监督上,它不是只学下一个动作,而是同时预测未来动作、未来视频和未来 6 轴力信号,迫使隐状态对接触动态形成可迁移的世界模型。持续学习上,作者把旧 pretraining episode 通过 experience replay 混入 finetuning,并用 learnable mask token 占位缺失 F/T,再屏蔽对应力损失,使模型在适配新模态时仍保有旧分布的视觉动作先验。

方法拆解

  • 输入侧保留 MAR 的 4 帧视觉历史与 16 步动作历史,同时加入左右手同步的高频 force-torque 序列;每个 proprio 时间步聚合 6 个六维 wrench,形成 144 维 F/T 向量并经 MLP 投到 1024 维 token 空间。
  • 融合侧采用双路径设计:一条是把 F/T token 与图像、语言、状态一起做早融合,让接触信号进入统一世界模型;另一条是专门的 cross-attention late-fusion adapter,让 decoder 在生成未来时显式读取 F/T memory,弥补单一路径对高频接触信息建模不足。
  • 训练目标同时覆盖 16 步未来动作、4 帧未来视频和每个手指 96 个未来 F/T 样本;视频预测让隐状态继续锚定原先的视觉动力学,F/T 预测则要求模型学会从视觉接触上下文补全未来力学演化。
  • 持续学习阶段把 1,271 条无 F/T 的预训练 episode 与 434 条带 F/T 的新任务 episode 混合训练;旧数据的力通道用 learnable mask token 代替,并关闭 F/T reconstruction loss,只保留动作与视频目标,从而以 parameter-efficient 方式维持旧任务能力。
方法图
方法图

关键要点

  • MuSe 真正有效的不是简单多模态拼接,而是把 F/T 接入同时设计成表示融合问题和未来预测问题;如果去掉 video prediction 或 replay,模型对旧任务接触动力学的泛化都会明显变差。
  • 论文把 predicted future F/T 直接送入 adaptive compliance controller,说明它追求的不是“读出一个好看的 latent”,而是为执行器提供可操作的虚拟接触目标,这让 world model 表征和下游控制闭上了环。

结果

  • 在前向迁移的新接触任务上,MuSe 的成功率整体高于对比基线:wiping 任务在 15 次评测中达到 11.5 次成功,高于 No F/T 的 5 次、No Pretrain 的 8 次和 diffusion policy 的 10 次;peg 任务达到 13/15,高于对应基线的 9/15、6/15 和 10/15。
  • 在后向迁移的旧任务保持上,MuSe 的成功率同样更高:wiping 为 12.5/15,显著高于 pretraining-only 的 8.5/15、No ER 的 0.5/15 和 diffusion policy 的 6.5/15;peg 为 10/15,也高于 8/15、2/15 和 5/15,说明 replay 对避免遗忘有决定性作用。
结果图
结果图
结果图
结果图

洞察

  • MuSe 的结果提示,力觉的最大价值未必只是在执行时提供纠偏,而是在训练时迫使模型学习接触动力学。模型一旦能在旧任务上从视觉上下文预测出合理 F/T 轨迹,说明接触已经被编码成了可迁移的结构知识,而不是某个任务特定的控制 hack。
  • 把辅助模态的未来预测结果直接对接到下游控制模块,是一种比只做 representation probing 更有工程价值的验证方式;它迫使附加模态既要可预测,也要可执行。
洞察图
洞察图

风险与判断

局限

  • MuSe 解决的是“把新力觉模态接进既有 world model 并保持旧能力”,不是完整的实时闭环接触控制方案;最终执行仍依赖外部 adaptive compliance controller 去吸收接触偏差,所以性能上限部分取决于控制器设计而不只取决于表示学习本身。
  • 实验规模虽然覆盖 21 个预训练任务与 5 个带 F/T 新任务,但多感官 finetuning 数据仍只有 434 条 episode,且主要围绕双指夹持与少数接触丰富任务;对更复杂多接触、非抓取操作或不同力传感器形态的泛化证据还不够。

适用场景

  • 适合已经积累了大量 vision-action 预训练数据、但近期才开始在少数高价值接触任务上加装 force-torque 传感器的团队,例如擦拭、装配、peg-in-hole、按压和 compliant insertion 等接触密集操作。
  • 也适合把 world model 当中间层、下游仍保留经典 compliance / impedance controller 的系统,因为 MuSe 产出的 future F/T target 可以自然变成 controller 的参考信号。

最终判断

  • 值得持续跟踪。这篇论文不是单纯证明“力觉有用”,而是给出了一个把新感官迁移进预训练策略、同时避免旧能力塌陷的可复用模板。若后续要做触觉/音频/事件相机等新模态接入 foundation policy,MuSe 的 replay + masked missing modality + future prediction 组合很可能是比直接全量微调更稳的起点。

Vision-Language-Action

VLA 从开放基座、多源数据、在线精修和长时程记忆,继续扩展到新感官模态的持续适配与执行期闭环。

打开主题

Tactile Representation

触觉与力觉如何从传感设计、跨硬件共享表示,进入预训练策略的持续适配、快慢控制与执行期流式闭环。

打开主题

继续阅读

上一篇

Heterogeneous Tactile Transformer

HTT 是面向异构触觉传感器的自监督预训练框架:四种传感器共享同一个 Transformer trunk,靠 masked reconstruction + 双向跨模态预测把光学和阵列信号对齐到同一潜空间,并在未见过的新传感器上验证可迁移。

下一篇

STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning

STEAM 值得记住的点,是它把真实机器人数据清洗问题改写成“逐帧 advantage 建模”:不用人工奖励、不用 VLM 打分,也不假设整条轨迹好坏一致,而是从专家轨迹内部的时间顺序中学习哪些 frame pair 代表推进、停滞或倒退。它尤其适合 VLA/机器人策略在真实 rollout、人工纠正和混合质量数据上继续提升:先找出真正推进任务的局部片段,再把这些片段作为 CFGRL 的高质量训练信号。