TenStep

Contact-Rich Manipulation and Adaptive Compliance

材料 3 综述 0 更新 2026-09-01

接触密集操作中的运动—力联合学习路线:如何从示范与实时力/触觉反馈学习任务相关柔顺性和主动微位移修正,并在安全接触、轨迹精度与快速响应之间动态权衡。

正文

Contact-Rich Manipulation and Adaptive Compliance

这条路线研究机器人在持续接触中如何同时“走对轨迹”和“用对力”,并让柔顺方向与幅值随任务阶段、接触几何和扰动动态变化。

这条主题在讲什么

接触密集操作不是纯位置预测问题。刚性控制能压住轨迹误差,却可能把几毫米的视觉或标定偏差放大成巨大内力;各方向统一放软虽然降低碰撞风险,又会因摩擦和外力偏离目标。真正需要的是任务相关、方向相关、时间相关的柔顺性:接触前保证定位,接触后沿约束方向让步,在仍需追踪的方向保持足够刚度,并在几何变化或扰动出现时快速重估。

这个问题会反复出现在擦拭、翻转、插入、沿面跟随、装配、灵巧手和双臂协作中,因此它不是普通 tag,而是一条连接示教学习、力/触觉表示、动作生成和低层控制器接口的持续问题线。

为什么重要

  • 真实机器人误差不可避免,纯位置策略容易把误差转成危险接触力。
  • 固定均匀柔顺不能同时满足精确追踪和安全接触,柔顺性必须随方向与阶段变化。
  • 学习策略通常低频运行,稳定接触还需要高频导纳、阻抗或触觉反馈回路兜底。
  • 不同机器人开放的控制接口不同,动作表示是否能跨硬件执行会直接决定方法的工程价值。

当前理解

子问题 代表材料 当前证据
单条示范无法辨识完整人体阻抗时,怎样得到可学习标签? Adaptive Compliance Policy: Learning Approximate Compliance for Diffusion Guided Control 不恢复真实质量、阻尼和刚度;只构造满足避免巨大内力与鼓励轨迹跟踪两项性质的近似柔顺轮廓。
柔顺方向怎样表示? Adaptive Compliance Policy: Learning Approximate Compliance for Diffusion Guided Control 沿反馈力方向设低刚度、正交方向设高刚度;参考位姿与虚拟目标之差编码低刚度方向。
学习策略和低层控制器怎样分工? Adaptive Compliance Policy: Learning Approximate Compliance for Diffusion Guided Control 扩散策略滚动预测参考位姿、虚拟目标和刚度标量,高频导纳控制器执行重建后的刚度矩阵。
不显式输出目标力时,怎样学到主动接触修正? Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation 慢速 latent diffusion 规划 action chunk;快速非对称 tokenizer 用最新力/触觉条件化解码,在位姿动作空间产生亚毫米级闭环修正。
高频接触反馈还能怎样进入现代生成策略? Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich ManipulationT-Rex: Tactile-Reactive Dexterous ManipulationTacForcing: Streaming Action Generation with Execution-Time Tactile Feedback 三种接口分别是独立快速动作解码器、共享 flow 轨迹上的快慢专家,以及单一流式专家内可修订的未来动作块。
接触反馈怎样成为长期任务进度,而不只服务即时纠偏? FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation 用重建预训练的 Force-VAE 把完整 wrench 历史压成 8 个长期事件 token,再由约 0.9 秒的 state token 提供接触前运动上下文。

关键设计轴

  • 柔顺来源:解析接触模型、重复示范统计、单示范近似标签、强化学习探索,或执行期触觉修正。
  • 空间结构:统一标量刚度、逐轴对角刚度、完整六维刚度矩阵,还是由参考目标与虚拟目标隐式编码方向。
  • 时间结构:接触前预调、接触后响应、动作 chunk 内反馈更新、突发扰动恢复,以及跨整个 episode 的接触事件计数与进度记忆。
  • 策略—控制接口:策略直接输出力、刚度、导纳参数、虚拟目标,或只输出由独立高频控制器修正的位置动作。
  • 观测硬件:腕部六轴力矩适合估计整体接触方向,指尖触觉适合局部滑移与形变;二者的可迁移性、成本和带宽不同。
  • 评测目标:任务成功率之外,还应记录峰值力、工具/物体损坏、接触保持时间、轨迹误差和扰动恢复。

当前判断

ACP 给出了一个很有价值的最小接口:策略无需显式知道接触雅可比,只需从示范学习参考位姿、虚拟目标和刚度幅值,就能把方向性柔顺交给成熟低层控制器执行。它证明“柔顺性应该成为策略动作的一部分”,而不是部署时手工固定的控制器超参数。

但当前证据仍主要来自慢速、轻物体、非夹持接触和单一 UR5e 平台。后续路线需要把这一接口与高频指尖触觉、六维柔顺、跨硬件动作表示和在线恢复结合起来,才能判断它是否能从两项强演示扩展为通用接触操作方法。

FM-VLA 又补充了另一条轴:force 不仅是高频控制反馈,也可以成为低成本的 episodic memory。它在按钮计数和重复擦拭上显著胜过视觉记忆,说明接触策略需要同时设计快反馈与慢记忆;不过固定 8-token 压缩目前只在单一双臂平台、三项小规模任务上成立。

未解决问题

  • 接触力不再主导、摩擦或惯性显著时,沿合力方向放软是否仍是正确近似?
  • 多点夹持会违反非夹持锥假设,如何在不丢失抓持稳定性的情况下选择柔顺子空间?
  • 一秒后见平滑能提前标注接触,但突发碰撞没有未来信息;训练和执行之间的差异如何补偿?
  • 能否用低成本腕力估计、视觉接触估计或电机电流替代高端六轴力矩传感器?
  • 面向安全的评测怎样避免“刚性基线先损坏工具、因而无法完成统计”这种不完整比较?

相关页面

相关材料

Adaptive Compliance Policy: Learning Approximate Compliance for Diffusion Guided Control

ACP 把柔顺性从低层控制器里的固定超参数提升为策略需要预测的动作变量:它从单条人体示范近似标注空间与时间变化的刚度方向和幅值,再由扩散策略结合视觉、位姿和力反馈生成。真实机器人翻转与花瓶擦拭分别达到 96% 和 93.75% 总成功率,显著超过固定柔顺和刚性位置策略。最值得记住的是它把接触约束转成可学习标签,但结论依赖慢速、轻物体、非夹持接触等明确假设。

Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation

RDP 的关键不是“把力塞进 Diffusion Policy”,而是把力放到正确的时间尺度和网络位置:低频 latent diffusion policy 负责生成约 0.67 秒的高层动作块,快速 asymmetric tokenizer 则以 24 FPS 读取最新触觉或六维 wrench,把潜在动作解码成末端相对位姿。模型不输出目标力、阻抗或力矩,学到的是“看到这种受力与任务阶段时,位置应该再压入、退出还是沿曲面移动一点”。 这正面回应“小位移很难学、策略浮在表面”的问题。论文观察到有效修正确实只有亚毫米级:削皮器受力突增时向上卸力,接近黄瓜末端时向下压入以继续贴面,双臂夹杯接触后向外修正以免压瘪。真正决定能否学到的不是位移绝对值,而是示范中是否有稳定的“力变化—微位移—接触结果”相关性,以及训练、推理和机器人执行是否在时间上对齐。

FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation

FM-VLA 的关键不是给 VLA 再塞一种当前时刻传感器,而是把整段腕部力/力矩历史压缩成可供动作专家读取的长期事件记忆。它在找隐藏积木、精确计数按钮按压与碗内擦拭三项非马尔可夫任务上达到 83.3% 平均成功率,显著超过视觉记忆 π-MEM 的 53.7%,推理延迟仅比无记忆 π0.5 增加 3.3 ms。最值得记住的是“长时 force + 短时 state”的职责分工,但证据目前仍限于单一双臂平台和小规模任务。