Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation
Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation
Han Xue · Jieji Ren · Wendi Chen · Gu Zhang · Yuan Fang · Guoying Gu · Huazhe Xu · Cewu Lu
一句话结论
RDP 的关键不是“把力塞进 Diffusion Policy”,而是把力放到正确的时间尺度和网络位置:低频 latent diffusion policy 负责生成约 0.67 秒的高层动作块,快速 asymmetric tokenizer 则以 24 FPS 读取最新触觉或六维 wrench,把潜在动作解码成末端相对位姿。模型不输出目标力、阻抗或力矩,学到的是“看到这种受力与任务阶段时,位置应该再压入、退出还是沿曲面移动一点”。 这正面回应“小位移很难学、策略浮在表面”的问题。论文观察到有效修正确实只有亚毫米级:削皮器受力突增时向上卸力,接近黄瓜末端时向下压入以继续贴面,双臂夹杯接触后向外修正以免压瘪。真正决定能否学到的不是位移绝对值,而是示范中是否有稳定的“力变化—微位移—接触结果”相关性,以及训练、推理和机器人执行是否在时间上对齐。
关键词
摘要
中文摘要
人类可以结合视觉与触觉完成复杂接触任务,并快速响应外界变化、适应性调节接触力;机器人仍难做到。现有视觉模仿学习依赖动作分块表达复杂行为,却无法在动作块执行期间立即响应实时触觉,而且常见遥操作系统也难以提供细粒度力/触觉反馈。论文提出低成本 AR 遥操作系统 TactAR,以及快慢视觉—触觉模仿学习算法 RDP:低频 latent diffusion policy 在潜空间预测高层动作块,高频 asymmetric tokenizer 根据最新触觉闭环解码位置动作,从而在一个框架内兼顾复杂轨迹生成与快速反应。三项接触密集任务的实验显示,RDP 明显超过视觉模仿学习基线,并兼容不同触觉与力传感器。
英文摘要
“Humans can accomplish complex contact-rich tasks using vision and touch, with highly reactive capabilities…”
英文摘要要点:现有视觉模仿学习虽然能借助 action chunk 建模复杂行为,却不能在块执行期间即时利用触觉。论文提出 TactAR 数据采集系统和 RDP 快慢视觉—触觉模仿学习框架,用低频潜扩散生成高层动作块、用高频非对称 tokenizer 完成闭环触觉修正,并在三项真实接触任务和多种触觉/力传感器上验证。
直观理解
把慢策略想成先写出一段“大方向正确”的动作草稿:拿起削皮器、接近黄瓜、沿长度方向移动。普通 action chunk 一旦开始执行,即使力已经变化,后半段草稿仍照抄,因此会浮在表面、压得过深或丢失接触。RDP 的快策略像一名只负责手感的校稿员,每一帧都用最新力把下一步末端位置微调一点;力是条件,位置仍是动作输出。
这条路线适合不想依赖厂商力控接口的机器人,但它并没有消除底层控制要求。主动接触力最终仍来自“位置偏置 × 机器人与环境的等效刚度”,所以需要稳定的位置/阻抗伺服、限速限力和异常撤离保护;RDP 本身不提供显式力跟踪或稳定性保证。

图 1:左侧 TactAR 用 AR 向示教者反馈力/触觉,右侧 RDP 用慢策略生成潜在动作块、快策略根据最新接触反馈修正位置。
背景与问题
为什么做
Diffusion Policy、ACT 等方法用 action chunk 缓解长序列误差累积,并能表达停顿、振荡和多模态行为;代价是动作块一旦开始执行,就在约 0.67 秒内近似开环。接触密集任务中的物体扰动、曲面变化、滑移和受力尖峰发生得更快,而真正有效的动作调整往往只有亚毫米级。只在动作块开头读取一次力,或者只把触觉拼到低频观察中,都会让接触反馈在真正执行到后半段时失效。
问题缺口
直接缩短 chunk 可以提高重规划频率,却会破坏示范中的非马尔可夫结构;论文消融中,chunk 从 8 缩到 2 后,擦拭任务的抓取成功率从 100% 跌到 20%。Temporal ensemble 虽然形成半闭环,却对平滑系数非常敏感,并可能抹掉多模态动作。论文因此要同时保住两种能力:慢网络对长动作、停顿和多模态轨迹的生成能力,以及快网络在 chunk 执行期间依据最新触觉或力即时修正下一位置动作的能力。

图 5:RDP 不缩短高层动作时域,而是在同一个动作块内部增加高频反馈解码。
方法
方法概述
RDP 分两阶段训练。第一阶段只用动作块训练快速非对称 tokenizer:1D-CNN encoder 把真实末端轨迹压成低维 latent action,GRU decoder 再结合对应时刻的触觉 PCA 表示或六维 wrench 重建原动作。第二阶段冻结这一动作表示,用低频 latent diffusion policy 根据图像、触觉/力和本体状态预测 latent action chunk。推理时慢策略约 1–2 Hz 生成高层潜在动作,快策略以 24 FPS 用最新接触反馈重新解码下一位置动作,最后由 Flexiv RDK 插值并以超过 500 Hz 发送。
核心机制
非对称结构刻意不让 encoder 看触觉或力,只允许 decoder 使用它。这样,低维潜变量更适合保存任务阶段、运动方向和多模态轨迹,而示范中与瞬时接触相关的精确位置必须由 decoder 结合实时反馈恢复。训练目标不是目标力,而是动作重建:L1 位置/姿态重建损失加很小的 KL 正则;慢策略再以 DDPM 噪声预测目标学习 latent action 分布。它没有数学上保证网络一定利用力,但低维瓶颈、动作下采样和 decoder-only 条件共同提高了利用高频反馈的压力。
方法拆解
- 力与触觉输入:RDP (Force) 直接把六维 TCP wrench(3D 力 + 3D 力矩)拼进观察向量;GelSight/MCTac 则从标记点形变场提取 PCA 特征,实践中保留 15 个主成分。
- 快速动作 tokenizer:动作块 (A\in\mathbb{R}^{T\times D}) 经 1D-CNN 压成 (Z=E(A)),GRU 用 (\hat A=D([Z,F])) 重建真实动作;训练损失为 L1 重建加系数 (10^{-6}) 的 KL 正则。
- 慢速 latent diffusion:FiLM 条件化的 1D U-Net 在潜动作空间做 DDPM 去噪。输入观察包含视觉、触觉/力和 proprioception,推理 8 个 diffusion steps,约 100 ms。
- 相对轨迹表示:动作不是相邻帧 delta,而是相对 action chunk 最后一个 observation 帧的末端轨迹,既减少连续 delta 的累积误差,也压缩了快策略需要学习的动态范围。
- 延迟匹配:估计推理与执行延迟,丢弃已经过时的前几步预测,避免“当前受力却执行旧位置”造成训练—部署时间错位和 chunk 交界处异常动作。
- 快慢执行频率:慢策略约 1–2 Hz;动作观察/预测为 12 FPS;快策略读取 24 FPS 的力/触觉并输出 24 FPS 位置动作;快网络单次推理低于 1 ms,理论计算上可超过 300 Hz。
关键要点
- 输出仍是末端相对位姿,不是目标力、刚度、导纳参数或关节力矩;主动施力由学习到的位置微调与底层伺服共同产生。
- 快策略不是单纯的 force → Δx 映射。latent action 和 GRU 历史携带任务阶段,因此同一种受力在“应该继续贴面”和“应该卸力”阶段可以得到不同修正。
- 默认 AT 预测窗口为 32 帧 @ 24 Hz,下采样比例 4;latent 维度很小,削皮为 4,擦拭和双臂抬杯为 8。这种容量限制是避免高层 latent 偷记所有亚毫米细节的关键工程选择。
- 论文明确在采集示范时主动加入 reactive behaviors;如果数据只有轻触后沿表面运动,没有“丢失接触后再压入”的动作,模型不会凭空学出主动施力。
结果
- Peeling 中,RDP Force 总分 0.95,视觉 DP 为 0.44;最难的接触后扰动设置中分别为 0.88 和 0.19,DP 加触觉 embedding 也只有 0.15。
- Wiping 中,RDP Force 总分 0.87,视觉 DP 为 0.57;接触后扰动下为 0.80 对 0.25。
- Bimanual Lifting 中,RDP Force 总分 0.70,视觉 DP 为 0.00;异构 GelSight + MCTac 组合也达到 0.48。
- 三项任务中 RDP 相对各类 Diffusion Policy 基线均提升超过 35%。GelSight 与 MCTac 在 Peeling 上分别为 0.90 和 0.88,说明结构可跨两种光学触觉;噪声更大的关节力矩估计版反而最好,作者推测原因是延迟更低、维度更小。
- 训练数据规模并不大:Peeling 60 条、Wiping 80 条、Bimanual Lifting 50 条示范。每种测试变化运行 10 次,并使用单盲评测。
洞察
- “位移太小”不是唯一问题,更常见的是监督被大范围接近/抓取轨迹淹没。RDP 用两阶段训练和低维 latent 把粗动作与接触微调分开,让 fast decoder 的主要工作正是重建那些无法由高层 latent 单独解释的细节。
- 高维触觉不一定比低维 wrench 更好。Force 版本虽然来自噪声较大的关节力矩估计,却在三项任务中最好;论文的合理解释是它延迟更低、维度更小。对闭环学习而言,反馈的新鲜度和可对齐性可能比表示精细度更重要。
- 主动施力与被动卸力可以由同一位置残差接口表达:削皮器在力突增时向上退,但在曲面末端又向下压。决定符号的不是力本身,而是 latent action 所代表的任务阶段和接触意图。
- Asymmetric tokenizer 只是结构性诱导,不是严格保证。若 latent 维度过大、示范太确定或力和动作时间错位,encoder 仍可能独自编码动作,decoder 继续忽略力。
- 相对普通 Diffusion Policy,RDP 不是只添加触觉观察,而是让力/触觉在 action chunk 执行期间持续参与高频动作解码。
- 相对 Adaptive Compliance Policy: Learning Approximate Compliance for Diffusion Guided Control,RDP 不输出目标力、刚度或虚拟目标;ACP 把柔顺参数交给高频导纳控制器,RDP 则用力输入学习末端位姿修正。
- 相对 T-Rex: Tactile-Reactive Dexterous Manipulation,RDP 是 action tokenizer + latent diffusion 的两阶段慢—快结构;T-Rex 则用共享 flow 轨迹上的视觉慢专家与触觉快专家。
- 相对 TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback,RDP 维护独立快速 decoder;TacForcing 在单一 streaming action expert 内保留未来动作中间态,并让执行期触觉只修正下一块。
- 对“不愿输出力”的平台,粗位置轨迹 + 高频受力条件位置残差是一种可执行接口。
- 可以用 decoder-only 条件和受限 latent 容量,迫使高频模态承担局部细节,而不是把所有模态无差别拼接。
- 评测应同时记录任务进展、接触保持、峰值力、扰动恢复和局部残差;仅看最终位姿或全轨迹 MSE 会漏掉亚毫米修正的价值。
风险与判断
局限
- RDP 是单任务模仿学习,只在 Peeling、Wiping 和 Bimanual Lifting 三项任务上验证;不能据此证明跨任务或开放世界泛化。
- 快策略只处理高频触觉/力,不能快速吸收图像变化;视觉层面的突发变化仍受慢策略 1–2 Hz 频率限制。
- TactAR 与实验平台围绕两指夹爪设计,没有灵巧手、多点接触和更复杂接触拓扑的实证。
- 论文没有显式目标 wrench、力误差损失、passivity 或闭环稳定性证明;主动接触力取决于位置命令、机器人伺服和环境刚度,换硬件后可能产生完全不同的力。
- 不对称瓶颈和 L1 重建没有从理论上保证 decoder 使用力;论文也未报告 force shuffling、modality dropout 或互信息类使用率诊断。
- 光学触觉内部延迟约 10–60 ms,TactAR 还有约 10 ms 标记追踪、10 ms AR 渲染和 1–6 ms 网络延迟;更换传感器与控制栈时需要重新做时间对齐。
适用场景
- 适合剥皮、擦拭、沿曲面跟随、轻压装配、稳握和双臂夹持等“宏观轨迹变化慢、接触反馈变化快”的任务。
- 适合已有视觉、本体和六维 wrench 输入,底层位置或阻抗伺服可靠,但不希望让学习策略直接输出目标力的机器人平台。
- 更适合作为受安全限幅保护的局部闭环策略,不应未经重新验证直接用于高速冲击、脆弱物体、强摩擦卡死或安全关键的人机接触。
最终判断
- RDP 是“力只做输入、动作仍是位置”路线中非常直接的证据:最简单的六维 wrench 输入配合正确的快慢结构,就能学到既会卸力、也会主动压入的亚毫米修正,而且在三项任务中优于更高维的光学触觉版本。
- 它真正解决的是 action chunk 内的反馈时效性与表示分工,不是通用力控制。若现有模型浮在表面,优先检查示范是否包含主动压入、fast residual 是否被大轨迹损失淹没、力与动作是否严格对齐,以及 latent 是否过强导致忽略力。
- 在工程上值得先复现一个最小版本:低维 slow latent + GRU fast residual、24–50 Hz wrench、接触片段均衡采样、局部坐标系残差和独立安全限幅;不要一开始就把目标力作为策略输出。
相关主题
继续阅读
上一篇
Adaptive Compliance Policy: Learning Approximate Compliance for Diffusion Guided Control
ACP 把柔顺性从低层控制器里的固定超参数提升为策略需要预测的动作变量:它从单条人体示范近似标注空间与时间变化的刚度方向和幅值,再由扩散策略结合视觉、位姿和力反馈生成。真实机器人翻转与花瓶擦拭分别达到 96% 和 93.75% 总成功率,显著超过固定柔顺和刚性位置策略。最值得记住的是它把接触约束转成可学习标签,但结论依赖慢速、轻物体、非夹持接触等明确假设。
下一篇
Emergence of Human to Robot Transfer in Vision-Language-Action Models
这篇论文的关键判断是:`human-to-robot transfer` 不是简单靠对齐技巧手工做出来的,而是会随着 VLA 预训练规模和多样性增长而“涌现”。也就是说,当机器人预训练覆盖足够多任务、场景和 embodiment 后,模型开始能够真正从 human video 中学到对机器人有用的东西。