TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback
TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback
Jianbo Zhou · Boyuan Zhao · Yuzheng Zhang · Yiyang Chen · Wenxin Chen · Qiuyue Li · Xiangyang Gu · Yuhan Cao 等
一句话结论
TacForcing 解决的不是“VLA 能否看到触觉”,而是“动作块执行到一半时,最新触觉能否继续改写尚未执行的动作”。它把一个动作 chunk 拆成顺序完成的块,保留未来块的 flow-matching 中间态,并用执行后新采集的触觉继续细化;EATA 只让最新触觉影响下一块,避免它提前污染更远期动作。六个 UniVTAC 仿真任务平均成功率 65%,三个真机任务平均 69%,但 v1 的真机评测每任务仅 16 次,尚不足以证明跨硬件泛化或实时成本优势。
关键词
摘要
中文摘要
接触密集型操作要求机器人适应在一个动作时域内可能发生显著变化的接触状态。然而,基于动作块的视觉—语言—动作模型会根据执行前采集的观测一次性预测完整动作块,使触觉条件在执行过程中逐渐过时。现有触觉响应方法通常依赖独立的高频控制器,增加了架构与训练复杂度。本文提出 TacForcing,一种能够有效利用执行期触觉反馈的流式动作生成框架。TacForcing 不再另设反应式控制器,而是用流式动作专家替换标准动作专家,使动作生成能够由执行期间不断变化的触觉观测来条件化。论文还提出执行感知触觉注意力 EATA,将触觉条件限制在即将执行的动作上,从而降低触觉采集与动作执行之间的时间错配。在六个 UniVTAC 仿真任务和三个真实接触密集型操作任务上,TacForcing 分别达到 65% 和 69% 的平均成功率,并超过强基线。
英文摘要
Contact-rich manipulation requires adapting to contact states that can evolve substantially within an action horizon. However, chunk-based vision-language-action models predict complete action chunks from observations collected before execution, leaving tactile conditioning stale during execution. Existing tactile-reactive approaches typically rely on separate high-frequency controllers, which increase both architectural and training complexity. In this paper, we introduce TacForcing, a streaming action-generation framework that effectively incorporates execution-time tactile feedback. Instead of employing a separate reactive controller, TacForcing replaces the standard action expert with a streaming action expert to generate actions conditioned on the evolving tactile observations acquired during execution. TacForcing also introduces Execution-Aware Tactile Attention (EATA), which restricts tactile conditioning to actions nearing execution, thereby reducing the temporal mismatch between tactile acquisition and action execution. Across six simulated UniVTAC tasks and three real-world contact-rich manipulation tasks, TacForcing achieves average success rates of 65% and 69%, respectively, outperforming strong baselines in both settings.
直观理解
背景与问题
为什么做
接触密集操作中的滑移、摩擦、形变和受力变化常被手掌或物体遮挡,视觉在短时域内几乎不变,触觉表示却可能快速漂移。论文在 40 个动作、1.17 秒的滴管挤压片段中测得:相对初始状态,最终视觉表示平均余弦距离约 0.005,而触觉表示约 0.55。这个百倍量级的动态差异说明,触觉不是可在 action chunk 开头读取一次后长期复用的静态条件。
问题缺口
标准 flow-based Action Expert 给整个动作块使用同一个生成时间,并在执行前一次性完成采样;因此执行中出现的新接触信息无法改变同一 chunk 内尚未执行的动作。简单把初始触觉拼入条件也会让它越来越陈旧,而已有快慢双控制器虽然响应及时,却引入额外策略、接口和训练流程。论文要解决的是:能否在单一生成专家内交错动作生成与执行,让最新触觉修正未来动作,同时避免当前触觉错误地影响更远期、届时接触状态已经变化的动作。
方法
方法概述
TacForcing 在 flow-matching VLA 中把长度为 H 的动作时域切成 K 个连续块,为不同块分配位置相关的 flow time;近期块先完成、先执行,远期块保留未完成的生成状态。每执行完一个块,模型重新编码最新触觉并从保留状态继续细化剩余块;EATA 通过注意力掩码只开放下一待执行块对当前触觉 token 的访问。这样,一个动作 chunk 的生成、执行和反馈被交错起来,无需外挂独立高频反射控制器。
核心机制
长度 H 的动作块被划分成 K 个、每块 B 个动作,并让第 k 块在第 kS 个采样步完成;所有未完成块共同推进,但越近的块越早到达 flow time 1。块完成后立即执行,未来块的中间态不丢弃。执行产生的触觉由共享编码器变成指尖 token,随后继续推进剩余块。EATA 的加性注意力掩码只允许下一待执行块读取最新触觉,其他远期块继续依赖任务上下文,等轮到自己成为下一块时再接收更新后的触觉。训练时随机采样生成进度,只对未完成动作回归 flow velocity,并使用与推理一致的块状态、阶段触觉和 EATA 掩码。
方法拆解
- 任务上下文只编码一次:视觉、语言和本体状态形成 Ct,在整个动作 chunk 的流式生成中复用,避免每执行一小块都重跑完整 VLM。
- 块级 flow 调度:设 H=KB、N=KS,第 k 块共享 flow time λk=min(n/kS,1),使各块按顺序完成;已完成块冻结,未完成块继续迭代。
- 执行与生成交错:每个已完成动作块立刻送去执行,执行后重新采集并编码 M 个指尖的触觉;模型从未来块保留的中间态继续,而不是重新从噪声生成整个 chunk。
- 执行感知触觉注意力:在第 k 阶段,只有块 k 的 action query 能看见最新触觉 key,其他块的对应 mask 为负无穷,避免远期动作被即将过时的接触状态直接条件化。
- 训练—推理对齐:训练随机采样归一化进度 p,构造各块不同噪声水平的中间动作,只对未完成位置计算 flow-matching loss,并匹配该阶段真实可用的触觉与 EATA 可见性。
结果
- 仿真中 TacForcing 相比 vision-only π0.5 高 14 个百分点,相比带独立快慢触觉控制器的 RDP 高 23 个百分点;唯一未获最佳的是 Lift Can,63% 略低于 FTP-1 的 66%。
- 三个真机任务平均成功率为 69%,高于 FTP-1 的 52%、GR00T N1.7 的 42% 和 π0.5 的 27%;Stand Bottle 为 81%,Transfer Liquid 为 50%,Wipe Board 为 75%。
- Transfer Liquid 的差距最大:TacForcing 为 50%,而 GR00T N1.7 为 19%,π0.5 与 FTP-1 都只有 6%,支持执行期触觉对遮挡下精细接触调节尤其重要。
- 消融中,从 Fixed Tactile 加入流式执行期更新后,仿真三任务平均由 42% 升至 51%,真机由 31% 升至 48%;再加入 EATA 后分别升至 60% 和 69%。
- 训练数据为仿真每任务 50 条示范、真机每任务 100 条示范;评测为仿真每任务 100 次 rollout、真机每任务 16 次独立试验。仿真基于 π0.5 初始化,真机基于 GR00T N1.7 初始化,触觉编码器均从 FTP-1 初始化。
洞察
- EATA 揭示多模态控制中的时间作用域问题:最新观测并非越广播越好。对快速变化的触觉,当前信号对近端动作价值最高,对远端动作可能成为有害的陈旧条件。
- 固定触觉比无触觉更差是关键反例。它说明接入新模态不能只比较“有/无”,还必须验证观测时间、动作生效时间和模型可修订窗口是否对齐。
- 方法本质上把 rolling-horizon 控制引入 chunk 内部:不缩短整个 action horizon,而是让近期动作先收敛、远期动作保持可修改,从而兼顾规划跨度与反馈响应。
- 相对 RDP 的慢视觉策略加快触觉反应控制器,TacForcing 不建立第二套控制输出,而是在同一 Streaming Action Expert 内用分块 flow schedule 交错生成和执行。
- 相对 T-Rex 的快慢双专家共享去噪轨迹,TacForcing 更进一步尝试只保留一个流式动作专家,并用 EATA 显式限制每次触觉更新的时间作用域;两者都证明静态拼接触觉不足,但接口复杂度与实时证据各有不同。
- 为高频模态设计注意力时,应按“观测采集时间—动作实际执行时间”建立可见性,而不是让所有未来 token 无条件访问最新信号。
- 评测触觉或力反馈方案时,应把固定条件、执行期刷新和时间对齐掩码分别消融,否则很容易把表示收益、反馈收益和架构收益混在一起。
风险与判断
局限
- 论文只给出 v1 的九个任务结果:六个 UniVTAC 仿真任务和三个固定真机任务;没有跨机器人、跨手型、跨触觉传感器或新任务的泛化评测。
- 真机每任务仅 16 次试验,单次成功对应 6.25 个百分点;81%、69% 等平均值受有限样本影响明显,也未报告置信区间或显著性检验。
- 论文强调无需独立高频控制器,但没有报告闭环频率、每个 block 的推理延迟、触觉编码开销、端到端吞吐或与 RDP 在等算力预算下的比较。
- 所有实验固定 B=5,未消融 block size、采样步间隔 S、触觉采样延迟、噪声与传感器漂移;因而响应性与计算效率之间的最佳折中仍未知。
- 训练依赖 π0.5 或 GR00T N1.7 初始化以及 FTP-1 预训练触觉编码器,尚未证明从更弱骨干训练时增益是否保持;项目页在论文发布时仍不可访问,代码与数据复现状态也未确认。
适用场景
- 适用于插孔、拔钥匙、管件对齐、液体转移、擦拭和稳握等在一个 action chunk 内接触状态会快速变化、视觉又受遮挡的操作。
- 适用于已有 flow-matching VLA 与触觉编码器、希望保持较长动作时域又不想维护独立高频控制器的研究系统。
最终判断
- TacForcing 是一篇值得重点跟踪的控制接口论文:它用清晰消融证明“执行期更新”与“触觉—执行时间对齐”都比静态触觉拼接更重要,并给出将反馈写回同一动作生成过程的简洁方案。
- 现阶段应把 65%/69% 视为强而有限的 v1 证据,不宜外推成通用触觉 VLA 已解决;在项目代码、等算力延迟、block size、跨硬件与更大规模真机试验公开前,它仍是研究原型而非部署结论。
相关主题
继续阅读
上一篇
What Matters for Latent Actions in Robot Learning
这是第一篇对 latent action model(LAM,隐式动作模型)做系统性实证研究的论文:把 LAPO、LAOF、CoMo、CFD-AE 等代表方法统一进同一个自编码框架,系统扫描了 41 个设计选择(建模范式、学习目标/正则化、隐式动作集成方式),并检验了 4 个代理指标能否预测下游操纵性能。核心结论是**原始 LAPO 反而是最强基线**,光学流(RAFT/SEA-RAFT)这类运动先验反而有害,隐式动作在 VLM 骨干微调后能显著提升下游策略与真实机械臂性能(真机成功率 64.75% → 79.25%)。对做「用无标注视频训练机器人」方向的人,这是一份可直接照抄的配方表。
下一篇
Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
VLAct 说明 VLA 的下一条独立增长轴不只是继续堆机器人轨迹,而是改造 continued pre-training 如何塑造 backbone 表示。在固定下游微调协议下,它仅替换预训练后的 Qwen3-VL-4B backbone,就在多项仿真、真机与未见 embodiment 迁移任务上取得 7.6–21.4 个百分点增益;最值得记住的是“保护 VLM 先验、用多动作头抵抗 decoder lock-in、只在物理可比维度共享动作语义”这套配方。
