TenStep

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

论文 2026-07-29 Vision-Language-Action

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

Hengyi Xie · Chenfei Yao · Xianjin Wu · Xuanyang Xi · Yiping Tang · Di Xu · Yingying Zhu · Dingkang Liang 等

Huazhong University of Science and TechnologyHuawei Technologies Huawei Technologies

一句话结论

TurboVLA 将高频控制从 LLM 居中的 V→L→A 改为轻量的直接 V+L→A,在 LIBERO 达到 97.7% 且只需 0.2B、31.2ms、0.9GB。

摘要

中文摘要

TurboVLA 以轻量双向视觉—语言交互和紧凑连续动作解码器取代 LLM 居中的高频执行路径。

英文摘要

TurboVLA replaces the LLM-centric V→L→A pathway with lightweight bidirectional vision-language interaction and a compact continuous action decoder.

直观理解

它将慢速规划与快速执行分离:执行器只负责把当前画面与指令对齐,并行输出连续动作。

主要图

主要图

主要图
主要图

背景与问题

为什么做

现有 VLA 往往把视觉投影到大语言模型空间,再由该空间生成机器人动作。即使使用并行 action expert,LLM 仍处在每个控制周期的关键路径,因此带来显存、延迟和本地部署成本。

问题缺口

论文要验证的是:在任务指令主要描述对象、属性和空间关系的执行级操作中,是否能保留必要的语言 grounding,却不再让大语言模型充当视觉到动作的中心接口,从而提高控制频率。

方法

方法概述

面向执行级操作的高效率 VLA。

核心机制

DINOv3 和 BERT 分别编码视觉与指令,六层双向 cross-attention 交换信息;ACT 风格动作块 decoder 结合机器人状态并行预测动作。

方法拆解

  • 保留 token 级文本表示以对齐对象、属性和空间关系.
  • 双向 cross-attention 同时更新视觉与指令流.
  • 一次输出连续动作块,避免自回归动作 token.
方法图
方法图

关键要点

  • 执行级控制不必让大语言模型处于每个控制步的关键路径.

结果

  • RoboTwin 2.0 为 60.2%,43.4ms.

洞察

  • 移除的是高频 LLM 中枢而不是语言条件.

风险与判断

局限

  • 不证明长程规划或开放式语义推理能力.

适用场景

  • 消费级 GPU 本地语言条件操作.

最终判断

  • 跨模型延迟仍受动作块长度和实现细节影响.

Vision-Language-Action

VLA 从开放基座、多源数据、在线精修和长时程记忆,继续扩展到新感官模态的持续适配与执行期闭环。

打开主题

继续阅读

上一篇

FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation

FM-VLA 的关键不是给 VLA 再塞一种当前时刻传感器,而是把整段腕部力/力矩历史压缩成可供动作专家读取的长期事件记忆。它在找隐藏积木、精确计数按钮按压与碗内擦拭三项非马尔可夫任务上达到 83.3% 平均成功率,显著超过视觉记忆 π-MEM 的 53.7%,推理延迟仅比无记忆 π0.5 增加 3.3 ms。最值得记住的是“长时 force + 短时 state”的职责分工,但证据目前仍限于单一双臂平台和小规模任务。

下一篇

DM0.5: 面向开放世界的通用具身智能基础模型

DM0.5 延续 VLA 架构(4B VLM 多模态主干 + 680M Action Expert),核心不是堆规模,而是四项系统增强:长历史上下文、具身推理(CoT)、动态动作对齐监督、数据质量清洗。换来的是开放环境 Zero-Shot 泛化、更长记忆、更鲁棒动作和多机型迁移,在 RoboChallenge Table30 v2 真机评测拿下 SOTA,并在 LIBERO / RoboTwin2.0 / R2R+RxR 导航基准上多项领先。