TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
Hengyi Xie · Chenfei Yao · Xianjin Wu · Xuanyang Xi · Yiping Tang · Di Xu · Yingying Zhu · Dingkang Liang 等
一句话结论
TurboVLA 将高频控制从 LLM 居中的 V→L→A 改为轻量的直接 V+L→A,在 LIBERO 达到 97.7% 且只需 0.2B、31.2ms、0.9GB。
关键词
摘要
中文摘要
TurboVLA 以轻量双向视觉—语言交互和紧凑连续动作解码器取代 LLM 居中的高频执行路径。
英文摘要
TurboVLA replaces the LLM-centric V→L→A pathway with lightweight bidirectional vision-language interaction and a compact continuous action decoder.
直观理解
背景与问题
为什么做
现有 VLA 往往把视觉投影到大语言模型空间,再由该空间生成机器人动作。即使使用并行 action expert,LLM 仍处在每个控制周期的关键路径,因此带来显存、延迟和本地部署成本。
问题缺口
论文要验证的是:在任务指令主要描述对象、属性和空间关系的执行级操作中,是否能保留必要的语言 grounding,却不再让大语言模型充当视觉到动作的中心接口,从而提高控制频率。
方法
结果
- RoboTwin 2.0 为 60.2%,43.4ms.
洞察
- 移除的是高频 LLM 中枢而不是语言条件.
风险与判断
局限
- 不证明长程规划或开放式语义推理能力.
适用场景
- 消费级 GPU 本地语言条件操作.
最终判断
- 跨模型延迟仍受动作块长度和实现细节影响.
相关主题
Vision-Language-Action
VLA 从开放基座、多源数据、在线精修和长时程记忆,继续扩展到新感官模态的持续适配与执行期闭环。
打开主题
继续阅读
上一篇
FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation
FM-VLA 的关键不是给 VLA 再塞一种当前时刻传感器,而是把整段腕部力/力矩历史压缩成可供动作专家读取的长期事件记忆。它在找隐藏积木、精确计数按钮按压与碗内擦拭三项非马尔可夫任务上达到 83.3% 平均成功率,显著超过视觉记忆 π-MEM 的 53.7%,推理延迟仅比无记忆 π0.5 增加 3.3 ms。最值得记住的是“长时 force + 短时 state”的职责分工,但证据目前仍限于单一双臂平台和小规模任务。
下一篇
DM0.5: 面向开放世界的通用具身智能基础模型
DM0.5 延续 VLA 架构(4B VLM 多模态主干 + 680M Action Expert),核心不是堆规模,而是四项系统增强:长历史上下文、具身推理(CoT)、动态动作对齐监督、数据质量清洗。换来的是开放环境 Zero-Shot 泛化、更长记忆、更鲁棒动作和多机型迁移,在 RoboChallenge Table30 v2 真机评测拿下 SOTA,并在 LIBERO / RoboTwin2.0 / R2R+RxR 导航基准上多项领先。
