TenStep

Vision-Language-Action

材料 15 综述 2 更新 2026-08-31

VLA 从开放基座、多源数据、在线精修和长时程记忆,继续扩展到新感官模态的持续适配与执行期闭环。

正文

Vision-Language-Action

把视觉、语言和动作统一进同一策略建模框架,是当前具身智能主线之一。

这条主题在讲什么

VLA 的核心不是“把图像和文本都喂给机器人”,而是把机器人控制问题放进 foundation model 语境里,让预训练、多任务泛化、迁移、微调和跨 embodiment 学习都能在一套统一框架里讨论。

为什么重要

  • VLA 是现在连接大模型能力与机器人执行能力的主干路线
  • 它把机器人学习从 task-specific policy 推向 reusable foundation policy
  • 很多后续方向,本质上都是在回答“VLA 还缺什么”
    • 更强的可控性
    • 更长的记忆
    • 更高的精度
    • 更好的跨 embodiment 迁移
    • 更低成本地利用人类数据
    • 新感官模态的持续适配与低延迟闭环

当前知识库里的几条子路线

当前判断

这几篇放在一起看,VLA 主线已经很清楚:

  • OpenVLA 解决“基座是否开放、可训、可部署”
  • π0.7 解决“多源数据如何通过 prompt 变成可控能力”
  • RLT 解决“如何把通才策略继续打磨到高精度”
  • MEM 解决“如何把策略延长到 long-horizon”
  • Human-to-Robot Transfer 解决“如何把人类数据真正吸纳进来”
  • DexJoCo 解决“如何用灵巧手任务和失败模式检验这些策略是否真的具备接触密集、双手和长时程能力”
  • AttenA+ 解决“训练目标是否应该反映动作序列内部的物理关键性”
  • MuSe 解决“如何把预训练时不存在的新力觉模态接入 foundation policy,同时避免旧能力遗忘”
  • T-Rex 解决“如何让低频视觉规划与高频触觉动作细化在同一生成轨迹上协同”
  • TacForcing 解决“如何在同一个动作生成器内部交错 chunk 生成、执行与触觉更新,并限制反馈的时间作用域”
  • DM0.5 解决“如何把历史上下文、具身推理、动作监督三件事系统化地收进一个可用的通用 VLA”
  • What Matters for Latent Actions 解决“用无标注视频学隐式动作时,哪些设计真正决定下游性能、以及如何低成本评估隐式动作质量”
  • VLAct 解决“固定机器人数据预算下,如何让持续预训练得到可换动作头、可跨具身迁移的 VLA backbone”

也就是说,VLA 不再只是一个单点模型设计问题,而已经分化成一套系统问题族。

相关页面

相关材料

OpenVLA: An Open-Source Vision-Language-Action Model

OpenVLA 的价值不只是开源一个 VLA 模型,而是把可训练、可微调、可部署的完整开源机器人大模型工作流真正落到了实践层面。

π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities

π0.7 的关键价值不只是把模型继续做大,而是把“可控的通才机器人策略”往前推了一步。它试图解决的核心问题是:当训练数据越来越杂时,机器人基础模型怎样既能吃下示范、失败轨迹、人类视频和网页数据,又不在推理时退化成平均化、含糊的动作。作者给出的答案是把“怎么做”也写进 prompt,包括子任务语言、子目标图像、质量/速度/错误等 episode metadata,让模型学会在多模态上下文里被 steer。

RL Token: Bootstrapping Online RL with Vision-Language-Action Models

这篇工作最重要的点,是给 VLA 和在线 RL 之间找到了一个足够轻量的接口。作者没有直接对整套大模型做昂贵 RL,而是让预训练 VLA 暴露一个紧凑的 `RL token`,再在这个表示上训练小型 actor-critic,从而把 VLA 的泛化能力和 real-world online RL 的样本效率拼接起来。

MEM: Multi-Scale Embodied Memory for Vision Language Action Models

这篇工作的重点,是把机器人策略里的“记忆”从单一历史帧堆叠,升级成多尺度、多模态的长期记忆结构。MEM 用视频短期记忆处理最近视觉细节,用文本长期记忆保留高层语义进度,从而把 VLA 推到更长时间跨度的任务上。

Emergence of Human to Robot Transfer in Vision-Language-Action Models

这篇论文的关键判断是:`human-to-robot transfer` 不是简单靠对齐技巧手工做出来的,而是会随着 VLA 预训练规模和多样性增长而“涌现”。也就是说,当机器人预训练覆盖足够多任务、场景和 embodiment 后,模型开始能够真正从 human video 中学到对机器人有用的东西。

DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo

DexJoCo 的价值不在于提出一个新策略模型,而在于把“灵巧手到底比夹爪强在哪里、现有 VLA/模仿学习策略在哪些灵巧交互上失败”变成了可系统测量的问题。它提供 11 个功能型 MuJoCo 任务、1.1K 条人类示范、低成本手套遥操作采集系统,以及面向视觉随机化、动力学随机化、多任务训练和 action-head 适配的评测工具链。对后续灵巧手机器人学习来说,这篇更像基础设施论文:它给出了一个比 pick-and-place 更接近真实灵巧操作的压力测试场。

AttenA+: Rectifying Action Inequality in Robotic Foundation Models

AttenA+ 的核心价值是指出 VLA/WAM 训练里一个很朴素但长期被忽略的问题:机器人动作时间步并不等价,慢速精细动作往往比快速过渡动作更决定任务成败。它用速度场给低速关键动作更高 loss 权重,不改模型结构、不加参数,却能在 Libero、RoboTwin 2.0 和真实 Franka 任务上稳定抬高强基线的上限。值得记住的不是某个复杂网络,而是“动作序列的物理结构可以直接进入训练目标”。

Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments

Qwen-VLA 将操作、连续导航、轨迹预测和人类第一视角运动统一为同一 action-and-trajectory prediction 问题;它不是为每个机器人另训策略,而是用 Qwen3.5-4B 与 1.15B 参数 DiT 动作专家共享建模。其关键价值是以 embodiment-aware prompt 保留各平台原生控制语义,并用四阶段训练把语言—动作先验、视觉 grounding、任务对齐和成功率优化串起来。跨操作、导航、真实 OOD 与动态零样本基准的结果表明,这个统一接口并未以明显的 specialist 性能为代价。

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Qwen-RobotManip 的核心不是“再堆更多机器人数据”,而是先把不同机器人在**表示、运动和行为**三个层面拉到同一坐标系,再讨论规模化。论文最有价值的证据是:统一动作表示后,跨具身数据在 OOD 验证误差和下游成功率上才出现清晰的规模趋势;但“只用公开数据”的说法只适用于 manipulation corpus,完整训练还混入了含 proprietary data 的 VL 数据。

DM0.5: 面向开放世界的通用具身智能基础模型

DM0.5 延续 VLA 架构(4B VLM 多模态主干 + 680M Action Expert),核心不是堆规模,而是四项系统增强:长历史上下文、具身推理(CoT)、动态动作对齐监督、数据质量清洗。换来的是开放环境 Zero-Shot 泛化、更长记忆、更鲁棒动作和多机型迁移,在 RoboChallenge Table30 v2 真机评测拿下 SOTA,并在 LIBERO / RoboTwin2.0 / R2R+RxR 导航基准上多项领先。

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

这篇论文最值得记住的不是“给 VLA 加一条触觉输入”,而是它把新模态接入表述成 continual learning:在少量新 contact-rich 数据上学会用 force,同时尽量不破坏旧的视觉动作能力。MuSe 的价值在于,它用 multisensory future prediction 和 replay 证明,旧任务上即使没有力标注,也能把力学结构以可迁移的方式对齐进预训练策略;真正的短板则是仍依赖离线适配和专门的 compliance 控制接口,而不是端到端解决全闭环接触控制。

T-Rex: Tactile-Reactive Dexterous Manipulation

T-Rex 的关键贡献不是把触觉当作又一种静态输入,而是让现有 VLA 的低频视觉动作规划与高频触觉修正协同工作。它用 22889 小时人类第一视角视频预训练、100 小时触觉同步机器人数据中训练和约 100 条任务示范后训练,在 12 个真实双手灵巧任务上达到 65% 平均成功率,相比最强基线 EgoScale 的 35% 高出 30 个百分点。结果很强,但目前仍是单一硬件平台上的研究级验证。

What Matters for Latent Actions in Robot Learning

这是第一篇对 latent action model(LAM,隐式动作模型)做系统性实证研究的论文:把 LAPO、LAOF、CoMo、CFD-AE 等代表方法统一进同一个自编码框架,系统扫描了 41 个设计选择(建模范式、学习目标/正则化、隐式动作集成方式),并检验了 4 个代理指标能否预测下游操纵性能。核心结论是**原始 LAPO 反而是最强基线**,光学流(RAFT/SEA-RAFT)这类运动先验反而有害,隐式动作在 VLM 骨干微调后能显著提升下游策略与真实机械臂性能(真机成功率 64.75% → 79.25%)。对做「用无标注视频训练机器人」方向的人,这是一份可直接照抄的配方表。

TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback

TacForcing 解决的不是“VLA 能否看到触觉”,而是“动作块执行到一半时,最新触觉能否继续改写尚未执行的动作”。它把一个动作 chunk 拆成顺序完成的块,保留未来块的 flow-matching 中间态,并用执行后新采集的触觉继续细化;EATA 只让最新触觉影响下一块,避免它提前污染更远期动作。六个 UniVTAC 仿真任务平均成功率 65%,三个真机任务平均 69%,但 v1 的真机评测每任务仅 16 次,尚不足以证明跨硬件泛化或实时成本优势。

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

VLAct 说明 VLA 的下一条独立增长轴不只是继续堆机器人轨迹,而是改造 continued pre-training 如何塑造 backbone 表示。在固定下游微调协议下,它仅替换预训练后的 Qwen3-VL-4B backbone,就在多项仿真、真机与未见 embodiment 迁移任务上取得 7.6–21.4 个百分点增益;最值得记住的是“保护 VLM 先验、用多动作头抵抗 decoder lock-in、只在物理可比维度共享动作语义”这套配方。

相关综述

当前 VLA 路线图:基座、可控性、在线精修、记忆与人类数据

如果只看单篇论文,很容易觉得大家都在“继续做更强的 VLA”。但把 OpenVLA、π0.7、RLT、MEM、Human-to-Robot Transfer、DexImit 放在一起,会看到这条路线其实已经分化成六个相互关联的问题: 1. VLA 基座如何开放、可训、可部署 2. heterogeneous data 如何变成可控能力 3. 通才策略如何继续被打磨到 specialist 级精度 4. 分钟级任务如何通过 memory 真正支撑起来 5. 人类数据何时开始能真正被机器人利用 6. 人类视频如何被显式编译成机器人可训练数据 这说明当前 VLA 研究已经不再只是单点模型设计,而是在演化成一套完整系统栈。

触觉与力觉如何进入预训练机器人策略:表示、持续适配与执行闭环

五篇材料共同勾勒出触觉与力觉进入机器人基础策略的四层栈:传感设计、跨硬件表示、无遗忘持续适配,以及与动作生效时间对齐的执行闭环。