TenStep

知识库

推荐综述判断

当前 VLA 路线图:基座、可控性、在线精修、记忆与人类数据

如果只看单篇论文,很容易觉得大家都在“继续做更强的 VLA”。但把 OpenVLA、π0.7、RLT、MEM、Human-to-Robot Transfer、DexImit 放在一起,会看到这条路线其实已经分化成六个相互关联的问题: 1. VLA 基座如何开放、可训、可部署 2. heterogeneous data 如何变成可控能力 3. 通才策略如何继续被打磨到 specialist 级精度 4. 分钟级任务如何通过 memory 真正支撑起来 5. 人类数据何时开始能真正被机器人利用 6. 人类视频如何被显式编译成机器人可训练数据 这说明当前 VLA 研究已经不再只是单点模型设计,而是在演化成一套完整系统栈。

打开综述

最近更新

按更新时间混排展示,标签只说明阅读类型,不暴露内部数据模型。

主题

Human Video Robot Data Generation

把人类操作视频转换成机器人可训练数据的路线,关注重建、调度、物理可行性和 sim-to-real。

打开

主题

Human-to-Robot Transfer

这条主题关注 human video、human embodiment data 与 robot policy 之间的迁移。核心问题不是“人类数据多不多”,而是“模型什么时候开始有能力利用这些数据”。

打开

主题

Long-Horizon Memory for Robot Policies

这条主题关注机器人策略如何处理分钟级任务。关键不是更多帧,而是多尺度记忆:哪些信息应该保留为短期视觉痕迹,哪些应该抽象成长期语义状态。

打开

主题

Online RL for VLA

这条主题关注 VLA 预训练之后的在线适配。核心问题不是“VLA 能不能泛化”,而是“当真实机器人需要更高精度、更高速度时,怎么以较低样本成本继续优化它”。

打开

主题

Vision-Language-Action

VLA 从开放基座、多源数据、在线精修和长时程记忆,继续扩展到新感官模态的持续适配与执行期闭环。

打开