TenStep

Human-to-Robot Transfer

材料 4 综述 1 更新 2026-06-26

这条主题关注 human video、human embodiment data 与 robot policy 之间的迁移。核心问题不是“人类数据多不多”,而是“模型什么时候开始有能力利用这些数据”。

正文

Human-to-Robot Transfer

人类视频什么时候能真正变成机器人能力,不只是数据源问题,也是表示能力和预训练多样性问题。

主题概述

这条主题关注 human video、human embodiment data 与 robot policy 之间的迁移。核心问题不是“人类数据多不多”,而是“模型什么时候开始有能力利用这些数据”。

当前知识库里的代表工作

当前判断

  • Human-to-Robot Transfer 这篇更强调“能力何时出现”
  • π0.7 更强调“多源数据如何被统一利用”
  • DexImit 更强调“人类视频如何被编译成物理可行的机器人数据”
  • 放在一起看,可以把问题理解成:
    • 预训练多样性负责让 shared representation 成熟
    • richer context / prompt 负责让这些能力在控制中被真正调用出来
    • 显式数据生成 pipeline 负责把一部分 human video 转成更接近机器人动作空间的 supervision
    • benchmark / teleoperation 工具负责把这些迁移能力放到功能型灵巧任务里做压力测试

值得后续关注的问题

  • human data 在 pretraining 阶段和 finetuning 阶段的作用是否不同
  • human-to-robot transfer 与 cross-embodiment transfer 是否本质同源
  • 显式 data generation 与 VLA co-training 是替代关系,还是更适合组合使用
  • 这种能力的出现,更依赖模型规模还是数据多样性

相关页面

相关材料

Emergence of Human to Robot Transfer in Vision-Language-Action Models

这篇论文的关键判断是:`human-to-robot transfer` 不是简单靠对齐技巧手工做出来的,而是会随着 VLA 预训练规模和多样性增长而“涌现”。也就是说,当机器人预训练覆盖足够多任务、场景和 embodiment 后,模型开始能够真正从 human video 中学到对机器人有用的东西。

π0.7: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities

π0.7 的关键价值不只是把模型继续做大,而是把“可控的通才机器人策略”往前推了一步。它试图解决的核心问题是:当训练数据越来越杂时,机器人基础模型怎样既能吃下示范、失败轨迹、人类视频和网页数据,又不在推理时退化成平均化、含糊的动作。作者给出的答案是把“怎么做”也写进 prompt,包括子任务语言、子目标图像、质量/速度/错误等 episode metadata,让模型学会在多模态上下文里被 steer。

DexImit: Learning Bimanual Dexterous Manipulation from Monocular Human Videos

DexImit 的价值在于把大量单目人类操作视频转成可训练的双手灵巧机器人数据,而不是直接把 human embodiment 当成 policy 输入。它通过重建、调度、动作生成和增强四阶段,把 Internet 或生成模型产生的人类视频变成物理可行的机器人轨迹,并在零真实机器人数据下支持 sim-to-real 部署。

DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo

DexJoCo 的价值不在于提出一个新策略模型,而在于把“灵巧手到底比夹爪强在哪里、现有 VLA/模仿学习策略在哪些灵巧交互上失败”变成了可系统测量的问题。它提供 11 个功能型 MuJoCo 任务、1.1K 条人类示范、低成本手套遥操作采集系统,以及面向视觉随机化、动力学随机化、多任务训练和 action-head 适配的评测工具链。对后续灵巧手机器人学习来说,这篇更像基础设施论文:它给出了一个比 pick-and-place 更接近真实灵巧操作的压力测试场。

相关综述

当前 VLA 路线图:基座、可控性、在线精修、记忆与人类数据

如果只看单篇论文,很容易觉得大家都在“继续做更强的 VLA”。但把 OpenVLA、π0.7、RLT、MEM、Human-to-Robot Transfer、DexImit 放在一起,会看到这条路线其实已经分化成六个相互关联的问题: 1. VLA 基座如何开放、可训、可部署 2. heterogeneous data 如何变成可控能力 3. 通才策略如何继续被打磨到 specialist 级精度 4. 分钟级任务如何通过 memory 真正支撑起来 5. 人类数据何时开始能真正被机器人利用 6. 人类视频如何被显式编译成机器人可训练数据 这说明当前 VLA 研究已经不再只是单点模型设计,而是在演化成一套完整系统栈。