Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models
Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models
Haoqi Yuan · Zhixuan Liang · Anzhe Chen · Ye Wang · Haoyang Li · Pei Lin · Yiyang Huang · Zixing Lei 等
一句话结论
Qwen-RobotManip 的核心不是“再堆更多机器人数据”,而是先把不同机器人在**表示、运动和行为**三个层面拉到同一坐标系,再讨论规模化。论文最有价值的证据是:统一动作表示后,跨具身数据在 OOD 验证误差和下游成功率上才出现清晰的规模趋势;但“只用公开数据”的说法只适用于 manipulation corpus,完整训练还混入了含 proprietary data 的 VL 数据。
关键词
摘要
中文摘要
语言和多模态基础模型之所以能获得强泛化,是因为异构数据可在统一形式下对齐,并能规模化训练。本文研究这套方法能否用于机器人操作。难点在于操作数据天然异构、采集昂贵且多样性有限。作者提出基于 Qwen-VL 的 Qwen-RobotManip,从表示、运动和行为三个维度统一对齐多源数据,并用 Human-to-Robot 管道把第一视角手部示范转换为 15 种机器人平台的轨迹。仅依靠公开机器人操作数据和人类视频,作者构建约 38,100 小时的 manipulation corpus,并在扰动鲁棒性、指令跟随、失败恢复和跨具身迁移上观察到泛化。由于标准 benchmark 难以反映预训练质量,论文重点采用 RoboCasa365、LIBERO-Plus、EBench、RoboTwin-Clean2Rand、RoboTwin-IF 和 RoboTwin-XE 等 OOD 设置,并在仿真与 AgileX ALOHA、Franka、UR、ARX 真机上验证模型。
英文摘要
Foundation models in language and multimodality achieve strong generalization by aligning heterogeneous data under a unified formulation and training at scale. In this report, we investigate whether this scaling recipe can be applied to robotic manipulation to achieve genuine generalization. This is challenging because, unlike text, manipulation data is heterogeneous by nature, expensive to collect, and narrow in diversity, making alignment and scale simultaneously difficult. We present Qwen-RobotManip, a generalizable Vision-Language-Action foundation model built on Qwen-VL. Qwen-RobotManip introduces a unified alignment framework across the representation, motion, and behavioral dimensions of manipulation, making large-scale multi-source training coherent rather than conflicting. This alignment capability in turn enables Qwen-RobotManip to absorb manipulation data at a scale that prior training regimes could not sustain. A human-to-robot synthesis pipeline converts egocentric hand demonstrations into robot trajectories across 15 platforms, and a rigorous curation pipeline harmonizes heterogeneous datasets. Using only open-source datasets and human videos without proprietary data collection, Qwen-RobotManip constructs a ~38,100-hour pretraining corpus and exhibits emergent generalization capabilities, including zero-shot instruction following, robustness to perturbations, reactive error recovery, and cross-embodiment transfer. We find that standard benchmarks fail to capture pretraining quality and instead adopt OOD settings including RoboCasa365, LIBERO-Plus, EBench, RoboTwin-Clean2Rand, RoboTwin-IF, and RoboTwin-XE. Qwen-RobotManip substantially outperforms prior state-of-the-art models, including π0.5, across all OOD settings, ranks 1st in RoboChallenge with a 20% relative improvement, and is validated on real-robot platforms including AgileX ALOHA, Franka, UR, and ARX.
直观理解
背景与问题
为什么做
- LLM/VLM 的规模化成立,是因为不同来源最终都能被映射到统一 token/formulation;机器人数据没有这种天然接口。
- 标准 LIBERO、RoboTwin 是同分布微调与测试。从零训练的 StarVLA、Qwen-RobotManip-scratch 也能接近或超过部分预训练模型,因此高分不等于预训练形成了可迁移能力。
问题缺口
- 表示不一致:机器人自由度、关节/夹爪/灵巧手字段和有效维度不同。
- 坐标不一致:同一末端运动可能记录在基座、世界、末端或不同相机坐标系中,数值监督互相冲突。
- 行为不一致:不同平台的速度、控制频率和运动学特征不同,仅提供 embodiment token 不足以动态校准策略。
- 数据不够广:遥操作数据昂贵且场景集中,人类第一视角视频虽多,但不能直接作为机器人动作监督。
- 评估不敏感:IID benchmark 很难区分记忆训练分布与真正的 OOD 泛化。
方法
方法概述
Qwen-RobotManip 是解耦式 VLA:Qwen3.5-4B 负责多视角感知、语言和上下文推理,DiT action expert 负责连续动作生成。DiT 的偶数块 cross-attend 视觉 token、奇数块 cross-attend 语言 token,二者都来自 VLM 最后一层;推理时用 4 步 Euler integration 生成 action chunk。

Figure 3:Qwen-VL、DiT action expert、80 维统一状态动作表示、相机坐标 EEF 和历史上下文的完整连接方式。
核心机制
Qwen-RobotManip 的核心不是单独增加一个跨具身标识,而是让表示、运动和行为三层对齐共同约束同一条动作生成链:canonical vector 统一各机器人字段的语义位置,camera-frame delta EEF 统一视觉相似运动的数值含义,structured prompt 与 episode history 再补足执行速度、相机方向和具体平台动力学。这样,多源样本进入 DiT 时不再提供相互冲突的监督,新增数据才可能转化为稳定的 OOD 收益。
方法拆解
- 表示对齐:80 维 canonical vector 两个 29 维手臂块 + 22 个预留维度;每臂包括 7D 关节、9D 末端位姿、1D 夹爪和 12D 灵巧手。 不存在的部件补零,并通过 per-dimension binary mask 从 loss 中排除;每个样本只按有效项归一化,避免高自由度机器人主导梯度。
- 运动对齐:camera-frame delta EEF 状态是绝对量;关节动作是绝对值;末端动作是相对当前状态的增量,旋转增量用 3D rotation vector。 末端位移和旋转被投影到参考相机坐标系,配合 CaPE、相机内参 embedding 和 end-effector type embedding,让视觉相似运动对应接近的数值动作。 这一模式需要训练与推理时都有相机标定;缺少标定时,auxiliary flag 会切回 robot-base relative mode。
- 行为对齐:prompt + episode context prompt 包括 embodiment、instruction、speed、fps、camera view direction;训练时以 15% 概率丢弃部分字段。 历史视觉、状态和已执行 action chunk 被编码进 VLM。训练随机从 episode 内取历史位置,避免模型只复制最近动作;部署时使用滚动窗口。
- 双流训练 VLA batch 优化带有效维度/时间步 mask 的 flow-matching loss;VL batch 优化 next-token loss,权重 λ=0.1。 VLA 与 VL 数据按 9:1 交替,action expert 对同一 action chunk 重复采样 8 个扩散时间步以摊薄 VLM 前向成本。
关键要点
- 80 维向量的关键不是补零,而是固定每个维度的物理语义,并用逐维 mask 防止缺失部件和高自由度平台扭曲训练目标。
- camera-frame delta EEF 把跨机器人对齐从“模型自己猜”改成显式几何约束,但部署时也因此依赖可靠相机标定。
- episode context 负责适配同一动作表示下仍然存在的平台动力学差异;它与表示、运动对齐是互补关系,不能替代前两层。
结果
- IID 不是主证据:Context 版在 LIBERO、RoboTwin Easy/Hard 上为 99.2%/93.7%/94.0%,但 scratch 模型也有 98.2%/88.7%/88.4%。真正差异在 OOD。
- 困难扰动更能拉开差距:RoboTwin-C2R Hard 中,scratch 从 Easy 71.6% 跌至 22.6%;基础 joint 版为 62.6%,Context joint 版为 69.4%。
- 语言仍是控制信号:RoboTwin-IF 五类未见指令模板平均 72.2%,相对 π0.5 的 49.6% 提升 22.6 点。
- 跨具身并未被完全解决:camera-frame EEF 在 ARX/UR5/Franka 上为 42.9%/22.8%/5.9%,虽然总均值是 π0.5 的 3.2 倍,但对形态差异最大的 Franka 仍很低。
- 真实 ALOHA:7 个 ID 任务平均 88.6%(π0.5 42.9%);4 个 OOD 任务平均 87.5%(π0.5 37.5%)。精密插入仍是弱项,yellow-disc-insertion 只有 2/5。
- RoboChallenge Table30-v1:generalist track 平均成功率 45%,高于第二名 DM0 的 37%,相对提升约 21.6%(论文按 20% 表述);并非每个 embodiment 都第一,UR5 平均低于 DM0。
- Human-to-Robot 数据把 RoboTwin-C2R Hard 从 robot-only 54.7% 提到 58.7%,LIBERO-Plus camera 扰动从 72.8% 提到 80.0%。
- 去掉预训练 VL co-training,RoboTwin-C2R Hard 从 62.6% 降到 54.4%,RoboTwin-IF 从 71.6% 降到 64.6%。
- Context 在 4 个 denoise steps 下没有收益且运动抖动;提高到 10 步后平均从 structured prompt 的 65.9% 升到 70.9%,20 步不再明显提升。
- last-layer cross-attention 在 LIBERO-Plus 为 87.5%,优于两个 self-attention 变体的 86.4% 和 87.0%,同时计算成本更低。
洞察
- 相比只用共享网络、embodiment token 或统一 action tokenization 的路线,本工作把“结构槽位”和“参考坐标”都显式统一,减少模型自行学习格式转换的负担。
- 相比直接把 human video 当另一种 modality,该工作把人类轨迹和视觉都转换成目标机器人形态,换取更强动作对齐,但也引入了 IK、修复和渲染误差。
- In-context policy adaptation 更接近在线系统辨识:它读取当前 episode 的执行签名来校准运动,而不是把历史当长时程任务记忆。
- 用固定语义槽位 + per-dimension/per-step mask 作为跨具身数据接口,简单且容易审计。
- 让 action reference frame 与主视觉 observation 对齐,可把视觉迁移直接转成动作迁移。
- 随机采样历史位置是防止 context learner 走“复制最近动作”捷径的通用做法。
- 将 IID 与 OOD 同时报告,并加入 scratch baseline,能更直接检验预训练是否真的提供 transferable structure。
- 数据清洗应报告淘汰率和失败类型;81% 的坏子集比“总小时数”更能说明多源数据工程的难度。
风险与判断
局限
- 约 24,808 小时 Human-to-Robot 数据来自把 1,933 小时人类视频重复渲染到 15 种形态;它扩大了 embodiment 覆盖,但并没有同比增加独立任务语义,不能把合成小时数等同于同规模新经验。
- 论文声称 manipulation corpus 没有专有采集,但第 2.5 节明确写出 VL mixture 包含 proprietary data;因此完整训练配方并非只依赖公开数据,复现边界需要分开表述。
- “scale law”来自缩小规模的受控消融、best validation MSE 和 RoboTwin-C2R 下游曲线,尚不足以证明跨模型、跨任务都服从同一规模律。
- 主要 OOD 证据仍以仿真为主;真机虽然覆盖四种平台,但很多结果样本数是每任务 5 或 10 次,置信区间和独立复现都缺失。
- camera-frame EEF 需要准确相机内外参;Context 版需要更多去噪步,并在 episode 开始时因零历史出现迟疑,实时性与适配收益存在权衡。
- 零样本跨具身对 Franka 仅 5.9%,说明“形态无关动作接口”降低了迁移难度,但远未消除视觉和运动学差异。
适用场景
- 多机器人、多任务的 VLA 预训练数据接口设计
- 需要相机视角 OOD、场景扰动和未见指令泛化的桌面操作
- 新机器人上的少样本适配、跨具身技能复用和可标定条件下的 EEF 控制
- 设计能区分预训练价值与 IID 记忆的机器人评估体系
最终判断
- 这是一份重要且工程证据密集的 VLA 技术报告,最值得保留的是“统一监督接口决定跨具身数据能否规模化”的论证,以及 IID/OOD 对照、Human-to-Robot 数据引擎和 camera-frame EEF。它不应被简单总结为“38,100 小时数据带来 SOTA”,也不宜直接称为已经确立的范式:最佳成绩混合了基础版、Context 版和额外 post-training 配方,公开数据声明存在范围限定,规模规律与真机泛化还需要独立复现。作为 FollowHub 的 VLA 核心材料,它更适合被定位为跨具身对齐与 OOD 评估的强系统基线。
相关主题
Vision-Language-Action
VLA 从开放基座、多源数据、在线精修和长时程记忆,继续扩展到新感官模态的持续适配与执行期闭环。
打开主题
继续阅读
上一篇
T-Rex: Tactile-Reactive Dexterous Manipulation
T-Rex 的关键贡献不是把触觉当作又一种静态输入,而是让现有 VLA 的低频视觉动作规划与高频触觉修正协同工作。它用 22889 小时人类第一视角视频预训练、100 小时触觉同步机器人数据中训练和约 100 条任务示范后训练,在 12 个真实双手灵巧任务上达到 65% 平均成功率,相比最强基线 EgoScale 的 35% 高出 30 个百分点。结果很强,但目前仍是单一硬件平台上的研究级验证。
下一篇
Heterogeneous Tactile Transformer
HTT 是面向异构触觉传感器的自监督预训练框架:四种传感器共享同一个 Transformer trunk,靠 masked reconstruction + 双向跨模态预测把光学和阵列信号对齐到同一潜空间,并在未见过的新传感器上验证可迁移。
