DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo
DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo
Hanwen Wang · Weizhi Zhao · Xiangyu Wang · Siyuan Huang · He Lin · Boyuan Zheng · Rongtao Xu · Gang Wang 等
一句话结论
DexJoCo 的价值不在于提出一个新策略模型,而在于把“灵巧手到底比夹爪强在哪里、现有 VLA/模仿学习策略在哪些灵巧交互上失败”变成了可系统测量的问题。它提供 11 个功能型 MuJoCo 任务、1.1K 条人类示范、低成本手套遥操作采集系统,以及面向视觉随机化、动力学随机化、多任务训练和 action-head 适配的评测工具链。对后续灵巧手机器人学习来说,这篇更像基础设施论文:它给出了一个比 pick-and-place 更接近真实灵巧操作的压力测试场。
关键词
摘要
中文摘要
实现接近人类水平的操作能力,需要机器人灵巧手能够处理复杂物体交互;而推进这类能力又需要标准化 benchmark 来进行系统评测。然而,现有灵巧操作基准缺少能够体现灵巧手相对平行夹爪独特能力的任务,也缺乏完整评测流水线。本文提出 DexJoCo,一个面向任务导向灵巧操作的 benchmark 与工具包,包含 11 个有功能语义的任务,用于评估工具使用、双手协调、长时程执行和推理能力。作者开发了一个低成本数据采集系统,并在这些任务上采集 1.1K 条轨迹,同时支持领域随机化来评估鲁棒性。论文在视觉与动力学随机化、多任务训练、action-head 适配等多种设置下评测现代模型,通过系统实验总结出当前灵巧操作策略的重要局限,为未来灵巧手机器人学习指出关键挑战。
英文摘要
Achieving human-level manipulation requires dexterous robotic hands capable of complex object interactions. Advancing such capabilities further demands standardized benchmarks for systematic evaluation. However, existing dexterous benchmarks lack tasks that reflect the unique manipulation capabilities of dexterous hands over parallel grippers, as well as comprehensive evaluation pipelines. In this paper, we present DexJoCo, a benchmark and toolkit for task-oriented dexterous manipulation, comprising 11 functionally grounded tasks that evaluate tool-use, bimanual coordination, long-horizon execution, and reasoning. We develop a low-cost data collection system and collect 1.1K trajectories across these tasks, with support for domain randomization to assess robustness. We benchmark modern models under diverse settings, including visual and dynamics randomization, multi-task training, and action-head adaptation. Through extensive empirical analysis, we identify several important insights and common limitations of current policies in dexterous manipulation, highlighting key challenges for future research in dexterous hand robot learning.
直观理解
可以把 DexJoCo 理解成一个“灵巧手版 LIBERO / CALVIN”,但任务设计刻意避开简单抓取搬运,转向浇花、敲钉子、折眼镜、开微波炉、解锁 iPad、汉诺塔、装配、拍照等需要手指协调、接触反馈、顺序约束和双手分工的场景。作者不仅搭了仿真环境,还配了一套用 Rokoko 手套和 Vive Tracker 采集人类示范的低成本系统,再把这些数据转成 LeRobot / Diffusion Policy 等现代策略可以消费的格式。它真正想回答的是:当任务从“把东西拿起来”变成“用手完成一个有功能语义的动作”时,当前策略到底卡在哪里。

DexJoCo 总览:11 个任务、1.1K 人类示范、领域随机化回放与策略评测工具链。
背景与问题
为什么做
机器人操作社区已经有不少成熟的夹爪平台数据集和基准,但人类级操作往往依赖灵巧手:按按钮、挤压夹子、折叠眼镜、双手握持与插装、连续步骤执行等都不是简单开合夹爪能自然完成的。要推动这类能力,研究者需要标准化任务、可复现环境、统一数据格式和能暴露失败模式的评测协议。
问题缺口
现有灵巧手 benchmark 往往有四类不足:一是只考虑 hand-only 设置,脱离真实机械臂-手系统;二是任务集中在 in-hand manipulation 或 pick-and-place,不能凸显灵巧手相对夹爪的功能优势;三是缺少好用的人类示范采集系统,导致数据要么靠 RL 生成、要么行为不自然;四是缺乏统一语言指令与现代 VLA/模仿学习评测格式,难以比较不同策略。
方法
结果
- 在只随机化物体位置和桌面高度的 rand-obj 设置下,平均成功率最高的是 π0.5(52.5%),DP-Transformer 也达到 50.4%,DP-CNN 为 47.6%,GR00T N1.5 为 40.2%,ACT 为 35.5%。
- 在额外加入相机、光照、纹理的 rand-full 视觉随机化后,所有模型都明显下降:π0.5 从 52.5% 降到 34.1%,DP-Transformer 从 50.4% 降到 20.0%,DP-CNN 从 47.6% 降到 28.4%。
- DP-CNN 在 Unlock iPad 和 Pinch Tongs 上异常强,作者推测这可能来自 FiLM 方式注入观测,比 self/cross attention 更利于精细视觉交互。
- 失败模式集中在按钮、插入、挤压/释放和记忆:模型能拿起设备或移动物体,但经常按不到目标按钮;能抓住夹子但不能连续挤压释放;能把热狗放进微波炉但又随手带出来。
- 多任务训练在相同训练步数下会退化:DP-Transformer 在所有任务下降,说明当前容量/训练设置还不能自然吸收这些异质灵巧任务。
- 动力学随机化下,π0.5 平均比 DP-Transformer 更稳,提示大规模预训练对扰动有帮助,但并不能解决高维灵巧动作空间本身的瓶颈。
- 保留预训练 action head 比完全随机初始化更好,说明 VLA 的动作头权重仍有迁移价值;但由于大多数预训练来自夹爪数据,高维灵巧手动作仍存在 embodiment mismatch。
洞察
- 做灵巧手 benchmark 时,应优先设计“功能完成条件”,而不是只定义末端位姿误差。
- 数据采集系统可以采用低成本手套 + tracker + retargeting,而不必一开始就依赖昂贵动捕房。
- 评测协议应同时包含视觉随机化、动力学随机化和 action-head adaptation,否则很容易高估模型能力。
- failure taxonomy 应成为 benchmark 的一部分:成功率之外,还要记录精细动作失败、插入失败、记忆失败、交互元素忽略等模式。
风险与判断
局限
- DexJoCo 仍是 MuJoCo 仿真 benchmark,真实机器人部署中的接触、摩擦、传感器噪声、材质形变和执行延迟没有被完整覆盖。
- 数据规模为 1.1K 条轨迹,对训练大规模通用灵巧手策略来说仍偏小,更适合评测和方法验证,而不是单独支撑 foundation model 训练。
- 任务虽然比 pick-and-place 更丰富,但仍集中在桌面场景和固定机器人/手配置上,对移动操作、软体物体、复杂工具链和开放世界任务覆盖有限。
- 论文暴露了语言泛化失败,但没有提供解决方法;它更像诊断工具,而不是完整模型方案。
适用场景
- 用作灵巧手模仿学习、VLA action head 适配、视觉鲁棒性、双手协调和接触密集操作的统一评测场。
- 用作新数据生成/遥操作采集方法的下游验证,例如从人类视频生成轨迹后在 DexJoCo 任务上训练策略。
- 用作分析策略失败模式的工具,尤其适合研究按钮、铰链、插装、长时程和双手任务。
最终判断
- 这是一篇值得放进知识库的基础设施论文。它本身不解决灵巧手策略学习,但清楚定义了“哪些能力还没解决”,并给出可复现实验场。对 FollowHub 的 embodied intelligence 线索来说,DexJoCo 可以作为评测基准节点,连接 OpenVLA/π0.5/GR00T 等 VLA 模型、DexImit 这类数据生成工作,以及未来 hand-centric foundation model 方向。
相关主题
继续阅读
上一篇
AttenA+: Rectifying Action Inequality in Robotic Foundation Models
AttenA+ 的核心价值是指出 VLA/WAM 训练里一个很朴素但长期被忽略的问题:机器人动作时间步并不等价,慢速精细动作往往比快速过渡动作更决定任务成败。它用速度场给低速关键动作更高 loss 权重,不改模型结构、不加参数,却能在 Libero、RoboTwin 2.0 和真实 Franka 任务上稳定抬高强基线的上限。值得记住的不是某个复杂网络,而是“动作序列的物理结构可以直接进入训练目标”。
下一篇
Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
Qwen-VLA 将操作、连续导航、轨迹预测和人类第一视角运动统一为同一 action-and-trajectory prediction 问题;它不是为每个机器人另训策略,而是用 Qwen3.5-4B 与 1.15B 参数 DiT 动作专家共享建模。其关键价值是以 embodiment-aware prompt 保留各平台原生控制语义,并用四阶段训练把语言—动作先验、视觉 grounding、任务对齐和成功率优化串起来。跨操作、导航、真实 OOD 与动态零样本基准的结果表明,这个统一接口并未以明显的 specialist 性能为代价。
