TenStep

DM0.5: 面向开放世界的通用具身智能基础模型

blog 2026-08-10

DM0.5: 面向开放世界的通用具身智能基础模型

Dexmal 原力灵机

首要单位:Dexmal 原力灵机(北京/重庆) Dexmal Dexmal

一句话结论

DM0.5 延续 VLA 架构(4B VLM 多模态主干 + 680M Action Expert),核心不是堆规模,而是四项系统增强:长历史上下文、具身推理(CoT)、动态动作对齐监督、数据质量清洗。换来的是开放环境 Zero-Shot 泛化、更长记忆、更鲁棒动作和多机型迁移,在 RoboChallenge Table30 v2 真机评测拿下 SOTA,并在 LIBERO / RoboTwin2.0 / R2R+RxR 导航基准上多项领先。

关键词

robot-foundation-model

摘要

中文摘要

DM0.5 延续 VLA 架构(4B VLM 多模态主干 + 680M Action Expert),核心不是堆规模,而是四项系统增强:长历史上下文、具身推理(CoT)、动态动作对齐监督、数据质量清洗。换来的是开放环境 Zero-Shot 泛化、更长记忆、更鲁棒动作和多机型迁移,在 RoboChallenge Table30 v2 真机评测拿下 SOTA,并在 LIBERO / RoboTwin2.0 / R2R+RxR 导航基准上多项领先。

英文摘要

DM0.5 延续 VLA 架构(4B VLM 多模态主干 + 680M Action Expert),核心不是堆规模,而是四项系统增强:长历史上下文、具身推理(CoT)、动态动作对齐监督、数据质量清洗。换来的是开放环境 Zero-Shot 泛化、更长记忆、更鲁棒动作和多机型迁移,在 RoboChallenge Table30 v2 真机评测拿下 SOTA,并在 LIBERO / RoboTwin2.0 / R2R+RxR 导航基准上多项领先。

直观理解

可以把它看成"给 VLA 模型装了记忆 + 教会它边看边想下一步":不再只是盯着当前画面输出动作,而是把过去 60 秒的关键视觉信息一起建模,训练时额外学 11 种自回归推理任务(任务规划、事件预测、动作生成),再通过动态路径匹配把"预测动作"和"真实轨迹进展"对齐,从而把采集节奏噪声滤掉、学到任务真正的动作规律。

背景与问题

为什么做

VLA 过去两年让机器人走向视觉、语言、动作统一建模,但真实世界远高于一个 Demo。通用机器人基础模型不能只在固定场景做既定任务,必须理解指令、理解"接下来为什么这样做",在不同相机视角、物体状态、环境、机器人本体和外部干扰下稳定执行,并在少量数据微调后快速适应新任务。

问题缺口

DM0 第一代能在可控环境学复杂操作,却还没有真正跨出实验室。要落地开放世界,需要解决长程依赖(很多任务不是单帧马尔可夫能搞定的)、语义理解、数据噪声(遥操作节奏差异)和动作连续性四个问题。

方法

方法概述

DM0.5 延续 VLA 架构(4B VLM 多模态主干 + 680M Action Expert),核心不是堆规模,而是四项系统增强:长历史上下文、具身推理(CoT)、动态动作对齐监督、数据质量清洗。换来的是开放环境 Zero-Shot 泛化、更长记忆、更鲁棒动作和多机型迁移,在 RoboChallenge Table30 v2 真机评测拿下 SOTA,并在 LIBERO / RoboTwin2.0 / R2R+RxR 导航基准上多项领先。

结果

洞察

  • "加记忆 + 教推理 + 动态对齐动作"是 VLA 从演示走向通用化的系统模板:长历史上下文解决"多帧状态依赖"、CoT 解决"为什么要这么动"、动态匹配解决"采集噪声"。三者合起来让模型从"当前帧驱动的操作策略"升级为"理解任务进程的通用策略"。
  • 历史和推理是低成本高回报的监督来源:不新增真机采集,而是从已有机器人数据里加自回归推理任务 + 历史 slot 采样,属于"把数据榨干"式的训练侧增益。
  • 专注动作点而非时间点:动态动作对齐把监督从"固定时间对齐"改成"轨迹进展对齐",这一设计对遥操作数据普遍适用,是工程上很值得借鉴的一手。
  • 相对 OpenVLA / π0.7 等 VLA 通用框架:DM0.5 同属 VLA,区别在于把"历史上下文 + 具身推理 + 动作对齐"作为显式系统设计整体纳入,而不只是扩大模型和数据。
  • 相对 MEM / Long-Horizon Memory 方向:DM0.5 的长记忆(最长 60s)是"架构上直接支持历史输入"的实现,印证了长程记忆对 VLA 的价值。
  • 相对 TurboVLA(RTX 4090 实时):DM0.5 在 4090 单卡也给出了 10Hz 推理,属于能上消费级显卡的实时性水平,但主打的是通用泛化而非极致帧率。
  • Context Abstraction Layer 用随机历史长度训练 + 可退化策略,是让模型同时适应长/短/无历史的安全设计,可迁移到任何序列决策模型。
  • 把动作监督从"时间对齐"换成"轨迹进展对齐 + 单调匹配 + 动态规划",可复用到各类遥操作 / 示教数据的策略学习,降低采集节奏偏差。
  • 在机器人数据里注入自回归推理任务做联合监督,是低成本提升指令遵循与时序感知的有效手段。

风险与判断

局限

  • 这是发布博客而非完整论文,缺少消融实验细节、训练数据总量、去中心化评测方法与 error bar;"SOTA" 声明需以完整论文/后续复现为准。
  • Zero-Shot 评测任务集(8 动作 × 7 条件)为自建,缺乏与第三方开放 benchmark 的严格横向对齐;与 Pi0.5-Droid 的对比只在 Franka 平台。
  • Table30 v2 43% SR 说明真实开放环境仍有大量失败空间,"走向开放世界"是方向性陈述,不代表通用落地。
  • 博客强调多机型迁移但未给量化数据;4B 主干相对更大 VLA 在极端复杂长程任务上的上限未知。
  • 需要"一个模型处理多机器人本体 + 多任务"的通用 VLA 选型。
  • 真实场景下对光照、视角、干扰鲁棒、并希望零样本跟自然语言指令操作的研究/产品。
  • 长程多步任务(需要跨帧状态记忆)或遥操作数据量大的策略训练。
  • 是值得记入知识库的具身基础模型发布:把历史上下文、具身推理、动作对齐三个设计做成一体,且真机 Table30 v2 拿到 SOTA,方向校验较强。
  • 对当前具身智能的实际价值:高。它把三个相对分散的方向(long-horizon memory、VLA reasoning、action supervision)收敛到一个可运行的通用模型里,并开源权重,是可复现、可跟踪的路线参照。
  • 跟踪价值:① 是否有完整论文/消融放出;② 4B 主干能否向更大规模迁移成功;③ 后续 DM 系列在开放世界评测(如 LIBERO、RoboChallenge)的持续表现;④ 开源后社区 fine-tune 到新机型、新任务的泛化证据。

适用场景

  • 需要"一个模型处理多机器人本体 + 多任务"的通用 VLA 选型。
  • 真实场景下对光照、视角、干扰鲁棒、并希望零样本跟自然语言指令操作的研究/产品。
  • 长程多步任务(需要跨帧状态记忆)或遥操作数据量大的策略训练。

最终判断

  • 是值得记入知识库的具身基础模型发布:把历史上下文、具身推理、动作对齐三个设计做成一体,且真机 Table30 v2 拿到 SOTA,方向校验较强。
  • 对当前具身智能的实际价值:高。它把三个相对分散的方向(long-horizon memory、VLA reasoning、action supervision)收敛到一个可运行的通用模型里,并开源权重,是可复现、可跟踪的路线参照。
  • 跟踪价值:① 是否有完整论文/消融放出;② 4B 主干能否向更大规模迁移成功;③ 后续 DM 系列在开放世界评测(如 LIBERO、RoboChallenge)的持续表现;④ 开源后社区 fine-tune 到新机型、新任务的泛化证据。

继续阅读

上一篇

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA 将高频控制从 LLM 居中的 V→L→A 改为轻量的直接 V+L→A,在 LIBERO 达到 97.7% 且只需 0.2B、31.2ms、0.9GB。

下一篇

What Matters for Latent Actions in Robot Learning

这是第一篇对 latent action model(LAM,隐式动作模型)做系统性实证研究的论文:把 LAPO、LAOF、CoMo、CFD-AE 等代表方法统一进同一个自编码框架,系统扫描了 41 个设计选择(建模范式、学习目标/正则化、隐式动作集成方式),并检验了 4 个代理指标能否预测下游操纵性能。核心结论是**原始 LAPO 反而是最强基线**,光学流(RAFT/SEA-RAFT)这类运动先验反而有害,隐式动作在 VLM 骨干微调后能显著提升下游策略与真实机械臂性能(真机成功率 64.75% → 79.25%)。对做「用无标注视频训练机器人」方向的人,这是一份可直接照抄的配方表。