论文阅读“DexUMI: Using Human Hand as the Universal Manipulation Interface for Dexterous Manipulation“
摘要
We present DexUMI — a data collection and policy learning framework that uses the human hand as the natural interface to transfer dexterous manipulation skills to various robot hands.
DexUMI includes hardware and software adaptations to minimize the embodiment gap between the human hand and various robot hands.
The hardware adaptation bridges the kinematics gap using a wearable hand exoskeleton. It allows direct haptic feedback in manipulation data collection and adapts human motion to feasible robot hand motion.
The software adaptation bridges the visual gap by replacing the human hand in video data with high-fidelity robot hand inpainting.
We demonstrate DexUMI’s capabilities through comprehensive real-world experiments on two different dexterous robot hand hardware platforms, achieving an average task success rate of 86%.
结论
We present DexUMI, a scalable and efficient data collection and policy learning framework that uses the human hand as an interface to transfer human hand motion to precise robot hand actions while providing natural haptic feedback.
Through extensive challenging real-world experiments, we demonstrate DexUMI’s capability in learning dexterous manipulation policies for precise, contact-rich, and long-horizon tasks.
Our work establishes a new approach to collecting real-world dexterous hand data efficiently and at scale beyond traditional teleoperation.
现在我来为您详细分析这篇 DexUMI 论文。这是一篇发表在 CoRL 2025(Conference on Robot Learning)上的高质量研究论文,并入选了 Best Paper Final List。
一、研究背景与核心问题
1.1 领域背景
灵巧操作(Dexterous Manipulation)是机器人学中最具挑战性的领域之一。人类双手能够轻松完成各种复杂操作,但将这些技能迁移到机器人手上面临巨大障碍,主要源于**“具身差距”(Embodiment Gap)**:
- 运动学差异:人手与机器人手的自由度、关节结构、运动范围不同
- 接触表面差异:指尖形状、材质、大小差异
- 感知信息差异:触觉、视觉反馈的不同
- 外观差异:视觉上的显著区别影响策略学习
1.2 核心挑战
现有的遥操作(Teleoperation)方法存在以下问题:
- 空间观察不匹配:操作者需要看着机器人执行,而非直接观察自己的手
- 缺乏直接触觉反馈:无法感受真实的接触力
- 需要机器人在场:数据采集必须在机器人旁边进行,限制了灵活性
- 重定向(Retargeting)精度不足:基于视觉指尖跟踪的方法存在误差,特别是拇指灵活性差异
二、DexUMI 核心创新
DexUMI 提出了一个完整的数据收集与策略学习框架,通过硬件适应和软件适应两个层面来最小化具身差距。
2.1 硬件适应:可穿戴外骨骼设计
设计目标
- 共享关节-动作映射:外骨骼与目标机器人手必须具有相同的关节到指尖位置映射(包括运动范围限制)
- 可穿戴性:必须允许用户手部有足够的自然运动空间
关键创新:双层优化框架
针对每个目标机器人手,DexUMI 设计定制化的可穿戴外骨骼:
优化目标:
max
p
S
(
W
exo
tip
(
p
)
,
W
robot
tip
)
\max_{\mathbf{p}} \mathcal{S}(\mathcal{W}_{\text{exo}}^{\text{tip}}(\mathbf{p}), \mathcal{W}_{\text{robot}}^{\text{tip}})
pmaxS(Wexotip(p),Wrobottip)
其中:
- p = { j 1 , . . . , j n , l 1 , . . . , l m } \mathbf{p} = \{j_1,...,j_n, l_1,...,l_m\} p={j1,...,jn,l1,...,lm} 是外骨骼设计参数(关节位置和连杆长度)
- W tip \mathcal{W}^{\text{tip}} Wtip 表示指尖工作空间(SE(3)空间中所有可能的指尖姿态集合)
- S ( ⋅ , ⋅ ) \mathcal{S}(\cdot,\cdot) S(⋅,⋅) 是两个工作空间的相似度度量
双向约束:
- 外骨骼覆盖机器人手的工作空间(确保机器人能执行的动作外骨骼也能做)
- 外骨骼工作空间包含于机器人手工作空间(防止生成机器人无法到达的姿态)
实际优化策略:
- 精确匹配指尖连杆的运动学
- 对不太可能与物体接触的非指尖连杆允许更大的灵活性
- 特别处理拇指的旋前-旋后运动(避免与人手碰撞)
传感器集成(四大关键组件)
| 传感器 | 功能 | 技术细节 |
|---|---|---|
| 关节编码器 (S.1) | 精确捕捉关节动作 | Alps 电阻式位置编码器,每个驱动关节一个 |
| 腕部姿态跟踪 (S.2) | 6DoF 腕部位姿 | iPhone ARKit(仅数据采集时使用) |
| 视觉传感器 (S.3) | 第一人称视角观察 | 150° 对角视场角广角相机(OAK-1),腕下安装 |
| 触觉传感器 (S.4) | 接触力感知 | 与目标机器人手相同的触觉传感器类型 |
关键设计决策:
- 相机在腕部坐标系中的位姿对外骨骼和机器人手保持一致,确保训练和部署时的视觉一致性
- 触觉传感器类型匹配:XHand 使用电磁触觉传感器,Inspire Hand 使用 FSR(力敏电阻)传感器
2.2 软件适应:视觉差距弥合
这是 DexUMI 最具创新性的部分。由于人手/外骨骼与机器人手外观差异巨大,直接用人手视频训练的策略在部署时会因视觉分布偏移而失效。
四步数据处理流程
步骤 V.1:分割人手和外骨骼
- 使用 SAM2(Segment Anything Model 2)分割视频中的外骨骼
- 标准化协议:操作者始终以相同手势开始,可复用相同的提示点
步骤 V.2:环境背景修复(Inpainting)
- 使用 ProPainter(基于光流的视频修复方法)填充被移除的外骨骼区域
- 生成"无手"的纯背景视频
步骤 V.3:记录对应的机器人手视频
- 在机器人手上重放记录的关节动作(无需机械臂)
- 使用 SAM2 提取机器人手像素,丢弃背景
步骤 V.4:遮挡感知合成
- 关键挑战:机器人手不总是出现在最上层(存在手-物遮挡关系)
- 解决方案:计算外骨骼掩码与机器人手掩码的交集,识别交互过程中手的可见部分
- 仅在可见掩码区域内用机器人手像素替换修复后的背景像素,保持自然的遮挡关系
三、实验验证与关键结果
3.1 实验平台
两款截然不同的机器人手:
- Inspire Hand (IHand):12-DoF(6个主动自由度),欠驱动手
- 拇指:2主动 + 2被动 DoF
- 其他手指:1主动 + 1被动 DoF
- XHand:12个主动自由度,全驱动手
- 拇指:3 DoF
- 食指:3 DoF
- 其余手指:各2 DoF
四个真实世界任务:
| 任务 | 使用手型 | 难度特征 |
|---|---|---|
| Cube (方块抓取放置) | IHand | 基础精度测试 |
| Egg Carton (鸡蛋盒开启) | IHand | 多指协调(4指下压+拇指提拉) |
| Tea (茶叶夹取) | IHand & XHand | 接触丰富操作,毫米级精度,可变形工具 |
| Kitchen (厨房任务) | XHand | 长程任务(4步序列):关旋钮→移锅→取盐→撒盐 |
3.2 核心实验结果
总体性能:平均成功率 86%
表 I:Inspire Hand 评估结果(阶段性累积成功率)
| 动作类型 | 触觉 | 视觉 | Cube | Carton | Tea-tool | Tea-leaf |
|---|---|---|---|---|---|---|
| Rel (相对) | Yes | Inpaint | 1.00 | 0.85 | 1.00 | 0.85 |
| Abs (绝对) | Yes | Inpaint | 0.10 | 0.35 | 0.80 | 0.00 |
| Rel | No | Inpaint | 0.95 | 0.90 | 1.00 | 0.90 |
| Abs | No | Inpaint | 0.90 | 0.85 | 0.90 | 0.60 |
| Rel | No | Mask | 0.60 | 0.10 | 0.90 | 0.50 |
| Rel | No | Raw | 0.20 | 0.05 | 0.85 | 0.05 |
表 II:XHand 评估结果
| 动作类型 | 触觉 | 视觉 | Tea-tool | Tea-leaf | Kitchen-knob | Kitchen-pan | Kitchen-salt |
|---|---|---|---|---|---|---|---|
| Rel | Yes | Inpaint | 1.00 | 0.85 | 0.95 | 0.95 | 0.75 |
| Abs | Yes | Inpaint | 1.00 | 0.25 | 0.50 | 0.45 | 0.00 |
| Rel | No | Inpaint | 0.95 | 0.80 | 0.95 | 0.95 | 0.15 |
| Abs | No | Inpaint | 1.00 | 0.75 | 0.60 | 0.60 | 0.0 |
3.3 关键发现
发现 1:相对手指轨迹更鲁棒
- 相对动作(Relative) 在所有任务中始终优于 绝对动作(Absolute)
- 原因分析:
- 相对动作的分布更简单,更容易学习
- 相对动作学习的是反应性行为:增量动作持续累积直到达到关键接触事件
- 绝对动作学习的是静态映射,如果映射存在误差会导致动作停滞
发现 2:触觉反馈的价值具有任务依赖性
-
有趣现象:XHand 的触觉传感器在高压后会漂移,因此在大多数情况下添加触觉反而使结果变差
-
例外:只有配合相对轨迹时,策略才能从触觉感知中获益
-
Inspire Hand:手动安装的触觉传感器噪声更大,所有方法添加触觉后性能都下降,但相对轨迹方法的性能下降更少
-
触觉显著帮助的任务:取盐任务(Salt Picking)
- 触觉传感器在手指接触盐碗时给出清晰的大读数
- 接近抓取时视觉信息很少(相机视角被碗遮挡)
- 有触觉:手指总是先插入盐中再闭合
- 无触觉:手指有时在空中尝试抓取盐
发现 3:软件适应(Inpainting)至关重要
- Raw(原始图像):成功率极低(Cube 0.20,Carton 0.05)
- Mask(绿色掩码):性能有所提升但仍有限(Cube 0.60,Carton 0.10)
- Inpaint(修复):达到最佳性能,视觉差距弥合是关键
3.4 数据采集效率
在"茶叶夹取"任务上的 15 分钟采集效率对比:
- 人手直接操作:51 次成功演示(上限基准)
- DexUMI:36 次成功演示(是人手的 70%)
- 传统遥操作:11 次成功演示
DexUMI 比传统遥操作效率高 3.2 倍,同时保持了数据质量。
四、技术细节深度分析
4.1 外骨骼设计优化实例
XHand 外骨骼:
- 初始化:基于 URDF 模型
- 优化后:拇指向后移动 50mm,避免与人手拇指碰撞,同时保持指尖和关节映射
Inspire Hand 外骨骼:
- 由于 Inspire Hand 的手指机制细节不可用,使用等效的四连杆机构替代
- 优化后:拇指向后移动 28.85mm
4.2 关节映射校准
由于关节摩擦和电机间隙,外骨骼关节编码器值 θ exo i \theta_{\text{exo}}^i θexoi 与机器人手电机值 M robot i \mathcal{M}_{\text{robot}}^i Mroboti 之间通常存在非线性关系。
校准过程:
- 在物理机器人上均匀采样 K 个电机值
- 通过叠加视觉观察找到对应的外骨骼关节值
- 训练简单的回归模型建立映射关系
精度限制:只能保证"单向"精度(闭合或张开),这会导致修复和动作映射过程中的微小差异。
4.3 策略架构
输入:
- 处理后的视觉观察 o t o_t ot
- 触觉感知 f t f_t ft
输出:
- 动作序列 { a t , . . . , a t + L } \{a_t, ..., a_{t+L}\} {at,...,at+L},长度 L L L
- 机器人动作 a t a_t at 包括:6-DoF 末端执行器动作 + N-DoF 手部动作(N 取决于具体硬件)
五、局限性与未来工作
5.1 硬件适应局限
-
每款手需定制外骨骼:虽然展示了欠驱动和全驱动手的通用性,但仍需针对每款手进行硬件特定调优
- 未来方向:给定机器人手模型和人手描述,实现完全自动化的优化
-
指尖匹配局限:当前仅关注指尖工作空间匹配,未建模其他潜在接触几何(如指节侧面)
- XHand 的厨房任务中使用了拇指和食指侧面推锅,展示了非指尖接触的重要性
-
可穿戴性可进一步提升:
- 可集成 TPU 等软材料改善与人手接触的部分
- 受目标手设计和 3D 打印材料强度限制,某些伸展动作仍受限
-
触觉传感器可靠性:
- Inspire Hand 的 FSR 传感器对安装方式敏感
- XHand 的电磁触觉传感器在高压后会漂移
- 人手产生的力通常大于机器人手,导致传感器频繁漂移
- 未来可探索基于视觉的触觉传感器(如 GelSight)和电容式力/力矩传感器
-
材料强度限制:有时人手会轻微扭曲外骨骼连杆,编码器无法捕捉这种变形
5.2 软件适应局限
-
仍需真实机器人硬件:获取机器人手图像需要真实机器人
- 未来可训练图像生成模型,输入电机值输出生成的手姿态图像
-
修复质量限制:
- 机器人手的光照效果无法完全重现
- 某些区域因修复过程限制显得模糊
-
相机位置固定:当前要求相机刚性固定在机器人手/外骨骼上,不支持移动相机
- 未来可训练接收相机-手相对位姿和手部姿态信息的图像生成模型
5.3 现有机器人手硬件局限
-
精度不足:两款手都存在间隙和摩擦问题
- Inspire Hand 指尖位置存在滞后现象(从 1000→500 与从 0→500 到相同电机值,最终位置不同)
-
尺寸差异:机器人手与人手的大小差异可能导致可穿戴性问题(如机器人手是人手两倍大时难以匹配关节配置)
-
协同设计机会:许多可穿戴性问题源于现有商业硬件的设计约束
- 未来方向:先设计对人手舒适且完全可操作的外骨骼,再以此为基础设计机器人手
六、与相关工作的对比
| 方法 | 类型 | 优势 | 局限 |
|---|---|---|---|
| Motion Capture Gloves [72,56,35] | 遥操作 | 便携 | 需要重定向,拇指灵活性差异大 |
| VR 设备 [26,12,9] | 遥操作 | 沉浸式 | 缺乏直接触觉反馈 |
| 相机跟踪 [28,66,48] | 遥操作 | 低成本 | 视觉遮挡、精度有限 |
| Handheld Grippers [10,42,55] | 可穿戴 | 无需机器人在场 | 主要针对平行夹爪,难以适应多指系统 |
| DexCap [60] | 可穿戴 | 接触数据采集 | 仍需重定向和遥操作校正 |
| Hand-over-hand [62,14] | 可穿戴 | 直观 | 需要实际机器人手在场并被人手抬起 |
| DexUMI | 可穿戴外骨骼 | 直接触觉反馈、精确关节捕捉、无需机器人在场、视觉一致性 | 每款手需定制外骨骼、触觉传感器可靠性 |
七、论文贡献总结
-
首个通用灵巧手操作接口框架:将人手作为通用操作界面,适用于多样化的机器人手硬件
-
硬件-软件协同设计:
- 硬件:可穿戴外骨骼 + 双层优化设计框架
- 软件:基于视频修复的视觉差距弥合流程
-
全面的实验验证:在两种截然不同的机器人手上验证,涵盖精确操作、长程任务、多指协调、接触丰富操作
-
效率提升:数据采集效率比传统遥操作提升 3.2 倍,同时达到 86% 的平均成功率
-
关键洞察:
- 相对轨迹表示对噪声和硬件缺陷更鲁棒
- 触觉反馈的价值具有任务依赖性,仅在配合相对轨迹时才能发挥作用
- 视觉差距弥合对策略学习至关重要
八、影响与意义
DexUMI 代表了机器人模仿学习数据收集范式的重要进展:
- 降低数据收集门槛:无需昂贵的机器人硬件即可进行高质量数据采集
- 提高数据质量:直接触觉反馈和精确关节捕捉产生更自然、更可行的演示
- 促进可扩展性:效率提升使得大规模数据收集变得可行
- 硬件通用性:框架可适应不同设计的机器人手,推动标准化数据收集接口的发展
这项工作为基础模型时代的机器人学习提供了关键基础设施,使得收集大规模、高质量的灵巧操作数据集成为可能,有望加速通用机器人操作能力的突破。
更多推荐

所有评论(0)