RA-L 2025 · Robotics

DexForce

从力触觉演示中提取「力感知」动作,用于灵巧操作 · Extracting Force-informed Actions from Kinesthetic Demonstrations for Dexterous Manipulation
Claire Chen, Zhongchun Yu, Hojung Choi, Mark Cutkosky, Jeannette Bohg · Stanford University

接触密集的灵巧操作,成败取决于「在正确的时刻、正确的位置施加正确的力」。DexForce 在力触觉演示(kinesthetic demonstration)中直接测量指尖接触力,用一个弹簧刚度模型把「观测到的动作」修正为能复现这些力的「力感知动作(force-informed actions)」,再用它们训练视觉扩散策略。六个任务平均成功率 76%;而直接用不含力的动作训练,成功率几乎为零。

Allegro Hand + CoinFT 力矩传感器 CNN Diffusion Policy 6 个接触密集任务 📄 arXiv:2501.10356 🔗 Project page
dexterous manipulationkinesthetic demonstrationforce-informed actionimitation learningdiffusion policycontact-richimpedance controlAllegro Hand力触觉演示

01 Motivation

模仿学习需要高质量的「状态-动作对」演示。对于接触密集的灵巧任务,这些动作必须能产生正确的力。但现有采集方式(遥操作 / 手部重定向)在接触密集任务上很难用:人到机器人的运动重定向不直观,而且操作者缺乏直接的力触觉反馈,无法判断施加的力是否合适。

“For contact-rich dexterous manipulation tasks that require dexterity, the actions in these state-action pairs must produce the right forces.” —— 演示里的动作不仅要「到位」,更要「用对力」。

DexForce 换了个思路:用力触觉演示(操作者亲手引导机器人手运动)——这种方式天然让人能感知到接触。但直接记录下的运动只是「达到某个位置」的轨迹,并没有编码「为达到该位置需要施加多少力」。DexForce 的贡献就是把这份被测量到的力,还原成机器人自己能复现的动作。

teaser
核心思想:力触觉演示中测得的接触力 f,被用来把观测指尖位置 xo 修正为「力感知目标」 xf。当用阻抗控制器(impedance controller)跟踪 xf 时,机器人会产生完成任务所需的正确运动与力
76%六任务平均成功率(力感知动作)
≈0%不含力动作训练的策略
6接触密集任务
2可舒适演示的手指数上限

02 Method

DexForce 是一套「演示采集」流程,核心是把「观测动作」变成「力感知动作」。它建立在阻抗控制器的弹簧模型之上:控制律第一项把「力—位移」建模为弹簧,在准静态(quasi-static)假设下,同一个弹簧模型可以反过来,由观测位置和接触力算出能复现该力的目标位置。

method pipeline
方法总览。左列:力触觉演示中操作者施加不同大小的力,记录观测指尖位置 xo 与接触力 f;中列:由弹簧模型计算力感知目标 xf;右列:用阻抗控制器开环回放(replay)这些目标,让机器人自己复现运动和力,同时用腕部相机采集图像——这样训练数据里就不再出现操作者的手

力感知动作:一个弹簧修正

给定某个观测指尖位置 xo 以及该手指施加在物体上的接触力 f,力感知目标为:

xf = xo + kf · f

其中 kf 是一个手工调节的标量刚度参数。直觉上:要让阻抗控制器真的「压」出力 f,就得把目标位置往施力方向多偏移一点(overshoot),偏移量正比于所需的力。论文对所有任务统一取 kf = 0.0045,调法是使回放能成功复现原始力触觉演示。

spring model
弹簧刚度直觉:阻抗控制的第一项将力与位移建模为弹簧;准静态下同一模型可反解——想复现更大的接触力,就把跟踪目标沿施力方向偏移更多。

两阶段流程

力触觉演示:操作者手动引导机器人手完成任务,记录指尖位置与两指的 6 轴力/力矩;用上式算出力感知目标序列。② 开环回放采集:用阻抗控制器跟踪这些力感知目标,机器人独立复现整段运动,并用腕部相机采集图像观测。回放得到的「新观测位置 + 图像」构成干净的机器人演示数据集,用于训练策略。

03 Experiments

硬件:一只 Allegro Hand,腕部装 RealSense 相机(加鱼眼镜头扩大视野),拇指与食指根部各装一枚 CoinFT 硬币大小的电容式 6 轴力/力矩传感器。策略:对所有任务训练基于 CNN 的 Diffusion Policy,用 ResNet18 编码 RGB 图像;观测 horizon = 2,动作预测 horizon = 16,执行 horizon = 8,训练 1000 epochs;演示以 30Hz 记录、降采样到 10Hz。每个任务在相同的 30 个随机初始物体配置上评估。

six tasks
六个接触密集任务:slide cube、reorient smiley、open AirPods、grasp battery、unscrew nut、flip box。任务覆盖不同的接触交互类型——施加精确的力、以及不断建立与断开接触。因人手可舒适演示至多两指,故选取单指「外在灵巧(extrinsic dexterity)」与两指任务。

力感知动作 vs. 不含力动作

核心对照实验:同样的力触觉演示,一组用 DexForce 的力感知动作,另一组直接用不考虑接触力的观测动作训练策略。

76%力感知动作 · 六任务平均
near-zero不含力动作 · 六任务
“policies trained on our force-informed actions achieve an average success rate of 76% across all tasks. In contrast, policies trained directly on actions that do not account for contact forces have near-zero success rates.”

Ablation:把力放进策略「观测」里

第二组实验消融的是策略观测中是否包含力信息(注意与上面「动作」的消融区分),三种设置:RGB, F/T(RGB + 原始 6 轴力/力矩向量)、RGB, 0/1(RGB + 二值接触信号,力幅超过 0.55N 记为 1)、RGB only(仅图像)。结论是:加入力观测从不损害性能,且对越需要精度与协调的任务帮助越大。

force observation ablation
力观测消融(Fig. 8):箭头表示相对 RGB-only 策略的成功率增减,* 表示统计显著(Fisher 精确检验,α=0.05)。上三行为分布内评估,底行为两个 OOD 评估。加入 6 轴力观测(RGB, F/T)通常优于二值接触信号(RGB, 0/1)。
任务(力观测帮助最大者)RGB, F/T 相对 RGB-only 的成功率提升
open AirPods+1600%
unscrew nut+136%
slide cube+58.8%

论文分析:open AirPods、unscrew nut、slide cube 这三类任务在 RGB-only 下更易失败,因为机器人无法施加满足所需精度与协调度的力——例如 open AirPods 时 RGB-only 策略常把盖子往错误方向压得过重,导致盖子纹丝不动。

刚度 kf 与 OOD 泛化

stiffness sweep
刚度 kf 敏感性扫描:六个任务存在重叠的可行区间,所选 kf = 0.0045 落在所有任务的容许范围内;对力更敏感的任务容许区间更窄,也正对应它们从力观测中获益更大。

OOD 场景:unscrew nut 训练时螺母初始旋转在 0°–360°,OOD 测试推到 360°–900°;flip box 的 OOD 是箱子加重 100g。这两项均包含在力观测消融的底行评估中。

04 Limitations

Note: 论文正文未设独立的 “Limitations” 章节;以下第 1 条为作者在文中明确陈述,第 2–3 条为依据方法设计的合理推断(inferred)
手指数受限于人手可舒适演示的范围(作者陈述)

“a human operator can comfortably collect kinesthetic demonstrations with up to two robot fingers” —— 因此论文只考虑单指「外在灵巧」与两指任务,尚未覆盖需要多指全手协同的更复杂灵巧操作。

依赖手工调节的单一刚度 kf(inferred)

力感知修正用一个全局标量 kf=0.0045。虽然刚度扫描显示各任务有重叠可行区间,但该值需针对硬件/任务手工调;对力更敏感的任务容许区间更窄,暗示换硬件或更极端任务时可能需要重新标定。

采集流程较重,规模化受限(inferred)

方法建立在人工力触觉演示 + 阻抗控制器开环回放之上,每任务演示量有限(约 10–20 段量级)。相比遥操作大规模采集,该流程更依赖人工逐段引导与回放,扩展到大规模数据集的成本较高。