IEEE T-IE 2025 · Robotics

AdmitDiff Policy:面向通用接触密集操作的导纳视觉运动策略学习

Admittance Visuomotor Policy Learning for General-Purpose Contact-Rich Manipulations
Zhou, Jiao, Li, Yuan, Fang, Li · IEEE Transactions on Industrial Electronics, 2025

contact force 当作与视觉、本体同等重要的一路观测:用一套低成本带触觉反馈的遥操作系统采集"柔顺"示范,用 diffusion 模型同时规划动作轨迹与期望接触力,再交给 admittance controller 柔顺执行。五个接触密集任务上,平均接触力降低 48.8%、成功率提升 15.3%

UR 机械臂 + 多指灵巧手 Consistency Distillation · 单步去噪 ~7ms 📄 arXiv:2409.14440 IEEE Xplore (DOI)
admittance controlcontact-rich manipulationvisuomotor policydiffusion policyconsistency modelforce control 力控teleoperation 遥操作imitation learning

01 Motivation

接触密集环境里,机器人光靠视觉与本体感知远远不够:碰撞感知、高精度抓取、高效操作都要靠接触力来补足信息。但现有 vision-based 遥操作难以给操作者交互反馈、也难以精确捕捉手部与手指动作;而现有 diffusion 策略对力控阶段切换与控制精度关注不足。

"Contact force in contact-rich environments is an essential modality for robots to perform general-purpose manipulation tasks, as it provides information to compensate for the deficiencies of visual and proprioceptive data in collision perception, high-precision grasping, and efficient manipulation."

作者指出瓶颈有二:其一,数据采集难 —— 缺少能给操作者力反馈、又能精确检测手指关节的低成本遥操作方案;其二,持续力控缺位 —— "there is limited work addressing continuous force control within general-purpose multi-stages manipulations",尤其是多指手在多阶段任务里的力规划与控制。

teaser: human demonstration to robot autonomy on drawer task
以 Dragging(开抽屉)为例:上方为遥操作人类示范,下方为机器人自主执行的 Reaching → Stable Pulling → Detaching 三阶段。底部曲线对比有/无力控(FC)时的 X 轴接触力:蓝线(AdmitDiff Policy,带力控)全程平稳贴近期望力,红线(w/o FC)在拉动阶段冲到约 −13 N,力波动剧烈。
−48.8%平均接触力(mean)
−52.0%接触力标准差(std)
+15.3%平均成功率
~7ms单步去噪推理耗时

02 Method

整体框架称为 AdmitDiff Policy,由三块组成:(1) 低成本带触觉反馈的遥操作系统采数据;(2) 以 force / vision / proprioception 为输入的 diffusion 模型,同时输出动作轨迹与期望接触力;(3) 导纳控制器 (admittance controller) 把力-位轨迹转成柔顺执行的目标位姿。

AdmitDiff Policy framework: inference, training, teleoperation
AdmitDiff Policy 框架。左(Inference): 取前两步观测(Contact Force / Hand Joint Angle / Arm Pose / RGB Image),经 MLP + CNN Encoder 编码,以 FiLM 条件化;student diffusion model(K=2)一次输出未来 8 步的动作及期望力 (𝓕, p, q),交给 Interpolator 与 admittance controller,以 125Hz 控制机械臂、10Hz 更新。中(Training): teacher 模型按 100 步去噪训练后冻结,用 consistency loss 蒸馏出单步去噪的 student(Policy Distill for One-Step Denoising)。右(Teleoperation): 1) Arm Control、2) Hand Joint Angle Control、3) Vibration Feedback 三路组成的遥操作系统采集含接触力的示范。

低成本遥操作系统(< $400)

三个功能模块:Wrist Pose Module 用 Intel RealSense T265 跑 Visual-Inertial Odometry 提供腕部空间位姿;Gesture Detection Module 用 Ultraleap Leap Motion Controller 估计手部关键点,再 kinematic retargeting 到机器人手;Force Feedback Module 在操作者掌心贴 ERM 振动马达,把 0–20N 接触力线性映射为振动强度,让人"感到"接触。

多模态 diffusion 策略与力规划

策略函数把全局/局部图像、本体状态与腕部 F/T 传感器读数映射到 (末端位姿 p_ee、手指关节角 q_finger、期望接触力 F_desired)。网络用 ResNet-18 编码视觉、3 层 MLP 编码低维量,再由 multi-head Conv-Blocks 分别预测不同动作相关量,并以 FiLM 条件化 —— 让接触力从一个被动读数升级为策略主动规划的输出目标。

Consistency Distillation 提速

在 EDM 框架下先训一个 100 步去噪的 teacher,冻结后用 consistency loss 蒸馏出单步去噪的 student。推理耗时从 Diffusion Policy 的约 100 ms 压到 Consistency Model 的约 7 ms,满足实时闭环力控。

导纳控制器柔顺执行

用二阶导纳模型 M_d(p̈−p̈_d)+B_d(ṗ−ṗ_d)+K_d(p−p_d)=F−F_d 把"期望力与期望位姿"融合成实际目标位姿;M_d/B_d/K_d 按任务调。目标位置与力用一维线性插值 (Interp1d)、旋转用球面线性插值 (Slerp) 平滑,输出到 125Hz 底层控制。

03 Experiments

在真实机器人上设计五个针对不同 action primitive 的接触密集任务,每个任务采 50 条示范轨迹,训练 400 epochs(约 8 小时)。对比 Diffusion Policy (DP)、Consistency Policy (CP) 两个 SOTA,以及去掉力控模块的消融 AdmitDiff Policy w/o FC。

five contact-rich tasks: insertion, dragging, door opening, wiping, drawing
五个任务(对应不同 action primitive):(a) Insertion 插拔/拧转 —— 抓充电插头对准 2cm 孔位;(b) Dragging 拉动 —— 拉开随机位置抽屉;(c) Door Opening 推 —— 施加 20–30N 转动把手再推门;(d) Wiping 擦拭 —— 抓橡皮沿 Z/X 轴擦;(e) Drawing 划写 —— 抓记号笔沿轨迹保持 Z 轴恒力。

成功率(TABLE II,真实实验,越高越好)

TaskDiffusion PolicyConsistency PolicyAdmitDiff w/o FCAdmitDiff Policy (Ours)
Insertion60%70%75%90%
Door Opening70%75%80%95%
Dragging80%80%85%95%
Wiping70%75%85%90%
Drawing20%25%40%45%
Average60%70%73%83%

相对其它方法,平均成功率提升约 15.3%。带力控(Ours)在每个任务上都是最高。

接触力对比(越低/越集中越好)

box plot of contact force mean and std across five tasks and four methods
五任务、四方法接触力箱线图(单位 N)。蓝色 AdmitDiff Policy 在几乎所有任务上力最低且分布最窄:Door Opening 从约 15–18N 压到约 10N,Wiping、Draw 压到约 2.5–3N。作者报告:相比其它方法,平均接触力(mean)降低约 48.8%、标准差(std)降低约 52.0%;Door Opening 上 mean 最多降 53.92%、力波动降 76.51%

消融与遥操作评测

去掉力控 (w/o FC) 后成功率与接触力平稳性都明显下降,说明把期望力纳入规划 + 导纳执行是主要增益来源,而非单纯换扩散/一致性骨干。作者还在 Telekinesis Benchmark(TABLE I)上评测了本文遥操作系统的采集性能。

04 Limitations

Note: 论文正文没有独立的 Limitations 章节;以下第 1 条转述自 Conclusions 的 future work,其余为依据方法/结果推断(inferred)
力控粒度停留在末端,未到手指级(stated / future work)

作者在结论中表示未来将"探索 finger-level admittance control 以实现更精确的力控操作",并把方法推广到"更复杂的任务以进一步验证泛化能力"。当前导纳控制主要作用于末端位姿层面。

高精度纯轨迹任务仍是短板(inferred)

Drawing(划写)任务四种方法成功率都很低(20%→45%),即便 Ours 也仅 45%。这类以视觉引导、空间轨迹精度为主、触觉约束弱的任务,收益有限。

每任务单独调参与训练(inferred)

导纳矩阵 M_d/B_d/K_d 需"tuned per task",且每个任务单独采 50 条示范、训练约 8 小时。尚未展示跨任务/零样本的统一策略。

依赖专用力/触觉硬件(inferred)

方案依赖腕部 F/T 传感器与掌心 ERM 振动反馈遥操作套件;虽总成本 <$400,但相比纯视觉方案仍引入额外硬件与标定环节。