Robotics · VLA · 接触密集操作

ForceVLA

用 Force-aware MoE 增强 VLA 模型的接触密集操作 (Contact-rich Manipulation)
Jiawen Yu, Hairuo Liu, Qiaojun Yu 等 · 复旦大学 / 上海交通大学 / 上海创智学院 / 上海 AI Lab 等 · 2025

现有 VLA 模型主要依赖视觉与语言,在插拔、装配、擦拭这类需要精细力控的接触密集任务上很脆弱,尤其是遮挡或动态不确定条件下。ForceVLA 把末端 6 轴力/力矩当作一等模态 (first-class modality),用一个力感知 MoE 模块 FVLMoE 在动作解码阶段动态融合视觉-语言表征与实时力反馈,在 5 个真实接触密集任务上比强 π0 基线平均成功率提升 23.2%

π0 + Flow Matching backbone FVLMoE:E=4 experts, Top-k=1 ForceVLA-Data:244 条轨迹 / 14 万步 📄 arXiv:2505.22159 🔗 Project page
Vision-Language-Actionforce-aware MoEcontact-rich manipulationflow matching力反馈 force-torque多模态融合π0机器人插拔 / 装配

01 Motivation · 动机

接触密集操作不只是语义理解和空间规划,它本质上由交互力驱动。人类天然会整合触觉与本体感觉来调整操作策略,而现有 VLA 严重依赖视觉/语言线索,常常忽略力这一对精确物理交互至关重要的模态——结果在插入、工具使用、装配等任务上(尤其遮挡或视觉条件差时)表现脆弱甚至失败。

"6D external force sensed at the robot's end-effector should be treated as a first-class modality and formally integrated into the action expert module to enable phase-aware action generation based on force feedback during physical interaction."

论文还强调:力需求会随任务阶段演化——精细抓取、受控插入、柔顺表面接触各自需要不同形式的力调制;现有方法缺乏感知并适应这些动态变化的机制。

ForceVLA vs baseline without force
Figure 1:ForceVLA 与无力输入基线的对比。没有力反馈时,策略无法修正位姿误差、错误地完成插入;ForceVLA 利用外部力信号动态调整插入策略,即便初始对不齐也能成功完成。
+23.2%平均成功率 vs π0-base 基线
60.5%ForceVLA 五任务平均成功率
80%插头插入等任务最高成功率
90%视觉遮挡 (Visual Occlusion) 下成功率

02 Method · 方法

ForceVLA 是端到端多模态机器人策略,构建在 π0 框架之上,整合视觉、语言、本体感觉与 6 轴力反馈,通过 conditional flow matching 生成动作。多路 RGB 视觉与语言指令由基于 PaliGemma 的 SigLIP 视觉-语言模型编码为上下文嵌入;核心创新 FVLMoE 把力读数投影为 token 并与视觉-语言嵌入融合,其输出作为引导信号注入 flow-based 动作头。

ForceVLA architecture
Figure 3:ForceVLA 总览。视觉与语言输入经预训练 VLM 形成上下文嵌入;外部力信号被投影后经 FVLMoE 模块与 VLM 输出融合;得到的多模态特征引导 flow-based 动作头生成接触感知的机器人动作。

关键点 1 · FVLMoE:晚期融合的力感知 MoE

力模态在 VLM 处理完视觉与语言之后才引入——FVLMoE 因此扮演类似"高级皮层联合区"的角色,把 VLM 预训练的视觉-语言表征与新引入的 force token 整合。原始 6 轴力/力矩 fraw ∈ ℝ6 经线性投影 φF 成一个 force token,与 VL 特征拼接为 Ein = [EVL; EF]。序列先过一层带多头自注意力 + FFN 的 encoder 做共享精炼,再进入 sparse MoE 层(E = 4 个 expert MLP,Top-k = 1 路由),经残差连接得到融合特征,最后线性投影匹配动作 expert 维度。

关键点 2 · 注入 Flow 动作头 & 数据集

融合特征取最后 Haction 个 token 作为引导 GFVLMoE,与 VLM 处理本体状态 st 和带噪动作轨迹得到的 Ssuffix 逐元素相加注入——让接触感知的上下文在每个去噪步直接调制生成的动作序列。数据方面,作者用 Flexiv Rizon 7-DOF 机械臂 + Dahuan 自适应夹爪、Quest3 VR 遥操作采集了 ForceVLA-Data:同步的视觉 / 本体感觉 / 力-力矩信号,覆盖 5 个接触密集任务,共 244 条轨迹、约 14 万同步时间步

03 Experiments · 实验

在 5 个真实接触密集任务上评测:Bottle Pumping、Plug Insertion、USB Drive Insertion、Whiteboard Wiping、Cucumber Peeling。基线均从 SOTA 的 π0 架构派生:π0-base(w/o F 与 w/ F,力直接拼接到状态输入)以及对应的 π0-fast 变体。每任务约 50 条专家演示训练;插入/按压任务各 20 次、擦白板 10 次、削黄瓜 15 次试验评测。

主结果(五任务平均成功率)

Model平均成功率说明
π0-fast w/ F14.2%紧凑 token 空间被朴素力 token 扰乱
π0-fast w/o F31.0%
π0-base w/o F37.3%标准 π0,无力输入
π0-base w/ F40.2%力直接拼接,仅微弱提升
ForceVLA (Ours)60.5%较 π0-base w/o F 提升 +23.2%

关键结论:"beyond the presence of force data, how it is integrated is critical to performance gains." 把原始力信号直接喂给 π0-base 只从 37.3% 涨到 40.2%,而 ForceVLA 借 FVLMoE 达到 60.5%——说明有效融合而非仅有力数据才是关键。

Main task success rates
Figure 5:各方法在五个接触密集任务上的主成功率。ForceVLA 显著超越所有基线;"Wipe Board-1" 指成功完成擦拭动作的成功率,"Wipe Board-2" 指完全擦除标记的成功率。

削黄瓜任务 (Cucumber Peeling)

ModelAvg. Peel Length (cm) ↑Min. Strokes to Clean ↓
π0-base w/o F10.2714
π0-base w/ F13.1710
ForceVLA (Ours)14.127

泛化能力 (Table 2)

在物体几何、插座高度、视觉遮挡、不稳定插座等扰动下评测。ForceVLA 平均 63.78%,明显领先。注意这里并非全面碾压:π0-fast w/o F 在 Height Gen. 上并列最好 (88.89%),而 Unstable Socket 一列 ForceVLA 仅 20%,反而低于 π0-fast w/ F 的 30%

ModelObj. Gen.1Obj. Gen.2Height Gen.Visual Occ.Unstable SocketAverage
π0-base w/o F48.010.066.6760.010.038.93
π0-base w/ F32.010.077.7830.010.031.96
π0-fast w/o F80.035.088.8950.010.052.78
π0-fast w/ F32.05.044.4450.030.032.29
ForceVLA (Ours)80.040.088.8990.020.063.78
Trajectory visualizations
Figure 7:跨任务与条件的轨迹可视化。(a) USB 插入、(b) 瓶泵按压、(c) 稳定/不稳定插座下的插头插入。当出现失败时 ForceVLA 会重试或调整位姿(重定向、重抓取、柔顺跟随移动的插座),最终完成任务——而基线常重复失败动作或施加过大力。

Ablations · 消融(插头插入任务成功率)

验证"力应在何时、以何种方式融入"这一核心设计。Early fusion 会严重损害性能:在 VLM 之前用 MoE 融合力 (MoE before VLM) 完全失败(0%)——改变预训练 VLM 的输入表征会破坏其学到的特征分布。晚期融合更好:"concatenate after VLM" 达 60%,而 ForceVLA 用 FVLMoE 在 VLM 之后自适应融合达到 80%

ModelSuccess Rate
baseline (π0)45%
linear before VLM55%
MoE before VLM0%
concatenate after VLM60%
ForceVLA (Ours)80%

路由分析(附录 C):不同任务表现出不同的 expert 利用模式——insert plug / peel cucumber 有明显的阶段性专家分化,wipe board 则始终偏好单一专家;Expert 0 在多任务中占据近半 token,疑似充当"通用专家"负责多模态融合或共享控制原语。

Router expert load analysis
Figure 9:不同任务在各完成度下的 expert 负载开环评估((a) Pump Bottle、(b) Insert Plug、(c) Wipe Board、(d) Peel Cucumber、(e) Insert USB)。纵轴为平均 expert 负载,横轴为任务完成百分比,体现路由随任务语义与时间结构动态分配计算。

04 Limitations · 局限性

Note: 以下两点为论文 "Limitation" 章节作者明确陈述 (stated);第三点为依据实验数据推断 (inferred)
使用的是估计的外部力矩,而非高保真直接测量 (stated)

"ForceVLA currently utilizes estimated external wrench values." 这些估计在极端触觉敏感场景下可能无法达到直接高保真测量的精度;作者提出可探索更好的传感器或先进标定技术来进一步细化精细控制能力。

依赖集成式、通常高成本的力/力矩传感平台,限制可及性 (stated)

实验主要在带集成力-力矩传感的机器人平台上验证,这类平台成本高,自然限制了更广泛的可及性。作者表示正在评估 ForceVLA 在更常见、低成本、外接或改装力传感平台上的适应性与性能,以推动力感知操作研究的普及。

不稳定/动态扰动下并非全面领先 (inferred)

由 Table 2 可见:在 Unstable Socket 条件下 ForceVLA 仅 20%,低于 π0-fast w/ F 的 30%;在 Height Gen. 上也只是与 π0-fast w/o F 并列 (88.89%)。说明在剧烈物理不稳定场景中,力感知融合带来的收益仍不稳健、有待提升。