现有 VLA 模型主要依赖视觉与语言,在插拔、装配、擦拭这类需要精细力控的接触密集任务上很脆弱,尤其是遮挡或动态不确定条件下。ForceVLA 把末端 6 轴力/力矩当作一等模态 (first-class modality),用一个力感知 MoE 模块 FVLMoE 在动作解码阶段动态融合视觉-语言表征与实时力反馈,在 5 个真实接触密集任务上比强 π0 基线平均成功率提升 23.2%。
接触密集操作不只是语义理解和空间规划,它本质上由交互力驱动。人类天然会整合触觉与本体感觉来调整操作策略,而现有 VLA 严重依赖视觉/语言线索,常常忽略力这一对精确物理交互至关重要的模态——结果在插入、工具使用、装配等任务上(尤其遮挡或视觉条件差时)表现脆弱甚至失败。
"6D external force sensed at the robot's end-effector should be treated as a first-class modality and formally integrated into the action expert module to enable phase-aware action generation based on force feedback during physical interaction."
论文还强调:力需求会随任务阶段演化——精细抓取、受控插入、柔顺表面接触各自需要不同形式的力调制;现有方法缺乏感知并适应这些动态变化的机制。
ForceVLA 是端到端多模态机器人策略,构建在 π0 框架之上,整合视觉、语言、本体感觉与 6 轴力反馈,通过 conditional flow matching 生成动作。多路 RGB 视觉与语言指令由基于 PaliGemma 的 SigLIP 视觉-语言模型编码为上下文嵌入;核心创新 FVLMoE 把力读数投影为 token 并与视觉-语言嵌入融合,其输出作为引导信号注入 flow-based 动作头。
力模态在 VLM 处理完视觉与语言之后才引入——FVLMoE 因此扮演类似"高级皮层联合区"的角色,把 VLM 预训练的视觉-语言表征与新引入的 force token 整合。原始 6 轴力/力矩 fraw ∈ ℝ6 经线性投影 φF 成一个 force token,与 VL 特征拼接为 Ein = [EVL; EF]。序列先过一层带多头自注意力 + FFN 的 encoder 做共享精炼,再进入 sparse MoE 层(E = 4 个 expert MLP,Top-k = 1 路由),经残差连接得到融合特征,最后线性投影匹配动作 expert 维度。
融合特征取最后 Haction 个 token 作为引导 GFVLMoE,与 VLM 处理本体状态 st 和带噪动作轨迹得到的 Ssuffix 逐元素相加注入——让接触感知的上下文在每个去噪步直接调制生成的动作序列。数据方面,作者用 Flexiv Rizon 7-DOF 机械臂 + Dahuan 自适应夹爪、Quest3 VR 遥操作采集了 ForceVLA-Data:同步的视觉 / 本体感觉 / 力-力矩信号,覆盖 5 个接触密集任务,共 244 条轨迹、约 14 万同步时间步。
在 5 个真实接触密集任务上评测:Bottle Pumping、Plug Insertion、USB Drive Insertion、Whiteboard Wiping、Cucumber Peeling。基线均从 SOTA 的 π0 架构派生:π0-base(w/o F 与 w/ F,力直接拼接到状态输入)以及对应的 π0-fast 变体。每任务约 50 条专家演示训练;插入/按压任务各 20 次、擦白板 10 次、削黄瓜 15 次试验评测。
| Model | 平均成功率 | 说明 |
|---|---|---|
| π0-fast w/ F | 14.2% | 紧凑 token 空间被朴素力 token 扰乱 |
| π0-fast w/o F | 31.0% | — |
| π0-base w/o F | 37.3% | 标准 π0,无力输入 |
| π0-base w/ F | 40.2% | 力直接拼接,仅微弱提升 |
| ForceVLA (Ours) | 60.5% | 较 π0-base w/o F 提升 +23.2% |
关键结论:"beyond the presence of force data, how it is integrated is critical to performance gains." 把原始力信号直接喂给 π0-base 只从 37.3% 涨到 40.2%,而 ForceVLA 借 FVLMoE 达到 60.5%——说明有效融合而非仅有力数据才是关键。
| Model | Avg. Peel Length (cm) ↑ | Min. Strokes to Clean ↓ |
|---|---|---|
| π0-base w/o F | 10.27 | 14 |
| π0-base w/ F | 13.17 | 10 |
| ForceVLA (Ours) | 14.12 | 7 |
在物体几何、插座高度、视觉遮挡、不稳定插座等扰动下评测。ForceVLA 平均 63.78%,明显领先。注意这里并非全面碾压:π0-fast w/o F 在 Height Gen. 上并列最好 (88.89%),而 Unstable Socket 一列 ForceVLA 仅 20%,反而低于 π0-fast w/ F 的 30%。
| Model | Obj. Gen.1 | Obj. Gen.2 | Height Gen. | Visual Occ. | Unstable Socket | Average |
|---|---|---|---|---|---|---|
| π0-base w/o F | 48.0 | 10.0 | 66.67 | 60.0 | 10.0 | 38.93 |
| π0-base w/ F | 32.0 | 10.0 | 77.78 | 30.0 | 10.0 | 31.96 |
| π0-fast w/o F | 80.0 | 35.0 | 88.89 | 50.0 | 10.0 | 52.78 |
| π0-fast w/ F | 32.0 | 5.0 | 44.44 | 50.0 | 30.0 | 32.29 |
| ForceVLA (Ours) | 80.0 | 40.0 | 88.89 | 90.0 | 20.0 | 63.78 |
验证"力应在何时、以何种方式融入"这一核心设计。Early fusion 会严重损害性能:在 VLM 之前用 MoE 融合力 (MoE before VLM) 完全失败(0%)——改变预训练 VLM 的输入表征会破坏其学到的特征分布。晚期融合更好:"concatenate after VLM" 达 60%,而 ForceVLA 用 FVLMoE 在 VLM 之后自适应融合达到 80%。
| Model | Success Rate |
|---|---|
| baseline (π0) | 45% |
| linear before VLM | 55% |
| MoE before VLM | 0% |
| concatenate after VLM | 60% |
| ForceVLA (Ours) | 80% |
路由分析(附录 C):不同任务表现出不同的 expert 利用模式——insert plug / peel cucumber 有明显的阶段性专家分化,wipe board 则始终偏好单一专家;Expert 0 在多任务中占据近半 token,疑似充当"通用专家"负责多模态融合或共享控制原语。
"ForceVLA currently utilizes estimated external wrench values." 这些估计在极端触觉敏感场景下可能无法达到直接高保真测量的精度;作者提出可探索更好的传感器或先进标定技术来进一步细化精细控制能力。
实验主要在带集成力-力矩传感的机器人平台上验证,这类平台成本高,自然限制了更广泛的可及性。作者表示正在评估 ForceVLA 在更常见、低成本、外接或改装力传感平台上的适应性与性能,以推动力感知操作研究的普及。
由 Table 2 可见:在 Unstable Socket 条件下 ForceVLA 仅 20%,低于 π0-fast w/ F 的 30%;在 Height Gen. 上也只是与 π0-fast w/o F 并列 (88.89%)。说明在剧烈物理不稳定场景中,力感知融合带来的收益仍不稳健、有待提升。