Robot Learning · 2026 · arXiv

Let the Dynamics Flow:Stable Flow Matching Dynamical Systems

让动力学“流”起来:稳定的 flow matching 动力系统 (SFMDS)
Rodrigo Pérez-Dattari, Francisco Leiva, Andrea Testa, Leonel Rozo, Javier Ruiz-del-Solar, Noémie Jaquier · KTH · Universidad de Chile · Bosch (CR) · IIT / AI4I

Flow matching 用于模仿学习时表达力强、可扩展、能建模多模态动作,但缺乏机器人策略所需的形式化稳定性保证。SFMDS 用 flow matching 隐式建模机器人运动的向量场,同时把学到的速度约束在由正不变性 / Lyapunov 渐近稳定性推导出的可行集内,做到“stable by design”。提供 soft(惩罚项)与 hard(结构性硬约束、构造上全局稳定)两种变体,并推广到 SE(3) 等 Lie 群。

Imitation Learning / 学习驱动动力系统 Soft & Hard 两种稳定性约束 推广到 Lie groups(SE(3) / 𝕋² / SO(3)) 📄 arXiv:2606.03834 🔗 Project page
Flow Matching稳定动力系统Imitation LearningLyapunov stabilitypositive invarianceLaSalle invariance principleLie group SE(3)multimodal policyasymptotic stability机器人运动生成

01 Motivation · 动机

Flow matching 策略在模仿学习中能高效学到复杂的多模态动作分布,性能优于经典 behavior cloning。但它并非为运动生成与控制设计,缺乏机器人策略所需的严格安全性保证。另一方面,把机器人运动建模为“学习驱动的动力系统 (dynamical systems)”能提供稳定性保证(正不变性、渐近收敛到目标),但已有方法往往只能建模单模态、表达力有限,或依赖 diffeomorphism(可逆神经网络 RealNVP/normalizing flow),以牺牲架构灵活性为代价换取 stable-by-design。

“…incorporating formal stability guarantees into these generative models is a prerequisite to ensure safe and generalizable robot behaviors, which remains a significant challenge.” — SFMDS 正是要在“高表达力生成模型”与“形式化稳定性保证”之间架桥。
teaser
Fig 1:把机器人行为建模为一个 stable flow matching 动力系统。当前速度 ẋ_t = h₁ 由 flow matching 模型学到:从高斯噪声 h₀∼𝒩(0,𝐈) 出发,沿辅助时间 τ 积分向量场 u_τ=∂h_τ/∂τ 得到 h₁。稳定性通过把解空间约束到从潜在 Lyapunov 函数导出的 admissible velocity set Ẋ_A⊂𝒯ₓ𝒳 来强制,蓝/红箭头体现其可生成的多模态行为。状态用 Lie group 表示以处理位姿。
0.000%hard SFMDS 在 LASA 上的不稳定轨迹(无约束 BC_FMDS 为 40.163%)
1682可稳定学习的最高状态维度(reaction–diffusion 系统)
~13 Hzhard SFMDS 在高维系统上的推理控制频率
15真实人形机器人 SE(3) 插入任务的示教条数

02 Method · 方法

目标是学一个时不变自治动力系统 ẋ_t = f_θ(x_t)(式 1),并要求 f_θ 属于满足预定稳定行为的可行函数族 𝓕_A。SFMDS 不显式参数化动力学,而是用 flow matching 隐式建模:对每个状态 x_t,从 h₀∼𝒩(0,𝐈) 出发、沿辅助时间 τ∈[0,1] 积分一个状态条件、时不变的 flow matching 向量场 u_θ(z_τ; x_t),把终点 h₁ 当作速度 ẋ_t(式 19)。稳定性则通过把 u_θ 的输出约束到 admissible velocity set Ẋ_A 来实现——该集合由 LaSalle's invariance principle 从两类稳定性质推导:positive invariance 与 asymptotic stability。

architecture
Fig 3:soft / hard SFMDS 的轨迹推理示意。编码器 ψ_θ 把任务空间状态 x 映到潜在空间 y;在 φ_θ 内部,soft 变体直接在(速度)任务空间 𝒳 里用网络输出 u_θ,再用 hinge 惩罚约束;hard 变体让网络在潜在空间输出 ũ_θ,投影到潜在可行半空间后经可逆 Jacobian J_{ψ_θ}⁻¹ 映回任务空间 u_θ^Π。每步 forward-Euler 都把状态推向平衡点 x_e,从而在任务空间与潜在空间同时收敛。

Soft SFMDS — 惩罚项弱约束

把“速度落在可行半空间”这一条件写成 hinge-type loss(式 34:ℓ_PI = σ_r(−δ_h⊤u_θ + m_u)),作为正则项加到 imitation learning 损失上,训练时在状态/速度空间均匀采样施加。实现简单、不限制网络架构,但只提供局部(local)稳定性保证。渐近稳定性通过在潜在空间 𝓛 构造 Lyapunov 候选 V^𝓛=d(y_e,y_t)²,并把潜在动力学约束到 Ĺ_A 内(式 44)来强制。

Hard SFMDS — 结构性硬约束

把网络原始输出 ũ_θ 通过 ReLU 投影(式 29/45)直接投影到 admissible half-space,约束被“焊进”模型架构,因而构造上全局渐近稳定 (globally asymptotically stable)。代价是要求编码器 ψ_θ 为 diffeomorphism(用 NODE / Glow blocks 实现),且其 Jacobian J_{ψ_θ} 可逆——推理需额外的内层积分与 Jacobian 求逆(论文用 Taylor-series 近似加速)。

推广到 Lie groups 与离散时间

机器人策略常需同时控制位置与朝向,后者属于 SO(3)/𝕊³ 等非欧空间。SFMDS 借助 adjoint operator Ad_x⁻¹logarithmic map(约束在 first cover 内以避免 wrapping)把方法搬到 Lie 群(式 57),支持 SE(3) 位姿、𝕋²、SO(3)。论文还专门分析了 forward-Euler 离散化下的稳定性(用 ball 投影替代半空间投影),弥合连续时间保证与实际数值积分之间的差距。

03 Experiments · 实验

在 6 类任务上评估:(1) LASA、(2) 新提出的 LASA 𝕋²、(3) 新提出的 Multimodal ℝ²、(4) 仿真 SE(3) 倒水任务、(5) 真实人形机器人 SE(3) 插入、(6) 1682 维 Gray–Scott reaction–diffusion 系统。指标含 accuracy(RMSE / DTWD / Fréchet / Chamfer distance)与 stability(从 out-of-distribution 初始点出发的不成功轨迹占比 % Unsuc.)。基线 BC_FMDS 是去掉稳定性约束、其余训练完全相同的无约束 flow matching 动力系统,用于凸显“无约束时缺乏稳定性”。

稳定性:不稳定轨迹占比(% Unsuc. Trajs ↓)

数据集 / 系统BC_FMDS(无约束)SFMDS SoftSFMDS Hard
LASA(ℝ²,Table I)40.1630.0000.000
LASA 𝕋²(Table I)32.2480.0000.000
Multimodal ℝ²(Table II)27.9780.0000.000
SE(3) 倒水(Table II)21.3550.0380.000
GSRD 1682-d(Table III)100.02.3440.000

无约束 BC_FMDS 在各任务上都有大量轨迹发散(LASA 40%、高维系统 100%),而 SFMDS 两种变体几乎总能收敛:hard 变体做到 0%,soft 变体仅个别边缘情形(如 SE(3) <0.13%、1682-d 为 2.344%)不收敛。准确度方面,在单模态 LASA 上所有方法 RMSE 相近(约 2.1–2.9);在 Multimodal ℝ² 上 soft SFMDS 的 CH(G,D)=1.402×10⁻³ 明显优于 BC_FMDS 的 3.271×10⁻³,说明稳定约束并未牺牲多模态拟合。

LASA T2 vector fields
Fig 6:在 LASA 𝕋²(二维环面 𝕊¹×𝕊¹)上学到的 soft(左)与 hard(右)SFMDS 向量场。白色为 demonstrations,红色为从相同初始条件 rollout 的轨迹,背景色表示归一化速度。两种变体都能在流形上准确复现跨越大范围的轨迹并稳定收敛。
real humanoid SE(3) insertion
Fig 9:真实 RB-Y1 人形机器人 SE(3) 插入任务。末端位姿动力学从 15 条不同初始位姿的示教中用 SFMDS on SE(3) 学出,经 Cartesian impedance 控制器以 500 Hz 运行;模型对扰动鲁棒、可无缝接入标准控制器。
1682-dim reaction diffusion
Fig 10:1682 维 Gray–Scott reaction–diffusion 系统上 GT vs. Soft vs. Hard SFMDS 生成的浓度场随帧演化。RMSE:hard 0.091 / soft 0.094,远优于 BC_FMDS_clipped 0.600 与 BC_FMDS 4.905,验证方法可扩展到高维。

推理速度与 soft / hard 取舍

hard SFMDS 因需内层积分 + Jacobian 求逆而更慢:在 ℝ² 上 BC/Soft ≈341.78 Hz 而 Hard ≈17.14 Hz;即便在 1682 维系统上 hard 仍达 ≈13–14 Hz(Table IV),足以支撑多数机械臂操作任务。整体权衡是:soft 架构灵活、精度略高、但只保证局部稳定;hard 提供全局稳定性保证,代价是需可逆映射且推理更慢。

04 Limitations · 局限性

Note: 前三条为作者在 Conclusions 中明确列出的 future work(stated);后两条为从方法设计/实验现象推断(inferred)。
只能收敛到单一目标位姿(stated)

“many robotic tasks cannot be adequately described by a single goal pose”——SFMDS 目前把稳定性定义为收敛到一个平衡点 x_e;作者指出扩展到收敛于目标状态集合会显著提升适用性。

未建模机器人物理约束(stated)

真实机器人实验中的失败“were caused by constraint violations such as imminent self-collisions”,工作空间限制与自碰撞不被 SFMDS 考虑;作者建议把物理约束直接纳入驱动末端运动的动力系统。

策略条件较简单(stated)

目前仅以机器人状态 x 作为条件;作者提出用图像、point clouds 等更丰富的条件可拓宽适用范围,并需研究此设定下的稳定性。

hard SFMDS 的离散化边缘情形(inferred)

连续时间的渐近稳定性不会自动传递到 forward-Euler 离散系统;App A 指出仍可能出现少量因离散化导致的“逃逸 Ẋ_A”或振荡边缘情形(soft SE(3) <0.13%、hard <0.03%),需专门处理。

hard 变体推理成本高(inferred)

hard SFMDS 依赖可逆映射 ψ_θ(NODE/Glow),推理需内层积分与 Jacobian 求逆,速度较 soft/BC 低一个数量级(如 ℝ²:17 Hz vs 342 Hz),高维时仅约 13 Hz。