RA-L 2025 · Constraint Learning

PUCL:从专家演示中推断非线性连续约束

Positive-Unlabeled Constraint Learning for Inferring Nonlinear Continuous Constraints Functions from Expert Demonstrations
Baiyu Peng, Aude Billard(EPFL LASA)· IEEE Robotics and Automation Letters, vol. 10, no. 2, pp. 1593–1600, Feb. 2025

很多机器人任务的约束(避障、限速)事先未知、也难以精确写出。PUCL 把「从演示中推断约束」重新表述为 positive-unlabeled (PU) learning:演示轨迹是可靠的 positive(feasible)样本,当前策略采到的高回报轨迹是 unlabeled 混合样本。两步法先用距离度量从 unlabeled 中挑出可靠 infeasible 数据,再训练一个二分类可行性网络当作连续约束函数——无需已知约束参数化,也无需可微环境模型。

4 个约束环境无需约束参数化 / 环境模型near-zero unsafe rate 📄 arXiv:2408.01622 💻 Code (GitHub)
constraint learningpositive-unlabeled learninglearning from demonstrationinverse constrained RLsafe policyobstacle avoidance约束推断dynamical system modulation

01 Motivation

规划机器人任务通常要求显式知道所有约束(哪些状态/轨迹被允许、哪些必须避开)。但这些约束常常「未知或难以精确写出」——尤其当它们是非线性、边界形状未知,或源于用户偏好与经验时。例如人类会依据障碍物材质、形状、密度以及个人偏好,隐式地决定机器人应保持的最小间距;机器人需要能从已有的人类演示中把这种隐含约束推断成一个显式的约束函数

“Sometimes these constraints are initially unknown or hard to specify mathematically, especially when they are nonlinear, possess unknown shape of boundary or are inherent to user's preference and experience.”

本文聚焦「不去访问某些不期望的 state(-action)」这类约束(如不撞上未知障碍、不超过未知最大速度)。现有约束推断方法大致分为 IRL-basedmixed-integer-programming (MIP)-based 两类;它们往往需要已知的约束参数化(如圆柱的高与半径)、只学习单维度的简单约束(如 x ≥ −3),或依赖可微的环境模型。PUCL 想在不做这些假设的前提下,恢复出任意的、可能非线性的连续约束。

expert demonstrations
(a) 专家演示:机器人到达目标同时避开 4 个杯子构成的复杂形状(绿色为演示轨迹)。
learned constraint
(b) 学到的约束:红色区域为推断出的 infeasible region,对应杯子占据的不可行空间。
transferred policy
(c) 迁移后的策略:把学到的约束迁移到起点/目标变化的新任务,策略仍能避开杯子。

Fig. 1(改绘):从演示中学习一个避障约束。上例演示了约束一旦学到即可作为可迁移的模块,用于同一约束、但目标与奖励不同的任务变体。

4验证环境(2D/3D 位置、3D 控制量、18D cheetah)
PU约束推断 = positive-unlabeled 学习
<1%学到策略的 unsafe rate
0无需约束参数化 / 可微环境模型

02 Method

核心洞见:与许多 IRL/MIP 方法一样,通过「对比(安全)演示与某个策略生成的潜在不安全轨迹」来推断约束。演示轨迹上的每个 state 由假设可确定为 feasible(labeled positive);而一条比演示获得更高回报的策略轨迹「潜在不安全、靠访问某些禁止状态作弊」,但具体是轨迹里哪些 state 不安全并不清楚——即它同时含真 feasible 与真 infeasible 的 state,却全部 unlabeled。于是问题被自然地表述为:从一批全 labeled 的 feasible state 与一批 unlabeled 混合 state 中,学一个逐 state 的可行性分类器。

PUCL framework
Fig. 2(改绘):PUCL 迭代框架。算法在两件事之间交替:(上) 用当前约束网络 ζθ,通过 Constrained RL 或 DSM 更新策略 πφ;(下) 用两步 PU learning 从演示与当前策略中推断约束。Step 1:把当前策略采样的轨迹 𝒫 视为 unlabeled、演示 𝒟 视为 labeled feasible,用基于距离的度量识别可靠 infeasible 数据 ℛ(存入 memory ℳ)。Step 2:用 ℛ∪ℳ 作为 infeasible、演示 𝒟 作为 feasible,以标准二分类损失训练约束网络 ζθ。

Step 1 — 用距离度量识别「可靠 infeasible 数据」ℛ

直觉:unlabeled 集 𝒫 中与演示集 𝒟 里所有数据都很不一样的点,极可能真的是 infeasible。论文提出一个 kNN 式的距离方法:对每个 unlabeled 点 s̄,计算它到 𝒟 中 k 个最近 feasible 点的平均距离 S_𝒟(s̄) 作为排序分数;分数越大越可能 infeasible。由于 𝒟 里是轨迹上连续的点,建议取较小的 k(约 1–3)。超过距离阈值 d_r 的点被选入可靠 infeasible 集 ℛ。(论文另提出一个基于 GMM 生成模型的变体 GPUCL,用专家分布的最低似然来选 infeasible 数据,但因表现较弱未展开。)

Step 2 — 二分类学习约束网络 ζθ

用识别出的可靠 infeasible 数据 ℛ 与 feasible 演示 𝒟,以标准二分类损失训练一个神经网络约束 ζθ(s̄)。约束网络输出经 sigmoid,ζ=0 表示 infeasible、ζ=1 表示 feasible,以 0.5 为决策阈值。

迭代框架:policy filter + memory buffer

PUCL 采用迭代式而非一次性生成 𝒫——因为策略始终对当前约束更新,新采样轨迹大多分布在当前约束边界附近,能高效精化边界。两项设计:

策略表征:Constrained RL 或 DSM

更新策略时可用两种方式:Constrained RL (CRL),适合动力学与奖励更复杂的通用任务;或 Dynamical System Modulation (DSM),以有原则的方式调制策略、带安全保证,尤其适合控制量为各维速度/加速度的机器人任务。

03 Experiments

在四个仿真环境上学习:2D 位置约束3D 位置约束3D 控制量(速度)约束,以及 18 维 half-cheetah 机器人的约束。任务为随机初始化、奖励为到达目标的负 Cartesian 路径距离的 goal-reaching。2D / 3D 任务分别用 4 / 10 条安全演示;末端速度上限 0.58 m/s。Baselines:MECL(max-entropy constraint learning,IRL-based)、BC(binary classifier,把 𝒫 全当 infeasible)、GPUCL(生成式变体)。Metrics:IoU(约束正确性,越高越好)与 unsafe rate(策略的逐步真实约束违反率,越低越好)。

“The proposed method PUCL exhibits superior performance compared to the baseline across both environments and metrics. It achieves a near-zero unsafe rate at the convergence of the training in both environments and outperforms baseline MECL.”
PUCL learned constraint MECL learned constraint
Fig. 4(改绘):2D reaching 任务中学到的约束。左 PUCL(ours)/ 右 MECL。两个白色椭圆是真实约束边界;热图红色区域(ζ=0)为学到的 infeasible。绿色为演示轨迹、黄色为策略轨迹、红点是 PUCL 识别出的可靠 infeasible 数据 ℛ∪ℳ。PUCL 学到的红色区域与真实椭圆吻合良好;MECL 的约束不够准确,甚至把演示访问过的一些 state 误判为 infeasible

两种策略表征的对比(3D reaching, Table II)

以 PUCL 为约束学习方法,比较 CRL-PUCL 与 DSM-PUCL(15 次独立运行取平均;PC: i9-12900K + RTX 3070)。两者分类性能(IoU / recall / precision)相近,DSM-PUCL 方差更低;两者 unsafe rate 均低于 1%,DSM-PUCL 略低——因其以有原则的方式调制策略并带安全保证,且训练时间更短。

Methods (3D reaching)CRL-PUCLDSM-PUCL
IoU0.46 ± 0.090.42 ± 0.01
Recall rate(94.2 ± 4.5)%(99.9 ± 0.1)%
Precision(47.6 ± 10.0)%(42.1 ± 1.3)%
Unsafe rate(越低越好)(0.47 ± 0.82)%(0.15 ± 0.56)%

数值逐字摘自 Table II。结论:两种方法都有效;对以速度/加速度为控制量的任务,DSM 在训练时间与策略性能上更有优势;CRL 更适合动力学与奖励更复杂的通用任务。

控制量约束与约束迁移

把 3D reaching 改成施加更严格的最大速度约束,验证 PUCL 也能学习控制量(velocity)约束。下图为学到策略的速度分布,红色虚线为真实约束阈值——策略基本落在阈值之内。此外,学到的约束可迁移到「同一约束、但目标/奖励不同」的任务变体(如 Fig. 1 中避开 4 个杯子的复杂形状),无需重新学习约束。

velocity distribution
Fig. 6(改绘):PUCL 学到策略的速度分布(左 v_x,右 v_z)。横轴为速度,红线为真实约束阈值;分布主要落在阈值以内,说明控制量约束被有效满足。

Ablation — 距离阈值 d_r 的敏感性

sensitivity to d_r
Fig. 3(改绘):3D 任务中改变距离阈值 d_r 的敏感性分析(5 个随机种子平均)。蓝线为 unsafe rate(左轴,越低越好),橙色虚线为 IoU(右轴,越高越好)。d_r 过小或过大都会变差,存在一个中间的良好区间(约 0.08–0.16),说明性能对 d_r 有一定依赖

04 Limitations

Note: 第 1 条为作者在 “Conclusions and Limitations” 中明确陈述的局限;第 2、3 条为依据方法设计与实验设置推断的局限(标注为 inferred)。
依赖距离阈值 d_r 与距离度量的选择(作者明确陈述)

“its performance depends on the choice of an appropriate distance threshold and the specific distance metric.” 敏感性分析(Fig. 3)也显示 d_r 过小/过大都会损害 unsafe rate 与 IoU。作者提出未来方向:联合学习一个能对不同任务自动适配的距离表征。

依赖「更高回报即潜在不安全」的假设(inferred)

方法把回报显著高于演示的策略轨迹当作 unlabeled/潜在 infeasible(policy filter 用 (1−δ)·r(τ) ≥ r(τ_𝒟)),并假设演示是 feasible 且次优(Assumption 1)。当奖励设计与该假设不吻合、或演示本身并非严格 feasible 时,识别出的 infeasible 数据可能失真。

验证局限于仿真、约束为「状态/控制量避免」型(inferred)

论文的四个环境均为仿真(2D/3D reaching、控制量、half-cheetah),未报告真实机器人硬件实验;且聚焦于「不访问某些 state(-action)」这一类约束,对更一般的时序/逻辑约束未做探讨。此外 IoU 绝对值并不高(如 3D 任务 ≈0.42–0.46),反映连续非线性约束边界的精确恢复仍有难度。