机器人 · Robotics / IRL

当机器人比人更强:从受限专家演示中学习

When a Robot is More Capable than a Human: Learning from Constrained Demonstrators
Xinhu Li, Ayush Jain, Zhaojing Yang, Yigit Korkmaz, Erdem Bıyık · University of Southern California (USC) · arXiv 2510.09096

人用手柄、动觉示教等受限接口采集的演示往往次优——受限于间接控制、硬件安全与自由度限制,只能给出缓慢、分段的轨迹。本文提出 LfCD-GRIP:不去直接模仿受限动作,而是从演示中推断一个只依赖状态的 goal-proximity 奖励,并用时序插值为未知状态自标注奖励,让 agent 在约束解除后探索更短更高效的轨迹。真机 WidowX 抓取任务上 12 秒完成,比 behavioral cloning 快 10 倍

cs.ROUSC · LiralabPPO + IRL 📄 arXiv:2510.09096 🌐 Project page
learning from demonstrationinverse RLgoal-proximity reward受限专家 constrained demonstratortemporal interpolationMonte Carlo DropoutPPOWidowX sim-to-realrobot manipulation

01 Motivation · 动机

Learning from demonstration 让专家能通过 kinesthetic teaching、joystick、sim-to-real 等接口教机器人。但这些接口本身会约束专家:例如 mode-switching joystick 一次只能控制一个轴,即使机械臂本身能在更高维空间协同运动。结果是演示轨迹缓慢、分段,学出来的策略自然次优。既有 imitation learning(BC/GAIL)以模仿专家动作为目标,会把这些人为约束一起学进去,无法超越演示者。

“Can an agent learn from constrained demonstrations and discover more efficient behaviors once those constraints are lifted?” —— 即,机器人能否学出比受限专家更好的策略。
teaser
Figure 1. 上排:人类专家受 mode-switching joystick 约束(一次只能沿一个轴移动),产生分段轨迹;下排:采用 LfCD-GRIP 的机器人执行平滑高效的运动,走出一条超越演示的更短路径。原文:"A human expert constrained by a mode-switching joystick produces segmented trajectories. A robot employing LfCD-GRIP executes smooth and efficient motions beyond the demonstrations."
12 s真机 WidowX 完成时间
10×比 BC(100 s)更快
100%Maze2D 成功率(Table 1)
100%OOC 越界动作占比

02 Method · 方法

LfCD-GRIP(Learning from Constrained Demonstrations with Goal-proximity Reward InterPolation)是一个 IRL 框架:把奖励学习与专家的受限动作解耦,只从状态推断"离目标有多近",再用 agent 在线探索到的数据把这种"任务进度"信号插值扩展到演示之外,最后用 PPO 在该奖励上训练策略。

① Goal-proximity 作为 action-free 奖励

训练一个只吃状态的 goal-proximity 函数 fφ(s):越接近目标的状态被赋予越高的 proximity 值,通过对专家轨迹做指数时序衰减标注得到。奖励定义为相邻状态的 proximity 增量——prox(st, st+1) = fφ(st+1) − fφ(st)。因为奖励不依赖动作,agent 不必复刻受限动作,只要朝目标推进就得到奖励,从而可以走演示里没出现过的捷径。

② Confidence Estimation Module(置信度估计)

Agent 在线采集的样本大多落在专家分布之外,直接外推 proximity 不可靠。论文用 Monte Carlo Dropout (MCD):推理时开启 dropout、多次随机前向,用预测方差衡量不确定性——"lower variance indicating higher confidence"。置信阈值动态设为专家状态上观察到的最大 proximity 方差;低方差(高置信)的状态被当作 anchor

③ Goal-proximity Interpolation(时序插值自标注)

对于两端都是高置信 anchor 的子轨迹,中间状态用对数尺度线性插值得到 proximity 目标:ρt = ρstart + (t/Tsub)(ρend − ρstart)。这样就把"任务进度"的概念沿 agent 自己的轨迹传播到约束之外的未知状态。训练中用一个逐步退火的 masking 概率,慢慢增加对插值值的依赖。

interpolation
Figure 2. Proximity 在两个高置信 anchor(ρstart、ρend,蓝点)之间沿时间轴插值,为中间未知状态(橙点)自标注目标值。原文:"Proximity is interpolated between high-confidence anchors."

总损失由三部分组成:φGRIP = ℒφe + ℒφconf + ℒφunconf(专家项 + 置信项 + 非置信/插值项)。为估计不确定性,proximity 网络维护一个 5 个成员的 ensemble。

03 Experiments · 实验

环境:MiniGrid-LfCD(离散导航)、Maze2D(连续 2D 导航)、FetchPick / FetchPush(3D 操作)、WidowX-Pick(仿真 + 真机)。Baselines:Behavioral Cloning (BC)、GAIL、GAIfO、SSRR、Proximity-based IRL,以及去掉插值的消融 Proximity(-Drop)。除 BC 外均用 PPO 训练。

tasks
Figure 3. 覆盖导航与操作、不同种类与不同强度受限演示的任务集合:MiniGrid-LfCD、Maze2d、Fetch-Push、Fetch-Pick、WidowX-Pick。

Out-of-Constraint (OOC) 动作分析 · Maze2D-Constrained

衡量各方法选择"落在专家动作空间之外"动作的比例,检验是否真的超越了约束。LfCD-GRIP 在 100% 使用越界动作的同时达到 100% 成功率;GAIfO 虽然 100% 越界却学不出高成功率,说明关键在奖励泛化而非单纯动作多样性

BaselineSuccess RateOOC Action Ratio
GAIL69%71%
BC12%69%
GAIfO51%100%
LfCD-GRIP (Ours)100%100%

Table 1:Success rate and OOC action ratio in Maze2D-Constrained(数值逐字摘自原文)。

轨迹效率 · 走捷径

在 MiniGrid-LfCD 中,LfCD-GRIP 发现了演示里没有的对角线捷径,而所有 baseline 都被限制在演示的横竖(cardinal-direction)路径上。在 Maze2D-Constrained 中,"LfCD-GRIP completes the task in 100 transitions on average—reducing episode length by over 10% compared to Proximity-based IRL, which requires 113 transitions."(100 vs 113 transitions,缩短 >10%)。

约束强度加剧下的鲁棒性

severity
Figure 6. 随约束强度(Severity Level)增大,LfCD-GRIP 相对 baseline 的优势愈发明显。在更严重约束下(如动作被限制到 [−0.05, 0.05]),Expert 与 BC 的轨迹长度飙升到 ~380,而 LfCD-GRIP(橙)保持极短轨迹,Proximity 次之。原文:"Varying constraint severity shows the increasing benefit of LfCD-GRIP over baselines."

真机 WidowX-Pick

用 ManiSkill 采集 550 条专家演示预训练,再 sim-to-real 迁移到真实 WidowX 250s。仿真中"Only BC and LfCD-GRIP succeed, with LfCD-GRIP being more efficient"。真机上:BC 能复现专家行为但无法利用完整动作空间、执行缓慢,每次需 100 秒;相比之下 LfCD-GRIP 生成高效轨迹,"completes the task 10x faster, in just 12 seconds."

real robot rollout
Figure 7. 真机 WidowX-Pick rollout(时间轴 t=0→100)。BC 在 t=100 才成功(100 秒),Others 中途失败,GRIP 在 t≈12 即成功。原文:"Only BC learns meaningful policies, while LfCD-GRIP completes the task 10x faster than BC."

04 Limitations · 局限性

Note: 以下第 1、2 条为原文 "Conclusion & Limitations" 中作者明确陈述(stated);第 3 条为根据方法设计推断(inferred)。
依赖明确的目标状态(stated)

原文:"Proximity-based reward assumes that task progress can be measured with respect to a specific goal state. While well suited for goal-reaching tasks, this limits applicability to settings without clearly defined terminal conditions." —— proximity 奖励假设任务进度可相对某个目标状态度量,因此适合 goal-reaching,但难以用于没有清晰终止条件的任务。

多任务 / 语义多样目标下受限(stated + future work)

当前依赖为每条演示量身定制的 goal-conditioned proximity estimates,在多任务场景下泛化困难。作者提出未来借助 representation learning 让进度信号能跨语义各异的目标泛化。

置信/插值机制的假设(inferred)

方法依赖 MC-Dropout 方差作为置信度、并以专家状态上的最大方差作动态阈值,同时用对数线性插值假定子轨迹内进度平滑单调。当在线探索质量差、anchor 稀疏或进度非单调时,插值的自标注奖励可能失真——此为据设计推断,非原文明述。