Robot Learning · RL Finetuning

From Prior to Pro:用“分布收缩”式 RL 微调高效掌握技能

Distribution Contractive Reinforcement Learning (DICE-RL)
Zhanyi Sun, Shuran Song · Stanford(real-stanford)· arXiv:2603.10263v2, cs.RO

DICE-RL 把 RL 看作作用在预训练生成式 BC 策略上的“distribution contraction”算子:从一个已经能产生 physically plausible 行为的 behavior prior 出发,用在线反馈把动作分布向高成功率的模式“收缩”,而不是自由漂移。它冻结预训练 diffusion/flow 策略、只学一个轻量 residual 校正,配合选择性行为正则与价值引导动作选择,在仿真与真实机器人上稳定、样本高效地把 prior 变成 pro。

Robomimic · LIBERO-10 · NIST 真机 Diffusion / Flow BC + Residual off-policy RL 📄 arXiv:2603.10263 🔗 Project page 💻 Code
RL finetuningdiffusion policyflow matchingresidual policybehavior cloningdistribution contractionoff-policy RLlong-horizon manipulation强化学习微调

01 Motivation

在 sparse-reward、long-horizon 的操作任务里,在线交互昂贵、无约束探索不可行。论文主张:此时 RL 最有用的角色不是从零学,而是在一个预训练生成式 BC 策略之上做“分布收缩器”——利用在线反馈重加权动作分布,提升 high-success 行为、抑制 failure-prone 行为。这一视角直接类比 LLM 的 post-training:RLVR 通过放大满足任务检验的回答来 sharpen 预训练模型。

“RL is most effective and practical when used as a ‘distribution contractor’ on top of a pretrained generative behavior cloning (BC) policy … increasing the probability of high-success behaviors while suppressing failure-prone ones.”

把这一思路搬到机器人并不平凡:动作空间连续、verification 需要真实执行、reward 延迟、horizon 很长。因此有效微调需要两个前提:(1) 一个覆盖可行解(哪怕不够精确)的预训练策略;(2) RL 的改进发生在预训练 support 内的“行为收缩”,而非任意漂移。

DICE-RL teaser
Figure 1. DICE-RL 把 (a) 预训练生成式 BC 策略(behavior prior,动作分布较宽、灰色轨迹发散)refine 成 (b) 一个“pro”策略,把动作分布向成功模式收缩。右侧放大图给出核心机制:在预训练 BC 策略采样出的候选动作(灰)之上,学习一个 Residual Action(蓝),叠加得到 RL Policy Action(绿),从而在保持 prior 支撑的同时朝高价值方向修正。
Tool Hang此前困难任务,pixel 输入下微调后达 ~90% 成功率(Fig. 2/4)
2 阶段diffusion/flow BC 预训练 + residual off-policy RL 微调
3 真机NIST 装配任务:Gear / LightBulb / Belt Assembly
5 baselines对比 IBRL / DPPO / EXPO / DSRL / ResFit

02 Method

DICE-RL 分两阶段。预训练:在离线示范上训练一个 diffusion 或 flow-matching 的 BC 策略,用 early stopping 避免过拟合、保留动作多样性,得到一个能表达复杂动作分布、支持随机推理的 behavior prior。微调:冻结该 prior,只学一个轻量 residual,用稳定、样本高效的 off-policy actor-critic 框架来做“选择性行为正则 + 价值引导动作选择”。

Residual 参数化(冻结 prior,只学修正)

动作 chunk 写作 at:t+h-1 = πpre(st, z) + sθ(st, z),其中 πpre 是冻结的 flow/diffusion 策略、sθ 是可学习残差,z~N(0,I) 是隐变量。冻结 prior 让探索始终落在 physically plausible 的支撑内;action chunking(h 步分组)改善 long-horizon 下的 credit assignment,同时复用预训练的观测编码器提取状态特征。

Selective behavior regularization(filtered BC)

用一个 filtered BC-style 残差正则 LBC 鼓励在高价值区域贴近 prior,但当残差产生“确信可提升价值”的动作时放松惩罚。关键的 BC-loss filter 定义为
Filter(s,z;ε) = 𝕀[ Qφ(s,acur) ≥ Qφ(s,apre) ∧ Qφ(s,acur) − Ĝ(s) ≤ ε ],
其中 Ĝ(s) 是来自 replay 的 Monte-Carlo return 估计,ε 是一个小负常数。第二个条件用真实回报“把关”,防止残差去利用 Q 函数的 overestimation。只有同时满足“比 prior 更优”且“不超出真实回报太多”时才免除 BC 惩罚。

Value-guided action selection(best-of-N)

在线交互时对每个状态采样 K 个隐变量 {zk},形成 K 个候选 chunk,执行 critic Qφ 打分最高的那个(best-of-N 动作选择)。训练目标也在 K 个隐样本上取期望(multi-sample expectation training):actor 损失 LRL(θ) = −(1/K)Σk Qφ(st, at:t+h-1(k)),从而在“分布层面”优化并降低梯度方差。

稳定性设计:ensemble critic + adaptive RLPD

Critic 用 h 步 TD 目标、并对下一状态的 K 个候选取平均值来 bootstrap;采用 ensemble critic(多个 Q 取 min)抑制 overestimation。Adaptive RLPD mixing 以随时间衰减的比例 roffline(t) 从 Ddemo 与 Donline 混合采样,从“离线为主”平滑过渡到“纯在线微调”。整体流程见论文的 Algorithm 1(DICE-RL)。

03 Experiments

仿真基准:Robomimic 的 Can / Square / Transport / Tool Hang(state 与 pixel 两种观测),以及附录里的 LIBERO-10 多任务基准。真机:NIST 装配基准的 3 个 contact-rich 任务。指标为“成功率 vs. 在线环境步数/回合数”,Robomimic 曲线在 5 个 seed 上平均。

Robomimic:稳定性与样本效率全面领先

在 8 个 task×观测组合上,DICE-RL(深紫)相对预训练 BC 基线(虚线)都取得稳定提升,尤其在最难的 Tool Hang(state/pixel) 上把成功率推到约 90%,而多数 baseline 在此停滞。对比方法包括:IBRL(在 BC 与 RL 动作间按 Q 取优,不利用 diffusion prior)、DPPO(把去噪链当内层 MDP、用 PPO 在线微调 diffusion 策略)、EXPO(学一个 Gaussian edit policy 局部修正采样动作 + 熵正则)、DSRL(在 latent noise 空间做 RL)、ResFit(冻结 chunk BC、学 per-timestep 残差但不含 BC 正则)。

Robomimic success curves
Figure 2. Robomimic 上成功率 vs. 在线环境步数(×100k)。上排 state 观测、下排 pixel 观测;深紫为 DICE-RL,虚线为预训练 BC 起点。DICE-RL 在 Can/Square/Transport/Tool Hang 全部达到更高最终成功率并更快收敛,曲线更平滑(稳定性更好)。

分析:RL 确实在“收缩 / sharpen”动作分布

value improvement vs entropy reduction
Figure 5. 价值提升 ΔV 与动作熵下降 ΔH 的散点关系:ΔV 越大,ΔH 也越大——RL 把概率质量集中到高价值模式,直接证据支持“distribution sharpening”。
pairwise distance evolution
Figure 7 (Left). 两条不同初始状态 rollout 的归一化 pairwise 距离随时间演化(Tool Hang, pixel)。RL Finetuned Policy(紫)相对 Pretrained BC 与 Expert Demo 收缩更强、闭环行为更稳定;论文另报告在注入动作噪声(扰动概率 0.1–0.9)下 RL 策略退化更“graceful”。

真机:NIST contact-rich 装配

三个高精度接触任务:GearInsertion(把齿轮插到金属杆,容差 ≈1 mm、有视觉遮挡)、LightBulbInsertion(先插灯泡再旋转约 360° 点亮)、BeltAssembly(把已抓住的橡胶带绕过两个滑轮穿装,刚柔耦合、最难)。用 kinesthetic teaching 分别采集 40 / 100 / 265 条示范预训练 diffusion 策略。RL 阶段由人给二元成功/失败奖励、每 10 个在线回合做一次 batched 更新,actor 与 learner 异步。每个 checkpoint 用 30 trials 评估。预训练 BC 存在明显失败模式(如 BeltAssembly 提前松手、seat 不到位;Gear/Bulb 接近导航差、插入不准),RL 微调后三任务均可靠成功(成功率曲线见 Fig. 8(c))。

real robot experiments
Figure 8. 真机实验。(a) 三个任务里预训练 BC 策略的典型失败模式(红框);(b) RL 微调后 DICE-RL 可靠完成关键子阶段(绿框:Approaching → Pre-Insertion → Insert / Thread → Rotate / Release);(c) 成功率 vs. 在线回合数,RL 曲线(实)显著高于 BC 起点(虚)。Fig. 9 显示 BeltAssembly 中最大的 ΔV / ΔH 恰好出现在 BC 的主导失败点(滑轮过渡、belt seating),与仿真中的 sharpening 观察一致。

消融与其它结果

三个设计选择——(i) BC-loss filter、(ii) multi-sample expectation training(K 越大收敛越快)、(iii) best-of-N 动作选择——都能加速收敛并提升峰值性能。更换 backbone(diffusion vs. flow matching)DICE-RL 均稳定且样本高效。预训练 epoch 的消融(下图)表明 early stopping 很关键:训练过久的 checkpoint 起点更低、可微调性更差。LIBERO-10 多任务上 DICE-RL 在样本效率上优于 DSRL,并可与预训练 π0 模型集成。

pretraining epoch ablation
Figure 4. 用不同预训练 epoch 的 BC checkpoint 做 DICE-RL 微调(Tool Hang, pixel)。虚线是各 checkpoint 的 BC 起点,实线是微调曲线:训练越久(如 Epoch 3200)BC 起点越低、微调后收敛也更慢,佐证“预训练要 early stopping 保留多样性”这一设计。
关于数字:论文正文对 Robomimic / 真机的具体最终成功率主要以曲线(Fig. 2/4/8)呈现,本页所引百分比(如 Tool Hang ~90%)为按图读数的近似,精确值请以原图与论文为准;示范条数 40/100/265、容差 ≈1 mm、5 seeds、30 trials 等为正文明确给出。

04 Limitations

Note: 第一条为论文明确 stated 的局限;其余为依据方法设计的合理 inferred 推断,非论文原文断言。
数据偏置与分布漂移下的不安全行为(stated)

论文指出:策略可能继承数据集偏置、并在 distribution shift 下表现出不安全行为;在 safety-critical 部署前需要配合安全防护做审慎评估。

依赖“可行”的预训练 prior(inferred)

方法把 RL 定位为在 prior 支撑内的“分布收缩”。若预训练策略根本不覆盖可行解,收缩就无从产生正确模式——性能上限受 behavior prior 的覆盖度与 early-stopping 质量制约。

真机 RL 需要人工监督(inferred,来自 setup 描述)

真机设置需要人给二元奖励、判定失败并做 reset;虽用异步 learner/actor 降低 wall-clock,但仍是有人在环、成本随任务复杂度上升。

尚未验证到大规模多任务 VLA(stated as future work)

作者把“在保持行为多样性的前提下扩展到大规模多任务 VLA 策略”,以及“对稳定性/样本效率的更深理论保证”列为未来工作,说明当前结论主要建立在单技能/有限多任务规模上。