机器人 · Diffusion Policy · 推理时引导

PPGuide:用性能预测引导 Diffusion Policy

Steering Diffusion Policies with Performance Predictive Guidance
Zixing Wang, Devesh K. Jha, Ahmed H. Qureshi, Diego Romeres · Mitsubishi Electric Research Laboratories (MERL) / Purdue University

Diffusion policy 学多模态操作行为很强,但动作误差会随时间累积、最终导致失败。PPGuide 是一个轻量、基于分类器的框架:它用自监督方式自动找出 rollout 里与成败相关的 observation-action 片段,训练一个 performance predictor,在推理时用梯度把预训练好的 diffusion policy 引离失败模式——无需额外专家示范、无需 dense reward、也无需昂贵的 world model。

Robomimic + MimicGen · 8 任务 仅用 10% 专家示范训练 📄 arXiv:2603.10980 PDF
diffusion policyclassifier guidancemultiple instance learningattentionself-supervisedrobotic manipulationinference-time steeringRobomimic / MimicGen模仿学习

01 动机 · Motivation

Diffusion policy 能高效学习复杂、multi-modal 的机器人操作行为,但生成的 action sequence 中的误差会随时间 compound(累积),最终可能导致任务失败。已有缓解手段——扩充专家示范数据集、或学习 predictive world model——要么需要更多标注,要么计算代价高昂。

“errors in generated action sequences can compound over time which can potentially lead to failure … We introduce Performance Predictive Guidance (PPGuide), a lightweight, classifier-based framework that steers a pre-trained diffusion policy away from failure modes at inference time.”

PPGuide 的核心思路:只用稀疏的二值成败信号(success / failure),从 policy 自己的 rollout 中自监督地学出「哪些动作片段导致了成功或失败」,再把这份知识以梯度形式在采样时注入 diffusion 去噪过程。它是 model-agnostic 的,可套在任意预训练 diffusion policy 上。

PPGuide steering example on Square insertion
Fig. 3 · 一个直观例子:在 square insertion 任务中,base policy 会走向 misalignment(错位),PPGuide 的引导梯度把动作纠回对齐的插入轨迹。
+16%Square(异构 epoch 1300)
+18%Transport(异构 epoch 1300)
+10%Square vs DP(epoch 500)
10%仅用的专家示范比例

02 方法 · Method

PPGuide 分三阶段:① 用 attention-based Multiple Instance Learning (MIL) 离线估计每个动作片段与成败的「相关性」;② 用 z-score 阈值把片段自监督地标为 SR / FR / IR;③ 训练轻量 performance predictor,在推理去噪时提供实时梯度引导。

PPGuide framework overview
Fig. 1 · PPGuide 框架总览。左:把整条 trajectory 当作 bag、每个 observation-action chunk 当作 instance,attention-based MIL 学出注意力权重并将片段标注为 Success-Relevant / Failure-Relevant / Irrelevant;中:在自标注数据上训练轻量分类器 f_guide;右:推理时用其梯度引导 diffusion 采样远离失败模式。

① Attention-based Multiple Instance Learning

把一条 trajectory 𝒯 视为带有 bag-level 标签 Y ∈ {success, failure} 的 bag,其中每个 (oₜ, aₜ) 是一个 instance。每个 instance 先过 encoder ϕ 得到嵌入 hₜ = ϕ(oₜ, aₜ),再经 gated attention 得到权重 αₜ、加权聚合为 bag 表示 z,最后由 g 输出 P(Y | 𝒯),端到端用 binary cross-entropy 训练:

αₜ = softmaxt( w( tanh(V hₜ) ⊙ sigm(U hₜ) ) )   (Eq.1)  z = Σₜ αₜ hₜ   (Eq.2)

MIL 无需 instance 级监督即可让模型给「witness」片段(真正决定成败的时刻)分配高注意力权重。

② 自监督标注(z-score 阈值 τ)

对所有 rollout 算出 {αₜ},用 z-score 阈值 τ 分三类:成功 bag 中 αₜ>τ 的记为 Success-Relevant (SR),失败 bag 中 αₜ>τ 的记为 Failure-Relevant (FR),其余 αₜ≤τ 记为 Irrelevant (IR)。论文观察到 IR 片段数量通常是 SR/FR 的 10 倍以上——说明模型确实能「精确定位关键时刻」。

③ 推理时梯度引导

在自标注数据上训练分类器 f_guide 输出 P(y | oₜ, aₜ), y ∈ {SR, FR, IR}。去噪步 k 时对 action 求梯度,一个鼓励成功、一个排斥失败,叠加进 noise 预测:

ε̂θ = εθ(aₜk, k, oₜ) + wsr·∇a log P(SR|·) − wfr·∇a log P(FR|·)   (Eq.3-5)

设计上 wsr ≪ wfr:失败模式多样、需要稳健的「普遍排斥」,而成功动作稀疏且高度依赖上下文,过强的「恒定吸引」会破坏稳定性。为省算力,引导只在交替(如偶数步)的去噪步施加,即可达到与「每步都引导」几乎相同的效果。

03 实验 · Experiments

在 Robomimic 与 MimicGen 的 8 个任务上评测(Stack D1、Stack Three D1、Coffee D2、Coffee Prep. D1、Kitchen D1、Mug Cleanup D1、Square、Transport),涵盖 long-horizon、precision、articulated object 等挑战;均在只用原始专家示范 10% 的低数据设定下训练。Baseline:DP(base diffusion policy)、DP-SS(+stochastic sampling),以及 PPGuide 的变体 PPGuide-SS(stochastic sampling)、PPGuide-CG(每步 constant guidance)、PPGuide(交替引导)。

Evaluation tasks from Robomimic and MimicGen
Fig. 2 · 评测任务示例(Robomimic + MimicGen)。任务在 long-horizon(如 Coffee Prep. D1、Kitchen D1、Mug Cleanup D1、Transport)、precision(Coffee D2、Coffee Prep. D1、Square)、articulated object(Coffee D2、Coffee Prep. D1、Mug Cleanup D1)上各有侧重。

主结果(Table II,success rate,摘 epoch 500)

数字逐字摘自论文;括号内为相对 base DP 的增减。

TaskDPDP-SSPPGuide-CGPPGuide
Stack D192%88% (-4%)94% (+2%)94% (+2%)
Stack Three D128%24% (-4%)36% (+8%)34% (+6%)
Coffee D254%44% (-10%)58% (+4%)58% (+4%)
Coffee Prep. D116%14% (-2%)20% (+4%)20% (+4%)
Kitchen D152%38% (-14%)54% (+2%)52% (+0%)
Mug Cleanup D126%24% (-2%)32% (+6%)30% (+4%)
Square62%58% (-4%)72% (+10%)72% (+10%)
Transport60%54% (-6%)68% (+8%)68% (+8%)

注意 DP-SS 在几乎所有任务上都劣于 base DP——论文据此指出 stochastic sampling 并不适配 PPGuide 框架。PPGuide / PPGuide-CG 则在 long-horizon 与 precision 任务上收益最大。

异构评测(Table III)

用 epoch 250–450 训练的 relevance 分类器去引导 epoch 1300–1600 的 deployment policy(rollout 与部署 policy 不同)。在较早 checkpoint 上收益尤为显著:

Task (epoch)DPPPGuide
Square @130054%70% (+16%)
Square @150062%68% (+6%)
Transport @130056%74% (+18%)
Transport @160058%70% (+12%)

消融 · Ablations

PPGuide(交替引导)“achieved almost the same level as PPGuide-CG with much less guidance inference”——用更少的引导计算换到几乎相同的性能。引导强度存在标准的先升后降 trade-off;z-score 阈值敏感,在 Coffee D2 上取 {1.5, 1.75, 2.0, 2.25} 时性能在 2.0 处达峰。

z-score threshold ablation on Coffee D2
Fig. 5 · z-score 阈值消融(Coffee D2,对 guidance strength 0.25/0.3/0.35 取平均)。性能在 z-score = 2.0 时最优,说明 “Performance of PPGuide is sensitive to z-score selection”。

04 局限性 · Limitations

Note: 以下三点均为论文 Limitations / Future Directions 中作者明确陈述的内容。
Cold-start 依赖初始 policy 质量

需要一个「表现尚可」的初始 policy 才能工作;若 policy 几乎从不成功,就没有足够的成功信号供 MIL 学习。未来方向:更稳健的探索策略以获得更多样的初始轨迹。

可能学到 spurious correlation

MIL 可能把反复出现的无关特征误判为「相关」。未来方向:在部署中在线更新 relevance 分类器、更精细的 credit assignment 来刻画误差的逐步累积。

超参数敏感

z-score 阈值 τ 与引导强度 wsr/wfr 都需针对任务仔细调参;实验中阈值取 2.0 附近才最优,偏离即掉点。