机器人 · Diffusion Policy · Imitation Learning

From Noise to Control:参数化扩散策略 (PDP)

用一个几何对齐的低维 behavior latent,把扩散策略从"随机多样性"变成"可精确操控的行为"
Renhao Zhang, Haotian Fu, Mingxi Jia, George Konidaris, Yilun Du, Bruno Castro da Silva(Brown University 等)

标准 diffusion policy 靠随机噪声产生多样轨迹,但"多样 ≠ 可控":想在噪声空间里挑出某个模式是 ill-conditioned 的。PDP 引入一个低维连续 behavior latent z,并把它组织成一个"距离 ≈ 轨迹相似度"的几何对齐流形,让 z 成为可插值、可优化的控制旋钮。当环境约束变化使原有模式失效时,只需在冻结策略权重的前提下优化 z,即可完成模式选择、平滑插值与快速适应。

ICML 风格投稿9 个操作域(仿真 + 真机)latent 维度 d_z = 2 📄 arXiv:2606.00336 💻 Code (github.com/Valarzz/pdp)
diffusion policybehavior steeringimitation learningmultimodal demonstrationslatent spaceVAEsoft-DTWglobal modulationtest-time adaptationrobot manipulation

01 Motivation

真实机器人任务往往是 underspecified 的:同一个目标在同一环境下可以由多条不同的动作序列完成(一对多结构),所以专家数据天然是 multimodal 的。理想策略既要 (i) 建模这些多模态行为,又要 (ii) 在约束变化时挑出正确的那一个去执行。Diffusion policy 因能表达多模态、高维动作序列而成为 behavior cloning 的强基线,但作者指出:"diversity alone is not the same as controllability"。

论文研究的是 constraint-induced behavior shift:环境变化使训练集中的许多轨迹模式失效,成功要求"selecting or discovering a different trajectory mode"。而标准 DP 靠采样噪声来 steering 是 ill-conditioned 的——微小扰动会引起大而不可预测的轨迹变化。
observation shift vs constraint-induced behavior shift
Figure 1. 上:标准评测改变的是 observation,目标行为不变。中:本文研究 constraint-induced behavior shift——环境变化使训练集中的多个轨迹模式失效,需要选择/发现另一个模式。下:标准 DP 在噪声空间里 steering 病态;PDP 则暴露一个几何与轨迹相似度对齐的 behavior latent zz 的微小变化诱导行为的平滑变化,从而支持插值与适应。
92.0约束偏移场景总体成功率 %(PDP)
64.6最强基线 VQ-BeT 同指标 %
21.5标准 DP 同指标 %
d_z=2behavior latent 维度

02 Method

PDP 在 diffusion policy 之上加入一个连续 behavior latent z∈ℝd_z,把控制分解为两部分:(i) 一个 geometry-aligned behavior manifold,把高维 demonstration 映射到"欧氏距离反映轨迹相似度"的隐空间;(ii) 一个 parameterized diffusion denoiser,在环境 context 与目标 z 双重条件下生成动作序列。测试时只优化 z、冻结策略权重,即可做 mode selection、行为插值与约束适应。

PDP framework: training and inference
Figure 2. PDP 框架。训练(左):trajectory encoder Eφ 把每条 demonstration τ 嵌入到 Gaussian 后验采样的 behavior latent z;隐空间由联合目标优化——标准 VAE loss(重建 ℒrec + KL 散度 DKL)保信息、正则化分布,几何 loss 则让隐空间距离对齐轨迹的物理相似度。推理时 denoiser εθ 以 context 与 z 为条件生成动作 chunk。

① Geometry-Aligned Behavior Latent(几何对齐隐空间)

核心是学一个隐流形,使 zizj 的距离反映两条行为的语义相似度。作者不直接在原始观测上建结构,而是从每条 demonstration 抽取一段 behavior trace(基于状态的特征序列,如位置状态)。trajectory encoder Eφ 把整条 τ 映射为 Gaussian 后验 qφ(z|τ)=𝒩(μφ(τ), diag(σ²φ(τ))),下游条件用确定性均值 z̄(τ)=μφ(τ);训练时配一个对称 decoder Dψ 重建 τ 以保证信息完整。几何对齐用 soft-DTW 计算两条轨迹的物理距离 δXij 作为监督,使隐空间距离与之匹配——这正是"isometric"隐空间的来源(见消融)。

② Global Modulation(把 z 注入 denoiser)

behavior latent 通过 MLP 变换成每层的 γ(l) 与 β(l),以 affine 变换作用在 denoiser 的 feature map 上:h(l) ← γ(l)(z) ⊙ h(l) + β(l)(z)(FiLM 式全局调制)。作者的消融显示,这种注入方式比简单 concatenation 或不加条件 (unconditioned) 收敛到明显更低的 diffusion training loss,说明它有效降低了训练中的 inter-mode ambiguity。

global modulation of denoiser
Figure 3. Global Modulation:behavior latent z 经 MLP 变成 layer-specific 的 γ(l)、β(l),通过 affine 变换调制 denoiser 各层特征。

③ Test-Time Latent Adaptation(测试时只优化 z)

约束变化时,PDP 冻结 {Eφ, εθ},只调 z:先用 semantic warm-start z0φ(X(τ̃)) 从一条目标 demonstration 初始化,再沿 fitting loss ℒfit 迭代若干步。因为隐空间几何对齐,warm-start 已接近可行区,通常只需很少步数即可适应;随机初始化则几乎无法收敛(见 Table 6)。

latent-space navigation for generalization
Figure 5. 通过隐空间导航实现泛化:学到的 behavior latent 把 demonstration 组织成紧凑 cluster,欧氏距离反映轨迹相似度。在流形上平滑插值可让 denoiser 生成介于已示范模式之间的全新行为

03 Experiments

9 个高多模态操作域(仿真 + 真机)上评测四点:behavior steering、原任务保真、几何驱动泛化、各组件必要性。基线共 9 种:DP、BC-GMM、BC、IBC、ADPro、Diff-ES、VQ-BeT、BESO。指标为 3 个随机种子下的成功率均值 ± 标准差。

benchmark domains
Figure 4. 评测域。上排为训练环境(多样专家示范,如 OpenDrawer/CloseDrawer 的不同接近路径、PickUpCup 的四个离散抓取点);下排为带 constraint-induced shift 的测试环境——红色障碍阻断某些训练模式使其失效,或移除把手只留下唯一可行策略。

约束偏移场景成功率(Table 2 摘选,总体均值见末行)

Task · ScenePDPDPVQ-BeTBC-GMMBESO
CloseDrawer · S3100.0 ± 0.040.0 ± 13.0100.0 ± 0.00.0 ± 0.0100.0 ± 0.0
PlaceBlock · S386.7 ± 10.12.5 ± 2.576.0 ± 3.10.0 ± 0.016.2 ± 11.5
MeatOffGrill · S391.7 ± 2.92.5 ± 2.50.0 ± 0.00.0 ± 0.00.0 ± 0.0
PickUpCup · S285.0 ± 2.50.8 ± 1.455.0 ± 5.072.5 ± 4.322.5 ± 15.9
Overall Avg.92.021.564.613.830.6

Scene 1–2 使除单一模式外的所有训练模式失效;Scene 3 是 zero-mode-feasible 设定——所有训练模式都失效,仅提供一条新 demonstration 用于适应。可见在 zero-mode-feasible(S3)的 MeatOffGrill 上,PDP 达 91.7% 而所有基线接近 0;总体上 PDP 92.0% 远超次优 VQ-BeT 的 64.6%。

原始(未偏移)场景成功率(Table 1)

TaskPDPDPDiff-ESVQ-BeT
CloseDrawer100.0 ± 0.088.3 ± 3.899.2 ± 0.8100.0 ± 0.0
PlaceBlock97.5 ± 2.560.0 ± 6.680.0 ± 0.077.5 ± 0.0
MeatOffGrill73.3 ± 2.952.5 ± 8.760.0 ± 0.00.0 ± 0.0
PickUpCup90.0 ± 5.015.8 ± 3.840.0 ± 0.079.2 ± 1.7

即使在无约束偏移的原任务上,PDP 也在这四个域全部取得最佳/并列最佳——说明 behavior latent 足够表达训练数据的多模态分布,并非以牺牲原任务保真换取适应性。

真机 OpenDrawer(Table 3,successes / 5 trials)

MethodOriginalScene 1Scene 2Scene 3
PDP5/55/55/55/5
DP5/53/51/52/5
simulation trajectory visualizations under constraint shift
Figure 11. 约束偏移下的仿真轨迹(CloseDrawer / PickUpCup),逐列对比 PDP 与 DP、BC-GMM、BC、IBC。PDP 保持 mode-consistent、集中在可行的绕障走廊内;无条件基线出现 mode interference 并塌缩到不可行区域。
latent space interpolation on CloseDrawer
Figure 13. CloseDrawer 隐空间插值。上:学到的隐分布,cluster 对应不同接近策略;中:多条插值路径(线性 / 椭圆)在 cluster 间穿行;下:以插值 latent 为条件生成的末端执行器轨迹——尽管插值方式不同,行为随 latent 平滑变化,验证了几何对齐隐空间的可插值性。

Ablations(消融)

04 Limitations

Note: 论文没有独立的 Limitations 章节。以下第 1 条为作者在 Impact Statement 中明确陈述 (stated);其余为从方法设计推断 (inferred)。
适应依赖一条成功 demonstration,且行为局限于已学隐空间附近(stated)

作者原文:"adaptation relies on a successful demonstration, and the adapted behavior is expected to lie within or near the learned behavior space induced by existing demonstrations." 即测试时适应需要一条目标 demonstration 做 warm-start,且生成行为预期位于/接近已有示范诱导出的 behavior space——离该流形太远的全新策略未必可达。

behavior latent 维度极低(d_z = 2)(inferred)

正文超参数表把 latent 维度设为 2。这利于可视化与插值,但对模式数量更多、跨阶段组合更复杂的任务,2 维隐空间的表达力是否足够,论文未在更高维度上系统验证。

behavior trace 依赖状态特征(如位置状态)(inferred)

几何对齐建立在从 demonstration 抽取的 state-based behavior trace 与 soft-DTW 物理距离之上。对于难以用低维状态轨迹刻画相似度的任务(如以视觉/接触为主的行为),该"距离 ≈ 相似度"假设是否仍成立,未展开讨论。

评测集中于操作类任务(inferred)

实验覆盖 9 个操作域(drawer/cup/block 等),虽含真机,但未涉及导航、动态/高频控制等场景,泛化范围有待进一步验证。