强化学习 · 扩散策略 · NeurIPS 2026 preprint

AMDP:用 Adjoint Matching 训练扩散策略的可扩展最大熵强化学习

Scalable Maximum Entropy Reinforcement Learning for Diffusion Policies via Adjoint Matching
Serge Thilges, Onur Celik, Denis Blessing, Emiliyan Gospodinov, Gerhard Neumann · Autonomous Learning Robots, Karlsruhe Institute of Technology (KIT)

扩散策略能表达复杂的多模态动作分布,但在线 RL 里训练它们要么靠反向传播穿过整条扩散链(显存爆炸),要么靠 importance sampling / 截断 Langevin(难扩展、缺保证)。AMDP 把最大熵 RL 改写成一个 stochastic optimal control (SOC) 问题,用 reciprocal adjoint matching 得到一个类似 score matching 的回归目标——免仿真、免链式反向传播,仅用 replay buffer 里的终端动作即可多次更新。在 63 个环境上,AMDP 匹配或超越强基线,训练墙钟时间追平高效的 Gaussian on-policy 方法。

on-policy + off-policy63 个环境10 seeds · IQM ± 95% CI 📄 arXiv:2606.22630 PDF
diffusion policymaximum entropy RLadjoint matchingstochastic optimal controlSchrödinger bridgesimulation-free trainingQ-scoretrust region在线强化学习

01 Motivation

在线 RL 没有 ground-truth 数据集,因此 score matching / bridge matching 这类目标无法直接使用。论文把现有训练扩散策略的方法归纳为三类,并指出各自的硬伤:

能不能有一个既像 score matching 一样可扩展的回归目标、又对 RL 有理论支撑,还能免仿真、免链式反向传播地训练扩散策略的方法?
HumanoidBench 结果
AMDP (Ours) REPPO DIME PPO
核心结果预览(HumanoidBench,on-policy)。在包含 whole-body 操作任务的高维 HumanoidBench 上,AMDP(蓝)即便不用 best-of-N 也大幅领先所有基线(IQM Score,10 seeds,阴影为 95% bootstrap CI),论文称其 "outperforms all baselines by a large margin",说明该方法能很好地扩展到更复杂的任务。
63on-policy 评测环境(MuJoCo Playground / ManiSkill / HumanoidBench)
7off-policy 高维 dog & humanoid 环境(DMC)
0链式反向传播 / 扩散过程仿真(policy 更新)
≈REPPO墙钟训练速度追平高效 Gaussian on-policy 方法

02 Method

扩散策略把动作生成建模为一个受控 SDE:dXτ = σ(τ)u(Xτ,s,τ)dτ + σ(τ)dBτ,动作 a=X1。目标是找到漂移 u 使终端边缘 Πu1 等于最优最大熵策略 π*(a|s) ∝ exp(Qπ(s,a)/α)。作者用确定性初值 X0=0 保证参考过程 memoryless,从而把 Schrödinger bridge 问题解耦成一个 path-space 上的变分目标——这正是一个二次运行代价、终端代价为 g=logΠ01−Qπ/α 的 SOC 问题。

AMDP 训练流程
AMDP 训练流程(论文 Fig. 1)。(1)从确定性初值 X0=0 前向仿真 SDE,得到终端样本 X1u1;(2)用 error function squashing a=erf(X1) 映射到有界动作空间 𝒜=[−1,1]d;(3)在 squashed 动作上计算 Q-scorex(1/α)Qπ;(4)借助 reciprocal 过程 Π0τ|1 直接从 X1 采样中间态 Xτ(免仿真);(5)在这些中间态上最小化 AMDP 回归损失来优化向量场 u,完全不需要对扩散过程反向传播

Reciprocal Adjoint Matching:一个 score-matching 式的回归目标

Adjoint Matching (AM) 把 path-space KL 目标写成一个 fixed-point 回归损失,其唯一不动点就是最优控制 u*(用 stop-gradient ū=sg(u),无需穿过扩散过程求导)。Havens 等的 reciprocal 改进把期望取在参考过程的 reciprocal projection 上:在 X0=0 设置下,条件分布 Π0τ|1 是一个可解析采样的 state-independent 高斯。于是可以把当前控制的终端样本 X1 存进 replay buffer,然后免仿真地(simulation-free)反复优化,并"reuse them for multiple gradient updates"——效率与 score/flow matching 同级,且保有与 AM 相同的理论保证。

Error function 动作 squashing

动作空间通常是有界的 [−1,1]d,需用可逆变换 f 把 X1 squash 进合法区间,change-of-variables 会带来 Jacobian 项 |det Jf|。作者不用常见的 tanh,而用缩放误差函数 ferf(x)=erf(kx),并把缩放因子 k 选成使 |det Jf| 恰好抵消参考过程的高斯边缘密度 Π01。此时 log(Π01/|det Jf|) 变成与 X1 无关的常数、梯度消失,训练目标被大幅简化为只含 Q-score 的一项;实验中 erf 也表现出"superior numerical stability"

Trust-region 更新与策略迭代保证

on-policy 里目标分布漂移很快,更新易不稳。作者加了一个 trust-region 约束(把新旧漂移 u 与 uold 的偏差限制在 ε 内),用 relaxed Lagrangian + dual descent 求解。因为 AMDP loss 与 TR loss 都是 u 的二次凸函数,强对偶成立;Proposition(fixed-point preservation)证明:对任意 λ≥0,加入 trust region "preserves the unique fixed point",不改变原目标的最优解。策略评估侧则用一个可处理的熵下界ENT(因扩散策略的边缘熵不可解)构造 soft Bellman backup,从而给出收敛到最优最大熵策略的策略迭代保证。

03 Experiments

on-policy 在 MuJoCo Playground、ManiSkill、HumanoidBench 共 63 个高度并行环境上评测,对比强 Gaussian 基线 REPPO / PPO / SPO 与扩散策略方法 DPPO / FPO / DIME;off-policy 在 DMC 的 7 个高维 dog & humanoid 环境上对比 DIME / QSM / Diff-QL / Consistency-AC。所有实验重复 10 seeds,按 Agarwal 等的建议报告 IQM 与 95% 分层 bootstrap 置信区间。

墙钟运行时间(off-policy,单次训练迭代,ms)

simulation-free 目标最直接的收益是:AMDP 的网络训练时间(Upd.)几乎与扩散步数无关,而对整条扩散链反向传播的 reverse-KL 随步数线性爆炸。

方法扩散步数Cartpole · Env.Cartpole · Upd.G1 · Env.G1 · Upd.
REPPO (Gaussian)839489,6051,014
AMDP1640499410,0311,113
rev. KL164049,94410,04111,421
AMDP1282,73899113,0971,117
rev. KL1282,75171,65913,12982,101

(Env. = rollout 时间,Upd. = 网络训练时间;论文 Table。128 步时 AMDP 的 Upd. 约 991 ms,而 reverse-KL 高达 71,659 / 82,101 ms,相差近两个数量级。)

on-policy 主结果

MuJoCo Playground Humanoid 结果
AMDP AMDP BoN DIME REPPO DPPO FPO
MuJoCo Playground humanoid locomotion(aggregated IQM)。AMDP 起步显著快于所有基线;REPPO 最终略微反超 AMDP,但在评估时对 Q 函数提议 N=16 个样本取最优(AMDP BoN)后,AMDP 表现"significantly improves… above all baselines"。值得注意的是 DIME 在此表现不佳,印证了复杂 on-policy 场景需要 trust-region 约束的更新机制。在 MJX DMC 上 AMDP 匹配 DIME 并略快于 REPPO;在 ManiSkill 上 AMDP、DIME、REPPO 相近而 PPO/SPO 更差。

Ablations

作者在 MuJoCo Playground DMC 与 Humanoid 上系统消融了每一处设计:

Trust region 消融
ε=0.01 ε=0.1 ε=0.3 ε=1.0 ε=∞ (no TR)
Trust-region 大小消融(MuJoCo Playground humanoid)。没有 KL 约束(ε=∞,红色平线)时 IQM Score 几乎停在 0——策略更新崩塌;各有界 ε 都能收敛到约 30,其中中等约束收敛最快,最小约束(ε=0.01)收敛偏慢。

off-policy:在 DMC 高维 dog & humanoid 上,AMDP 匹配 DIME 的性能、在 dog 环境上收敛略快,说明 adjoint matching 目标在 off-policy 设置下也是与 reverse-KL 相当的有力策略优化损失。

04 Limitations

Note: 第一条为论文 Limitations 一节明确陈述(stated);后两条为根据方法设计推断(inferred from the design),非作者原话。
确定性初值 X0=0 难以对接 offline-to-online 流程(作者明确陈述)

为满足 adjoint matching 所需的 memoryless 性质,AMDP 把参考过程限制为确定性初值 X0=0;而在离线行为数据上预训练的扩散策略通常用随机高斯先验 μ0=𝒩(0,I)。这一结构性差异"complicates the integration of our method into offline-to-online RL pipelines"。作者提出的可能出路是采用 memoryless noise schedule 以兼容标准 flow-matching / denoising diffusion 模型,并留作 future work。

依赖可靠的 Q 函数与 Q-score(inferred)

训练信号核心是 ∇xQπ(Q-score)。策略改进的质量因此取决于 critic 及其梯度的准确性;trust region 正是为在 Q 估计可靠的邻域内更新而设计——这也暗示当 Q 估计较差时更新收益有限。

evaluation 阶段的强表现部分依赖 best-of-N 采样(inferred)

在较复杂的 humanoid locomotion 上,AMDP 需要评估时对 Q 提议 N=16 个样本取最优(AMDP BoN)才能全面超过基线;这会在部署/评估时引入额外的 Q 评估开销(HumanoidBench 上则无需 BoN 即领先)。