Diffusion Guidance · Autonomous Racing

CoDiG:面向机器人的约束感知扩散引导

Constraint-Aware Diffusion Guidance for Robotics: Real-Time Obstacle Avoidance for Autonomous Racing
Hao Ma, Sabrina Bodmer, Andrea Carron, Melanie Zeilinger, Michael Muehlebach(ETH Zürich · Max Planck Institute for Intelligent Systems)

扩散模型能拟合复杂高维分布,却天生不懂"约束",难以进安全攸关场景。CoDiG 把 barrier function 直接融进扩散去噪的 reverse SDE,在采样阶段用轻量的 barrier 梯度把轨迹"推"向可行域——无需重训网络、无需投影或外部模拟器。在微型自主赛车实机上,配合 warm-start 达到 2.5 Hz 实时重规划、100% 避障成功率。

微型自主赛车实机验证数据高效:仅 80 条训练轨迹NVIDIA RTX 4090 📄 arXiv:2505.13131 OpenReview 8OPDJOpfZV
diffusion modelconstraint-aware guidancebarrier function实时避障autonomous racingtrajectory planningwarm-startsafety-critical roboticsMPC

01 Motivation

扩散模型(diffusion models)在机器人领域潜力巨大,因为它能"capture complex, high-dimensional data distributions"。但纯靠数据训练的模型缺乏 constraint-awareness:面对分布外场景,采样出的轨迹可能碰撞障碍或动力学不可行,因此难以部署到安全攸关任务。已有做法要么在训练期塞入大量满足约束的数据(成本高、泛化差),要么在推理期做投影 / 外部校正(计算昂贵)。

"their lack of constraint-awareness limits their deployment in safety-critical applications." —— CoDiG 的目标:在采样时用 barrier 梯度增广 score,无需 projections、辅助模型或 simulators。
sampling without barrier function
(a) 不加 barrier function 的采样。无约束扩散采样出的轨迹会直接穿过障碍——不满足避障要求。
sampling with barrier function
(b) 加入 barrier function 的采样(CoDiG)。去噪过程(t = 1 → 0.591 → 0.002)逐步被引导,生成结构化、绕开障碍的安全轨迹。
2.5 Hzwarm-start 实时重规划频率(vs 0.25 Hz)
100%避障成功率(5 trials × 15 laps)
50warm-start 后的去噪步数(vs 1000)
80最终训练轨迹数(数据高效)

02 Method

CoDiG 的核心思路:不改动底层神经网络,只在反向扩散过程里把 barrier function 的梯度加进 score,从而把采样引向"约束满足"的输出。它是 data-efficient、general-purpose 的框架,也能跨任务泛化。

CoDiG framework flowchart
Fig. 9 · 系统总览。框架把三部分串起来:diffusion-based trajectory planner(生成参考轨迹)、constraint-aware guidance module(用 barrier 梯度引导采样满足避障约束)、warm-start(复用上一次轨迹加噪,加速实时重规划),最终由 tracking MPC (TMPC) 跟踪执行——TMPC 本身并不知道障碍信息。

Barrier-guided reverse SDE(约束感知引导)

把"满足约束 C"的条件分布写成对 score 的修正:
∇log p_t(x_t|C) = ∇log p_t(x_t) − γ_t ∇V(x_t; C)(Eq. 5)。其中 barrier function V 在不可行区域取大值、在可行区域取 0。据此改写反向扩散:
dx_t = β(t)[−x_t − (1+η)(∇log p_t(x_t) − γ_t∇V(x_t;C))]dt + η√(2β(t)) dw̃_t(Eq. 6)。
参数 η ∈ [0,1] 加速收敛;权重 γ_t 按调度从 0 逐步增大——早期让模型自由去噪,后期再逐步施加约束。赛车任务中 V 由"避障项 + 惩罚偏离 nominal time-optimal 轨迹的二次项"组成(Eq. 7)。

Warm-start:让实时重规划成为可能

常规每次都从高斯噪声重新采样,需要约 1000 步去噪、太慢。Warm-start 改为对上一次轨迹加少量噪声再去噪,把步数从 1000 降到约 50,既实现实时重规划、又保持时间上的连续性(temporal consistency)。这把采样频率从 0.25 Hz 提到 2.5 Hz。

time-conditioned U-Net architecture
Fig. 4 · 网络结构。time-conditioned score-based 生成模型:U-Net backbone 通过多级卷积 / 反卷积提取多尺度特征,配合 temporal embedding 与 spatial transformer 模块。训练 500 epochs。

03 Experiments

平台:自建的微型自主赛车 + 缩比赛道 + motion capture 系统,推理在 NVIDIA RTX 4090 上。数据:先解 time-optimal control 得到 100 条专家轨迹(约 16 小时计算),在安全区域加冗余障碍增广到 10,000 条,最终以 Frenet 坐标系(横向位移 ŷ、航向角 φ̂)下的 80 条轨迹训练。生成的轨迹交给 tracking MPC (TMPC) 执行。

指标Without warm-startCoDiG (warm-start)
去噪步数~1000~50
采样 / 重规划频率0.25 Hz2.5 Hz
实机避障成功率100%(5 trials × 15 laps,10 种障碍配置)
CoDiG vs offline time-optimal trajectories
Fig. 7 · 接近时间最优。CoDiG 实时生成的轨迹(红)与离线计算的 time-optimal 轨迹(黑)在多种障碍配置下高度吻合,只为安全裕度做出微小偏离——说明实时约束引导几乎不牺牲最优性。
real-world obstacle avoidance episode
Fig. 2 · 实机避障回合。障碍侵入 → 触发重规划 → 成功绕行的完整过程,验证了动态条件下的实时安全性。

Ablation:warm-start 的取舍

对比同一障碍配置下"标准 500 步"与"partial diffusion 50 步(warm-start)"生成的参考轨迹(Fig. 6):warm-start 的轨迹更粗糙、更保守,但换来了稳定性与实时性。图中灰圈为静态障碍、黑圈为动态障碍。训练侧的消融(Fig. 5)则比较了不同输入模态与 noise schedule 下的收敛表现。

warm-start vs standard sampling comparison
Fig. 6 · Warm-start 对比。标准采样(500 步)轨迹更精细;warm-start(50 步)虽更粗糙、更保守,但足以稳定实时运行。

04 Limitations

Note: 以下第 1 点由作者在文中明确指出(stated);第 2、3 点为根据方法设计与实验范围推断(inferred)。
Warm-start 让轨迹更粗糙、更保守(stated)

为了把去噪步数从 1000 降到 50,warm-start 生成的轨迹 profile 更粗糙、路径更保守——这是实时性与轨迹精细度之间的直接权衡。

需要为每个任务设计 task-specific barrier function(inferred)

barrier function V 需针对具体任务(如赛车避障)设计。作者认为相比数据采集成本这部分开销可忽略,但它仍是把框架迁到新任务时的一项人工设计负担。

与其他 inference-time 约束方法缺乏直接量化对比(inferred)

论文主要展示 CoDiG 自身的有效性与消融,未给出与 projection / 外部校正等其他推理期约束方法在同一实机上的头对头定量比较。