机器人 · VLA 安全对齐

SafeVLA:以约束学习实现 VLA 模型的安全对齐

Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
Borong Zhang, Yuhao Zhang, Jiaming Ji, Yingshan Lei, Yishuai Cai, Josef Dai, Yuanpei Chen, Yaodong Yang(Peking University 等)

VLA 作为通用机器人策略在真实部署时会给环境、机器人自身乃至人类带来严重安全隐患。SafeVLA 把安全性显式建模为约束马尔可夫决策过程(CMDP),用拉格朗日松弛的 Safe RL 训练 —— 在提升任务成功率(SR)的同时,把累计安全违规(cumulative cost, CC)平均降低 83.58%,并对 OOD 扰动与极端失败场景保持稳健。

cs.RO / cs.AISafety-CHORES 基准长时程移动操作 📄 arXiv:2503.03480 PDF
Vision-Language-ActionVLA 安全对齐Constrained MDPSafe RLLagrangian relaxationmobile manipulationcumulative costsim-to-realOOD 泛化

01 Motivation

VLA 有望成为通用机器人策略,但它直接输出物理动作,一旦失误就是真实世界的碰撞、损坏与伤人 —— 这类物理风险无法靠 VLM/LLM 那套 RLHF、内容审核来解决。论文指出:现有 VLA 尚未把安全性作为设计中不可或缺的一环显式定义并集成

"Vision-language-action models (VLAs) show potential as generalist robot policies. However, these models pose extreme safety challenges during real-world deployment, including the risk of harm to the environment, the robot itself, and humans."

本文的做法不是给奖励里加惩罚项(reward shaping),而是把安全当作硬约束:先系统性地"引诱"出多样的不安全行为,再用带约束的强化学习把违规压到给定阈值以下,从而得到 SR 与安全性都更优的策略。

ISA pipeline
Figure 1:Integrated Safety Approach (ISA) 流水线 —— 面向 VLA 的系统化安全对齐框架,串联「安全建模 → 风险引发 → 策略约束 → 安全保证」四个环节。
-83.58%累计安全违规 CC 平均降幅(vs FLaRe)
+3.85%任务成功率 SR 平均提升
~35×极端场景下 CC 上界严重程度降低
3 类Safety-CHORES 任务:ObjNav / PickUp / Fetch

02 Method

整体框架称为 Integrated Safety Approach (ISA),把 VLA 对齐纳入 CMDP:在满足累计成本约束的可行策略集合内最大化任务回报,即 π* = arg maxπ∈ΠC J(π),约束为 E[Σ γt ci(st,at)] ≤ bi。ISA 依次覆盖四个相互衔接的环节。

① Safety Modeling(安全建模)

用组合逻辑把安全性写成状态-动作谓词 φ(瞬时违规,如碰撞)与轨迹级谓词 ψ(整条轨迹上的行为约束)。任务把自然语言指令与安全规约一并给出。计成本规则:状态-动作谓词每次违规计 cost = 1;轨迹级谓词则在违规轨迹的最后一步计 cost = 1。

② Risk Elicitation(风险引发)

在 AI2-THOR 中借助 150K 程序化生成场景(ProcTHOR)与 800K 3D 物体(Objaverse),专门制造五类安全关键情形(safety critical components)去暴露危险行为:

safety critical components
Figure 2:[上] 五类安全关键情形的概念示意;[下] 仿真环境中对应的逼真渲染样例。

③ Policy Constraining(策略约束)

核心在于用拉格朗日松弛把带约束问题转成 min-max 优化:minθ maxλ≥0 [ −Jr(θ) + Σi λi Jci(θ) ]。动态的拉格朗日乘子 λ 会自适应地在"安全"与"任务表现"之间权衡 —— 违规越多,λ 越大,对策略的约束越强,避免了固定惩罚系数的僵化。

④ Safety Assurance(安全保证)

从三个维度评估安全性:test-time safety(留出/OOD 场景)、long-tail safety(低频罕见事件)、extreme failure safety(任务根本不可能完成时能否安全地失败)。

03 Experiments

在自建基准 Safety-CHORES(含 Safety-ObjNav 多房间导航找物、Safety-PickUp 从表面抓取、Safety-Fetch 先导航再抓取三类任务)上评测。主要指标:SR(成功率 ↑)与 CC(累计成本 / 安全违规 ↓,CC(τ)=ΣkΣt ck(st,at))。baseline 覆盖 IL-only(SPOC)、IL+RL 标准(FLaRe)、IL+RL 奖励塑形(FLaRe-RS)与 RL-only(Poliformer)。

下表对比 IL+RL 标准基线 FLaRe 与本文 ISA(数值摘自 Table 1)——ISA 在三类任务上 SR 均更高,而 CC 大幅下降,尤其 Safety-PickUp 的 CC 从 7.076 降到 0.372:

Safety-CHORES 任务FLaRe · SRISA · SRFLaRe · CCISA · CC
Safety-ObjNav0.8220.86512.3561.854
Safety-PickUp0.9120.9287.0760.372
Safety-Fetch0.6050.63743.3648.084
平均相对变化SR +3.85%CC −83.58%
cumulative cost distribution
Figure 3:累计成本分布分析。左:测试集上 ISA 与 FLaRe 微调后各条轨迹的 CC 分布;中:任务成功时的 CC 分布;右:任务失败时的 CC 分布。ISA 的成本分布无论成功与否都保持一致、集中在低位,而 FLaRe 呈现"成本与成功负相关"的危险模式。
SR and CC per benchmark
Figure 5:多个基准上各 VLA 模型的对比。左:每个模型在各基准上的 SR;右:对应产生的 CC。ISA 在保持/提升 SR 的同时显著压低 CC。

Ablations & 泛化

04 Limitations

Note: 以下第一条为论文附录明确陈述(stated),其余两条为依据方法设计推断(inferred from the design)。
轨迹级谓词的信用分配尚待探索(stated)

论文指出,针对轨迹级谓词 ψj 的 credit assignment "remains an area for exploration in future work" —— 当前把成本只记在违规轨迹的最后一步,如何更精细地把责任分配到轨迹中的具体动作仍是开放问题。

Sim-to-real 依赖精心设计的感知与对齐(stated / inferred)

论文的真机验证平台为双 Realman RM75-6F 机械臂 + PsiBot G0-R 灵巧手 + egocentric RealSense D455 相机(Figure 8)。作者说明 sim-to-real 需要结构化位姿估计、动力学解耦与数字孪生对齐;对多样机器人形态的泛化仍未解决。

安全性建立在仿真定义的谓词与阈值之上(inferred)

成本函数、五类安全关键情形与阈值 bi 均在 AI2-THOR 仿真中定义。现实世界的危险语义更丰富且难以枚举,谓词覆盖不全时可能出现"未被建模的风险",这是约束式方法的固有边界。