Robotics · VLA Runtime Monitoring

Hide-and-Seek in Trajectories

仅凭轨迹级标签,把“藏”在正常动作里的失败信号“找”出来 — VLA 运行时失败检测
Seongheon Park, Wendi Li, Changdae Oh, Samuel Yeh, Zsolt Kira, Michael Hagenow, Sharon Li · (UW–Madison, Georgia Tech 等)

失败轨迹里绝大多数动作其实是正常的,真正“出错”的往往只是少数几步,但训练时只有一条轨迹级的成功/失败标签。Hide-and-Seek 把 VLA 失败检测建成 coarsely supervised learning 问题:用跨轨迹 + 轨迹内两个对比目标,从轨迹级监督中定位最具失败指示性的动作,无需任何逐步标注,再借 conformal prediction 做运行时报警。

arXiv 2605.30834 (v1) LIBERO · VLABench · Real xArm 6 OpenVLA · π₀ · π₀.₅ 📄 arXiv:2605.30834 PDF
VLA runtime monitoringfailure detectioncoarsely supervised learningcontrastive learningconformal prediction失败检测OpenVLAflow-matching policyweakly supervised localization

01 Motivation

VLA(Vision-Language-Action)模型让机器人能按自然语言指令泛化到多样任务,但执行中仍会失败,实时检测失败是可靠部署的关键。现有方法卡在两条轴上:监督成本——逐步(step-level)失败标注昂贵、难以规模化;计算实用性——action resampling / 外部 VLM judge 推理开销大,无法实时。近期 SAFE 把轨迹级标签均匀贴到每一步,却把失败发生前的正常动作误标为失败,引入大量 label noise。

“the failure signal is hidden among largely normal behavior within a trajectory, and the detector must seek it out using only the trajectory-level outcome as a clue.”
Hide-and-Seek failure detection concept
Figure 1. 失败轨迹在 failure onset 之前含有大量正常动作,训练时却只有一个轨迹级标签、时序结构完全未知(上)。Hide-and-Seek 从这种粗监督中发现最具失败指示性的动作(如 failure onset 及其后的关键事件),把标签“均匀传播”换成自适应的失败信号定位。
+11.7%bACC,超最强 classifier baseline(up to)
0step-level 标注需求
0.001s每帧延迟 vs VLM monitor 2.343s
12 / 3对比 12 个 baseline · 3 个 VLA policy

02 Method

给定一批成功轨迹与失败轨迹(仅轨迹级标签 y∈{0,1}),从 VLA 的 action token / action head 抽取每步 action embedding,训练一个轻量时序检测器 fϕ(默认 single-layer LSTM),对每个前缀输出标量 failure score st∈(0,1)。核心是用两个互补粒度的对比目标,把“轨迹级监督”转成“有时序结构的逐步失败信号”。

Hide-and-Seek overall framework
Figure 2. 整体框架。对一对 (τ_f, τ_s),检测器为两条轨迹产出逐步 failure score。ℒ_inter 要求失败轨迹中“最具失败指示性”的动作分数高于成功轨迹中“最像失败”的动作(hardest false-positive);ℒ_intra 在失败轨迹内部围绕 proxy failure onset 拉开前后分数,形成时序结构。

ℒ_inter — 跨轨迹对比(seek the peak)

不再逐步独立分类,而是聚焦于最具失败指示性的一步:对失败轨迹 τ_f,至少有一步分数应真正升高,且要高于成功轨迹 τ_s 中最像失败的那一步(hardest false-positive,如一次短暂犹豫或尴尬中间姿态但最终恢复)。用 margin-based contrastive loss 强制 max(s|τ_f) 比 max(s|τ_s) 高出 margin m。该目标不假设失败发生在哪一步,而是自适应地把最显著的失败信号“找出来”。

ℒ_intra — 轨迹内对比(sharpen the onset)

仅用 ℒ_inter 只优化单个峰值,周围时序结构仍无监督。由于 failure onset 之后成功概率下降,作者引入第二个目标:在每条失败轨迹内定义 proxy failure onset(failure score 上升最陡的点),鼓励 onset 之后的平均分数 > onset 之前的平均分数。论文证实该 proxy 与人工标注的 onset 高度吻合,把粗监督转成时序结构化的失败信号,全程无需逐步标注。总损失为 ℒ = ℒ_inter + λ·ℒ_intra。

Runtime monitoring via Conformal Prediction

部署时每步产出 st,超过阈值 τt 即报警。为避免固定阈值不适配分数的时序演化,采用 functional conformal prediction:在一组留出的成功轨迹上标定一条随时间变化的预测带,在 exchangeability 假设与用户指定显著性 α 下,保证新成功轨迹的轨迹级 false alarm rate ≤ α。为降低时序冗余,先做非重叠 sliding-window 平均池化(窗口 w)。

03 Experiments

在两个仿真基准 LIBERO-10VLABench 与真实 UFactory xArm 6 平台上评测多任务失败检测,覆盖自回归与 flow-matching 两类范式的 3 个 policy:OpenVLA、π₀、π₀.₅;采用 held-out task 协议区分 seen / unseen,结果对 3 个随机种子取平均。指标:bACC(balanced accuracy,主指标)、wACC(weighted accuracy)、TWA(time-weighted accuracy,惩罚晚检测);三者均在 conformal α∈{0.15, 0.20, 0.25} 上平均。对比 12 个 action-based baseline(OOD / multi-sampling / classifier / token-uncertainty)。

主结果 — bACC(vs 最强 baseline SAFE-MLP)

基准 / Policy划分SAFE-MLPOursΔ bACC
LIBERO-10 · OpenVLASeen0.8230.852+2.9
LIBERO-10 · OpenVLAUnseen0.7750.834+5.9
LIBERO-10 · π₀Seen0.8700.885+1.5
LIBERO-10 · π₀Unseen0.8010.892+9.1
VLABench · π₀.₅Seen0.7880.856+6.8
VLABench · π₀.₅Unseen0.6410.713+7.2
Real CUBE · π₀.₅Unseen0.7970.914+11.7

Hide-and-Seek 在所有 model × benchmark × (seen/unseen) 上于 bACC/wACC/TWA 均取得 SOTA。OOD 方法在 seen 上有竞争力但 unseen 大幅退化(如 Mahalanobis 在 OpenVLA 上从 67.0% 跌到 51.3% bACC);SAFE-MLP 用线性增长的时间权重部分缓解均匀标注,但该固定启发式对“失败何时发生”无感知。真实机械臂上,Hide-and-Seek 在四个设置的 TWA 全部最优,unseen CUBE 较 SAFE-MLP +11.7% bACC、+15.0% TWA;SAFE-MLP 在 seen CUBE 高达 99.2% bACC 却在 unseen 跌到 79.7%,而本方法跨设置稳定。

accuracy-timeliness tradeoff on LIBERO-10
Figure 3. LIBERO-10 上(OpenVLA 与 π₀)的检测“准确率–及时性”权衡:扫描 α∈[0.01,1.0] 得到各方法的操作点曲线,越靠左上越好。灰色虚线为失败轨迹的平均归一化 failure onset 时刻(用 GPT-5.2 对录像标注)。Hide-and-Seek 曲线始终最靠左上,即更早且更准。
qualitative failure trajectories with failure scores
定性示例(失败轨迹):左,机器人抓 alphabet soup 失败后停止移动;右,放好 mug 后卡住并漂移、未关微波炉。Hide-and-Seek 的 failure score 在关键失败事件处升高——而在成功轨迹上分数全程保持低位。

Ablations

损失分量(Table 5)

ℒ_inter 已超最强 baseline SAFE-MLP(OpenVLA +2.6%、π₀ +2.1%);仅 ℒ_intra 表现下降,因其依赖 onset proxy,需 ℒ_inter 先塑造分数动态才有意义;两者结合再提升(OpenVLA +1.8%、π₀ +3.2%)。

Backbone / 效率(Table 4 & 6)

能利用时序上下文的 backbone(GRU/Transformer/LSTM)显著优于逐步 MLP,LSTM 最稳作默认。对比 VLM monitor(Qwen3-VL-8B):Ours bACC 0.843 vs 0.712,延迟 0.001s vs 2.343s(超 2000× 更快)。

uniform labeling embedding
(a) Uniform trajectory-level labeling
onset-aware relabeling embedding
(b) Onset-aware relabeling
OpenVLA embedding 可视化:均匀轨迹级标注(左)把 onset 前的正常动作也标成失败,边界模糊;Hide-and-Seek 的 onset-aware 重标注(右)让失败/正常动作在特征空间更清晰可分。

04 Limitations

Note: 以下均为论文 Appendix I — Limitations and Future Work 中作者明确陈述(stated)的局限。
沿 DoF 维度平均,可能丢弃运动学结构

Hide-and-Seek 对 VLA 内部 embedding 的 degree-of-freedom 维度做平均,可能丢掉对某些失败模式有用的 kinematic structure,例如只在特定关节或末端执行器构型上显现的失败。作者建议探索 kinematic-aware 的特征聚合。

纯 action-level embedding 难覆盖感知型失败

部分失败在本质上是感知型(perceptual)的,仅靠 action-level embedding 未必能完全捕捉;作者提出把视觉观测与动作表征联合起来构建 multimodal failure detector 作为补充信号。

检测器非万无一失,需作为系统一环

Broader Impacts 指出:failure detector 并非绝对可靠——false negative 会漏检、false positive 会触发不必要的干预。作者将 Hide-and-Seek 定位为更大系统中的一个监控组件(辅以硬件约束、上层监督等),而非可靠性的独立保证。闭环矫正/恢复/多轮交互留作 future work。