机器人 · VLA · 强化学习

WCM:面向 VLA 强化学习的世界评论家模型

World Critic Model for Vision-Language-Action Reinforcement Learning
Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu · arXiv 2607.29613

critic-based 的 VLA-RL 里,value 估计大多只吃单帧观测,与机器人控制的部分可观测(POMDP)本质不符。WCM 把 critic 换成一个基于 LeJEPA 的轻量世界模型:联合预测未来 latent state 与估计 value,让 critic 表征被显式训练去刻画时序动态,而非仅回归标量回报。在 4 个基准共 149 个任务与 7 个真实机器人任务上取得 SOTA,OOD 泛化增益尤为显著。

4 benchmarks · 149 tasksPi0 / Pi0.5 / OpenVLA-OFTon-policy + off-policy RL 📄 arXiv:2607.29613 Homepage GitHub
Vision-Language-Actionreinforcement learningworld modelcritic modelLeJEPAPOMDPvalue estimationrobotic manipulationoff-policy RL时序建模

01 Motivation

critic-based 的 RL 后训练依赖一个 value estimator,但现有方法大多在单帧观测单帧 VLM backbone latent 上估值——这与机器人控制的部分可观测性存在根本性错配。朴素地把观测历史塞进 critic,会在高维视觉空间上带来指数级复杂度;而且即便塞进去也不奏效,因为纯标量回报回归为学习跨时序动态提供的监督严重不足。

作者把根因归结为一个 “state approximation problem”:without an explicit world modeling objective, the critic's representation cannot capture the temporal structure needed for accurate value estimation.
WCM overview
Figure 1:WCM 总览。以往 critic 受部分可观测所困,而朴素多帧结构又因高维观测上的稀疏标量监督而不足。WCM 采用端到端结构,联合预测未来并估计 value,从而有效利用历史信息,取得 SOTA 表现。
149任务数(跨 4 个仿真基准)
+252%OpenVLA-OFT 在 ManiSkill 的相对提升
7真实机器人操作任务
3兼容 backbone:Pi0/Pi0.5/OFT

02 Method

WCM 建立在轻量的 LeJEPA 结构之上。一个 observation encoder 先把过去 K 帧的图像分别编码为序列 latent state;随后一个 predictor 挂两个 decoder head,分别预测下一步 latent state(world head)与估计 value(value head)。它可以无缝接入 on-policy 与 off-policy 两套训练管线,并兼容 Pi0、Pi0.5、OpenVLA-OFT 等 SOTA VLA backbone。

WCM architecture and pipelines
Figure 2:WCM 方法总览。(a) Architecture:observation encoder 把过去 K 帧映射为序列 latent state;predictor 的两个 decoder head 分别 forecast 下一状态与估计 value。(b) On-policy Pipeline:从 on-policy rollout 估值,计算 GAE advantage 用于 PPO/Flow-SDE 更新。(c) Off-policy Pipeline:用统一 data buffer(SFT + rollouts)通过 AWR/RECAP 稳定地同时更新 WCM 与 policy。

把 VLA-RL 建模为 POMDP

论文把 VLA 机器人操作显式建模为部分可观测马尔可夫决策过程(POMDP):观测 ot 只部分揭示隐藏状态 st。单帧 critic 无法从当前观测恢复真实状态,这正是价值估计不准的来源。WCM 通过引入世界建模目标,让 critic 表征去逼近隐藏状态的时序结构。

联合目标:value + world prediction + LeJEPA 正则

训练损失由三项组成——value 估计损失、下一状态预测损失 Lpred(teacher-forcing 下预测 latent 与真实 latent 的 L2 误差),以及 LeJEPA 的 SIGReg(Sketched Isotropic Gaussian Regularization)损失,用以防止表征坍缩:

L = Lvalue + λ · Lpred + η · LSIGReg

其中 λ 平衡「回归回报」与「预测未来」两种监督——λ=0 即退化为只有时序建模能力、无世界预测的 ViT critic(消融中的对照)。

03 Experiments

评测覆盖 ManiSkill(IND 与沿 vision/semantic/execution 三轴的 OOD)、MetaWorld(pick-and-place 之外的接触任务)、CALVIN(长程任务)与 LIBERO-Plus(泛化能力);所有 policy 均从 few-shot SFT baseline 初始化,用稀疏 0/1 reward 训练。“+WCM” 表示把 Flow-SDE / PPO 的 critic 替换为 WCM。指标逐字摘自论文。

ManiSkill:IND 与 OOD 成功率(%,Table 1)

BackboneMethodINDOOD avg.
Pi0SFT38.418.1
Pi0prev. best (π-stepNFT)79.250.4
Pi0+ WCM84.451.5
Pi0.5SFT47.026.4
Pi0.5prev. best (π-stepNFT)85.459.5
Pi0.5+ WCM91.964.4
OpenVLA-OFTSFT28.118.3
OpenVLA-OFTprev. best (PPO)97.777.1
OpenVLA-OFT+ WCM99.077.9
OpenVLA-OFTZero-Shot → + WCM0.8 → 98.70.8 → 73.5

三条关键发现(引自论文):(1) ManiSkill 上大幅提升,OpenVLA-OFT 取得 252% 的相对提升;(2) 从极低初始性能也能稳定提升——当 OpenVLA-OFT 在完全未见 ManiSkill 数据(0.78%)时初始化,WCM 把性能提高了 12,551%;(3) 在 MetaWorld(需要稳定接触的任务)与 CALVIN(长程)上同样领先。

MetaWorld and CALVIN results
Figure 4:MetaWorld 与 CALVIN 上的结果(成功率或平均完成长度,带 error bar)。作者称提升源于方法能捕获更高阶的状态信息,在 POMDP 设定下增强 latent 表征与 value 估计。

LIBERO-Plus:单样本 SFT 起步也能追平全量 SFT(total,%,Table 2)

“One-SFT” 每任务仅见 1 条演示,“Full-SFT” 见 50 条;“+WCM” 自 One-SFT 初始化。WCM 从极弱起点出发,total 成功率反超对应 Full-SFT。

BackboneFull-SFTOne-SFT+ WCMΔ vs One-SFT
Pi071.239.172.8+33.7
Pi0.572.938.073.7+35.7
OpenVLA-OFT71.729.374.0+44.7

真实机器人 + sim-to-real(Pi0.5,Table 3/4)

7 个真实操作任务上用 OpenVLA-OFT 与 Pi0.5 做 off-policy RL,部署稳定。以 “拿起物体” 为例(成功次数 / 25 trials):纯 sim SFT 为 0/25,经 sim RL 提升到 carrot 7、banana 7、pepper 6;real SFT 起点为 carrot 13、banana 2、pepper 4,叠加 sim RL 后为 11 / 8 / 9,语义与执行维度的 OOD 也同步改善。

Ablations

ablation on critic architecture and history length
Figure 5:critic 结构与观测历史长度的消融。MLP 是 PPO/Flow-SDE 的 baseline critic;ViT 代表去掉世界预测(λ=0)的 WCM(仅有时序建模能力)。WCM 在所有配置下成功率最高——说明「显式世界预测目标」而非单纯多帧结构才是增益来源。
effect of lambda
Figure 6:λ 对 IND(蓝)与 OOD(红)性能的影响。存在使两者最佳的 λ 取值(星标);λ 过大或过小都会损失性能,印证 value 回归与未来预测两种监督需要平衡。

04 Limitations

Note: 论文没有单独的 Limitations 章节。以下条目为据方法设计推断(inferred),非作者明述,仅供研读参考。
依赖 SFT 初始化与稀疏奖励(inferred)

所有 policy 均从 few-shot SFT baseline 起步、用稀疏 0/1 reward 训练;WCM 是对 critic 的替换而非从零学习,其增益建立在已有 SFT 与奖励设定之上,未探讨无 SFT 或稠密奖励下的表现。

λ 需要按 IND/OOD 权衡调参(stated via Fig. 6)

Figure 6 显示 IND 与 OOD 的最优 λ 并不一致,需针对目标场景取舍——引入了一个对结果敏感的超参数。

真实世界评测规模有限(inferred)

真机验证覆盖 7 个任务、每任务 25 trials,且以 Pi0.5 / OpenVLA-OFT 的 off-policy RL 为主;主结论仍主要来自 4 个仿真基准,大规模真实部署的鲁棒性有待进一步验证。

历史长度 K 带来的计算开销(inferred)

把过去 K 帧编码为序列 latent 提升了时序建模能力,但也随 K 增加计算/显存成本;论文以 LeJEPA 轻量化缓解,未系统给出精度—开销的完整边界。