机器人 · World Model

PSG-JEPA:仅靠前向预测够吗?

Is Forward Prediction Enough? Physical State Grounding for JEPA World Models
Haodong Yan, Jiaguan Zhu, Mingyuan Jia, Ruiqing Yin, Junjie He, Zhide Zhong, 等 · arXiv 2026/08/07

JEPA 世界模型只用 action-conditioned 前向预测塑造潜空间,却不保证潜表征能可靠地解码出机器人自身的物理状态。PSG-JEPA 在前向预测之外,加入两条仅在训练期生效的锚定目标——把单帧潜向量锚到本体状态、把潜向量对锚到多步关节角变化,从而让潜空间"看得见"物理状态。推理架构与算力完全不变,却在可辨识性、规划、策略三层评测中全面超越 SOTA 潜世界模型。

OGBench · LIBERO · Real Dual-arm Cobot Backbone: LeWM (JEPA) Training-only heads, inference cost unchanged 📄 arXiv:2608.06799 PDF
JEPA world model世界模型physical state groundinglatent identifiabilityproprioceptive stategoal-conditioned planningrobot manipulationself-supervised representation

01 Motivation

近期 JEPA-based 世界模型(如 LeWM)从观测序列中学习 action-conditioned 的潜动力学。但作者指出:前向预测目标并不显式监督"从单个 latent 解码机器人物理状态、从 latent 对解码状态变化"这件事,于是留下一个 "robot-centric identifiability gap"——视觉与动作之间的对齐关系没有被编码进表征,下游 planner / policy 只能自己从头去学,进而限制规划与策略的性能。

"control requires relating visual observations to the robot's state and to how actions change it" —— 因此把 vision–action 对齐放到表征层本身,是控制的基础。
PSG-JEPA overview teaser
Figure 1. PSG-JEPA 总览。(a) 前向预测型 JEPA(如 LeWM)仅靠 action-conditioned 前向预测学潜空间,不显式监督机器人物理状态/状态变化的可解码性;(b) PSG-JEPA 保留前向通路,同时把单个 latent 锚到 proprioceptive state、把 latent 对锚到 multi-horizon joint-angle changes,两条目标由轻量、仅训练期的 state head 与 transition head 实现;(c) 相比 LeWM,PSG-JEPA 在物理可辨识性、有限 planner 训练下的规划成功率、仿真与真机策略成功率上均更强。
0.94EE-yaw 探针 r(LeWM 仅 0.08)
95.0%Cube 规划 SR@5ep(LeWM 80.7%)
85.3%LIBERO-Goal 策略成功率
79.3%真机平均成功率(LeWM 60.0%)

02 Method

PSG-JEPA 在标准前向 JEPA 损失之外并联两条 physical state grounding 目标,用来"塑形"潜空间。共享 encoder 对每帧观测 ot+i 产出 zt+i=Eφ(ot+i);两条目标各挂一个轻量 head,只在训练时使用、训练后丢弃,因此推理结构与算力与基线完全一致。

PSG-JEPA grounding objectives
Figure 2. 两条 grounding 目标示意。state head 从每个 latent 预测 ŝt+i=Hs(zt+i),对齐 logged 机器人状态 st+i;transition head 从每对有效端点 (zt+i, zt+i+k) 预测 Δq̂t+i,k=HΔ(zt+i,zt+i+k),监督信号为关节角差 Δqt+i,k=qt+i+k−qt+i

① Static state grounding —— 单帧锚到本体状态

把每个 latent 拉向机器人本体感知状态(joint angles、gripper state、end-effector pose)。损失为
static = (1/T) Σi=0..T−1 MSE(Hs(zt+i), st+i)。 这保证"从单个 latent 就能线性/MLP 读出机器人物理状态"。

② Dynamic transition grounding —— 潜向量对锚到多步关节角变化

把 latent 对 (zt+i, zt+i+k) 拉向对应的 multi-horizon 关节角变化,横跨所有 horizon k ∈ {1,…,T−1}:
dynamic = (1/|𝒦|) Σk∈𝒦 (1/|ℐk|) Σi∈ℐk MSE(Δq̂t+i,k, Δqt+i,k)。 相比只在相邻帧上做 one-step inverse-dynamics,这里的 multi-horizon 端点对提供了更丰富的"状态变化"监督。

③ 组合损失

总损失为 PSG = ℒJEPA + λg(ℒstatic + ℒdynamic),其中 λg = 0.1。state head Hs 与 transition head HΔ 均在训练后丢弃,推理架构和计算成本保持不变

03 Experiments

在三个层级评测:(1) 通过 probing 检验 latent 的物理可辨识性;(2) 在冻结 latent 上做 goal-conditioned planning;(3) 在仿真与真机上做 policy learning。基线包括 LeWM(同 backbone 前向预测)、LeWMActionIDM(相邻对加一步 inverse-dynamics 目标)、DINOv2(预训练视觉参照)。

Q1 · 物理可辨识性探针(OGBench-Cube,Pearson r,linear/MLP)

Table 1 单帧状态探针:PSG-JEPA 在 EE-yaw 上 r 达 0.94/0.98,而 LeWM 仅 0.08/0.08、LeWMActionIDM 仅 0.11/0.10——前向预测/单步 IDM 几乎"看不见"末端偏航。

MethodJointPosEEPosGripperEE-yaw
LeWM0.71/0.690.99/0.990.93/0.960.08/0.08
DINOv20.73/0.720.99/0.940.84/0.840.51/0.50
LeWMActionIDM0.75/0.721.00/0.990.96/0.980.11/0.10
PSG-JEPA0.83/0.811.00/0.990.97/0.980.94/0.98

Table 2 相邻对的 transition 探针:JointVel 0.75/0.75、GripVel 0.69/0.76、Action 0.80/0.86,均为最优或持平最优。

Q2 · 冻结 latent 上的 goal-conditioned planning(成功率 %,3 seeds 均值±std)

PSG-JEPA 在小 planner 训练预算小数据下优势最大:OGBench-Cube 全量数据、GC-IDM 仅训 5 epoch 时即达 95.0±0.7,而 LeWM 80.7±1.9;训到 100 epoch 时达 98.7±1.2。

设置LeWMDINOv2LeWMActionIDMPSG-JEPA
Cube · 全量 · 5ep80.7±1.976.5±1.682.8±1.295.0±0.7
Cube · 全量 · 100ep89.7±0.292.0±0.896.0±0.498.7±1.2
Cube · 25%数据 · 5ep67.0±0.760.8±5.163.2±1.876.7±2.2
Scene · 全量 · 100ep91.0±1.190.2±1.494.7±0.696.2±0.8
Scene · 25%数据 · 100ep83.0±1.180.0±1.187.3±1.689.7±0.9
planning success vs epochs and data
Figure 3. (a) 不同 GC-IDM 训练 epoch 下的成功率(全量演示数据);(b) 不同演示数据比例下的成功率(planner 训 100 epoch)。误差带为 3 个 planner seed 的 ±1 std。PSG-JEPA 在两条轴上均领先,且在 小 planner 预算 / 小数据 处 margin 最大。

Q3 · 策略学习:仿真 + 真机

LIBERO-Goal(10 任务,每 seed 50 rollout,3 seeds):PSG-JEPA 85.3±3.9%,高于 LeWM 77.7±0.5%、LeWMActionIDM 82.6±2.2%、DINOv2 80.1±5.3%。真机 Dual-arm Cobot(Mobile ALOHA 设计,每任务 50 trials)三项任务全部超越 LeWM,平均 79.3% vs 60.0%。

真机任务LeWMPSG-JEPA
Place-to-Bread62%84%
Place-to-Plate58%74%
Pour-Water60%80%
Average60.0%79.3%
real robot platform and per-task success
Figure 4. (a) 双臂 Cobot 遥操作平台(Mobile ALOHA design);(b) PSG-JEPA 与 LeWM 在 Place-to-Bread、Place-to-Plate、Pour-Water 三任务上的逐任务成功率——三项全面提升。

Ablations(Table 5,Cube 规划 SR@5ep 与 LIBERO-Goal)

逐一移除组件均导致下降,说明"每个 grounding 组件都有贡献":去掉 transition head 时规划仅 81.3±2.4%、去掉 state head 时探针 r 掉回 0.69;把 multi-horizon 换成仅相邻对(adjacent/endpoint)规划为 93.5/93.7%——均不及完整版的 95.0±0.7% 与策略 85.3±3.9%。

VariantState Probe rTransition Probe rPlanning SR%Policy %
LeWM0.680.6280.7±1.977.7±0.5
w/o transition0.930.7281.3±2.480.3±3.9
w/o state0.690.6793.3±1.280.0±2.3
w/o multi-horizon (adj.)0.860.7493.5±1.981.5±3.1
w/o multi-horizon (end.)0.860.7593.7±2.081.2±2.7
PSG-JEPA (full)0.940.7595.0±0.785.3±3.9

04 Limitations

Note: 原文(所抓取正文)未设独立的 Limitations 章节,结论仅强调 "physical grounding improves both the identifiability of latent representations and their usefulness for embodied decision-making"。以下各点均为据方法设计推断(inferred),非作者明确陈述。
依赖 logged 本体状态作监督(inferred)

两条 grounding 目标都需要与观测对齐的 robot state / joint-angle 日志(st+i、qt+i)。对无本体状态记录、或仅有视频的数据集,训练期监督难以获得。

锚定对象偏 proprioceptive(inferred)

锚定目标聚焦机器人自身状态与关节角变化,未显式锚定被操作物体 / 场景的物理量;对以物体状态识别为瓶颈的任务,收益可能有限。

评测范围(inferred)

结论建立在 OGBench(Cube/Scene)、LIBERO-Goal 及一套双臂 Cobot 真机任务上;跨更多机型/更长时序/更复杂场景的泛化仍待验证。