机器人 · Robotics

DenseReward

Dense Reward Learning via Failure Synthesis for Robotic Manipulation
Yu Fang, Wanxi Dong, Jiaqi Liu, Yue Yang, Mingxiao Huo, Yao Mu, Huaxiu Yao, Li Erran Li, Daniel Szafir, Mingyu Ding · 2026

机器人 RL 的瓶颈在于缺乏可靠、能提供稠密反馈的 vision-language 奖励模型。DenseReward 用仿真自动合成物理真实的失败轨迹(无需人工标注),训练出一个从视觉观测 + 语言指令预测逐帧(frame-level)奖励的模型,在 sim 与真机操作上均优于通用 VLM 与现有机器人奖励模型,并为下游 MPC 与 RL 提供有效引导。

27k episodes · 7.56M frame samples base: Qwen3-VL-4B-Instruct Franka Research 3 真机验证 📄 arXiv:2607.13033 PDF
dense reward modelfailure synthesisrobotic manipulationreinforcement learningvision-language rewardmodel predictive controlLIBERO稠密奖励强化学习

01 Motivation

Reinforcement learning 有望突破 imitation learning 的上限,但落地受制于缺乏可靠的 vision-language 奖励模型。论文点出两个关键难题:

"Two key challenges remain: acquiring diverse failure data at scale and obtaining fine-grained reward signals beyond sparse trajectory-level success labels."
overview
Figure 1 · 总览:(a) 含多样失败模式的 27k-episode 数据集;(b) DenseReward 从当前帧 + 历史帧预测逐时刻奖励;(c) 稠密奖励引导下游 RL 提升策略表现。
0.081整体 MAE(次优 RoboReward-8B 为 0.230)
0.229MPC 平均末端-物体最小距离(最低)
40→80%真机 Stack cups 成功率
30→70%真机 Put ball in basket 成功率

02 Method

DenseReward 同时解决两个难题:一条自动失败数据生成 pipeline 在仿真中合成物理真实的失败轨迹(无需人工标注),再据此微调出一个输出逐帧标量奖励的 vision-language 奖励模型。

failure synthesis pipeline
Figure 2 · 自动数据生成与失败合成:(a) 将操作分解为 Reach / Grasp / Lift / Move / Place 五个阶段并赋予稠密奖励;(b) 针对性扰动合成多样失败模式。GraspNet 从 RGB-D 预测至多 50 个抓取候选,CuRobo 做碰撞感知运动规划并执行,阶段边界由仿真状态自动检测。

失败合成 pipeline 与失败模式

操作被结构化为五个 canonical phase;通过对特定阶段注入针对性扰动,自动合成六类轨迹(阶段边界处还有 validity filtering 剔除物理无效样本,如 miss 试验中的意外抓取):

模式描述扰动方式
Success完整无扰执行,奖励单调上升
Collision与环境/物体碰撞,奖励呈"山形"关闭碰撞规避
Miss抓取失败,奖励先升后降偏移抓取目标位姿
Fall搬运中掉落,奖励呈"山形"Move 阶段随机旋转扰动
Smooth次优运动执行,奖励被惩罚关节注入 Gaussian 噪声
Recover碰撞后成功重规划,奖励先降后恢复先碰撞再重规划路径

稠密奖励模型

Qwen3-VL-4B-Instruct 为底座微调。输入 task instruction、当前观测与历史帧;输出每个时刻一个 [0,1] 区间、保留三位小数的标量奖励。区别于只在整条轨迹末端给单一标签的做法:

"Unlike current reward models that assign a single label p∈[0,1] at the end of an entire trajectory, we aim to learn reward signals at every timestep throughout execution."

训练:LoRA 微调,rank 16,10 epochs,8× H100,batch size 32。数据集共 27k episodes / 7,560,942 frame-level samples,混合 DROID(2,986)、Isaac Sim(12,481)、RoboSuite(9,287)、LIBERO(1,825)。

03 Experiments

评测覆盖稠密奖励预测精度(MAE)、下游 MPC、仿真 RL(π₀ + PPO on LIBERO)与真机 RL(DSRL on Franka)。

稠密奖励预测精度(MAE,越低越好)

ModelOverallDROIDIsaac SimRoboSuiteLIBERO
Qwen3-VL-4B-Instruct0.2890.5320.2850.1950.478
Molmo2-8B0.3350.4800.3070.3030.455
Robometer0.3660.5210.3280.3450.468
RoboReward-8B(次优)0.2300.4840.1850.1720.431
DenseReward (Ours)0.0810.2590.0810.0510.044

DenseReward 在所有数据源上均取得最佳(best across all sources),整体 MAE 0.081,显著优于通用 VLM 与现有机器人奖励模型。

qualitative reward prediction
Figure 3 · 在 success / failure 轨迹上,DenseReward 的逐帧奖励曲线与真实进度高度吻合,而 VLM 与现有奖励模型基线的曲线更平或误判。

下游 MPC(每步采样 28 个候选动作,选奖励最高者;末端-物体最小距离,越低越好)

ModelCanCupLemonAvg
RoboReward-4B0.1990.3070.2950.267
VLAC-8B0.3510.3600.3630.358
DenseReward (Ours)0.2190.1810.2880.229

DenseReward 平均距离最低(0.229)。注意在 Can 子任务上 RoboReward-4B(0.199)优于 DenseReward(0.219)——单项并非全胜,但整体最优。

强化学习引导

RL learning curves
Figure 5 · 在 LIBERO 上用 DenseReward + 稀疏仿真奖励(r_t = α·r_t^sim + β·r_t^model,α=1.0,β=C/T_max,chunk C=5)对 π₀ 做 PPO 微调的成功率曲线。

Ablations

04 Limitations

Note: 论文未设独立的 Limitations 章节;下列第 1 点为作者在 future work 中明确陈述(stated),其余为依据方法设计的合理推断(inferred)。
任务复杂度与时序长度(stated)

作者计划将工作扩展到更复杂的操作,如 tool use 与 long-horizon tasks,暗示当前主要在相对短程、单物体的抓放类任务上验证。原文:"We plan to extend this work to more complex manipulation, such as tool use and long-horizon tasks."

缺少人类偏好对齐(stated)

作者将"incorporating human preference feedback into the reward learning process"列为未来方向,以使稠密奖励模型"more general, scalable, and aligned with human expectations"——即当前奖励主要来自仿真合成信号,尚未纳入人类偏好。

依赖仿真合成的失败分布(inferred)

失败模式由 Isaac Sim / RoboSuite 中针对性扰动合成,其多样性与真机失败分布的一致性取决于仿真与规划器(GraspNet、CuRobo)的覆盖范围;sim-to-real gap 可能影响真机泛化。

底座与算力(inferred)

奖励模型基于 Qwen3-VL-4B-Instruct,训练用 8× H100;作为在线 RL / MPC 的逐帧打分器,其推理开销对高频控制回路的实时性可能构成约束。