论文海报合集

每篇一页图文海报,含 动机 / 方法 / 实验 / 局限性 四节,配论文真实插图,页眉页脚均链原文。

共 60 篇 · 每日新增

标签:imitation learning17diffusion policy16机器人操作9robot manipulation8Flow Matching8bimanual manipulation7robotic manipulation7contact-rich manipulation7VLA7learning from demonstration6Vision-Language-Action6world model4impedance control3failure detection3reinforcement learning3long-horizon manipulation3off-policy RL3geometric constraints3constraint learning3visual imitation learning3双臂操作2self-supervised2模仿学习22D keypoints2JEPA2semantic keypoints2DINOv22SAM2
已筛选标签:清除 ✕

🆕 最新提交 · Daily Snapshot 1

2026-08-12
Point Policy: Unifying Observations and Actions with Key Points for Robot Manipulation
Point Policy 仅用离线人类示范视频、无任何遥操作数据,通过把人手位姿翻译为机器人位姿并用语义关键点刻画物体状态,得到与形态无关的稀疏表征;在 8 个真实任务上相比此前最好方法取得 75% 的绝对成功率提升。
robot manipulationlearning from human videokey pointshand posepoint tracking
arXiv:2502.20391

机器人 · Robotics 59

2026-08-12
Point Policy: Unifying Observations and Actions with Key Points for Robot Manipulation
Point Policy 仅用离线人类示范视频、无任何遥操作数据,通过把人手位姿翻译为机器人位姿并用语义关键点刻画物体状态,得到与形态无关的稀疏表征;在 8 个真实任务上相比此前最好方法取得 75% 的绝对成功率提升。
robot manipulationlearning from human videokey pointshand posepoint tracking
arXiv:2502.20391
2026-08-12
Multi-Quadruped Cooperative Object Transport: Learning Decentralized Pinch-Lift-Move
N 台带臂四足机器人在无通信、无中心化、无机械耦合下仅凭接触力协作搬运不可抓取物体;用 constellation reward 让机器人表现得“仿佛与物体刚性相连”,仅以 N=2 训练即可零样本泛化到 2–10 台与多种几何/质量的负载。
multi-robot cooperationquadrupeddecentralized controlMAPPOconstellation reward
arXiv:2509.14342
2026-08-10
PSG-JEPA:仅靠前向预测够吗?为 JEPA 世界模型注入物理状态锚定
PSG-JEPA 在 JEPA 世界模型的 action-conditioned 前向预测之外,并联两条仅训练期生效的锚定目标——把单帧 latent 锚到本体状态、把 latent 对锚到多步关节角变化,让潜空间可辨识物理状态;推理架…
JEPA world model世界模型physical state groundinglatent identifiabilityproprioceptive state
arXiv:2608.06799
2026-08-10
INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models
INTACT 是一个端到端 JEPA,把带动作标注、无奖励的离线轨迹转成可部署的“意图→动作”接口:其分布式动作律的条件均值直接作为免搜索策略,训练一个 epoch 即可在四个官方 LeWM 任务上达到 85.78%–100% 的零搜索…
world modelJEPAsearch-free controlintent-to-actiongoal-conditioned policy
arXiv:2607.26056
2026-08-10
Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination
Efficient-WAM 提出“action-centric future imagination”原则:未来预测只需保留 task-relevant 的几何、运动与接触线索而非 photorealistic 画面。它从 WAN-2.…
World-Action ModelVLArobot manipulationfuture imaginationMixture-of-Transformers
arXiv:2606.10040
2026-08-06
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
针对 VLA-RL 中 critic 只吃单帧、与部分可观测本质错配的问题,WCM 用轻量 LeJEPA 世界模型改造 critic:联合预测未来 latent state 与估计 value,让表征显式刻画时序动态。兼容 Pi0/Pi…
Vision-Language-Actionreinforcement learningworld modelcritic modelLeJEPA
arXiv:2607.29613
2026-07-28
用语义强化学习适配通用机器人策略 (SARL)
SARL 把 VLA 的语言 prompt 当作 RL 的动作空间,用语义 Q 函数在线学习最优指令序列,把预训练技能重新组合以解决 zero-shot prompting 无法完成的长程任务;真实机器人上 60–100 个 episo…
VLAsemantic action spacereinforcement learningprompt steeringlong-horizon manipulation
arXiv:2606.31958
2026-07-28
SAGE:用自监督能量门控改进扩散规划器
SAGE 在推理期用 JEPA latent 一致性能量为扩散规划器的候选轨迹前缀打 feasibility 分,与 value 融合重排序来抑制动力学不可行的计划;无需环境 rollout 与重训,在 D4RL 上把整体平均分从 95…
diffusion planneroffline RLJEPAself-supervisedlatent consistency energy
arXiv:2603.02650
2026-07-28
Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents
Foresight 用 action-conditioned world model(V-JEPA 2-AC 骨干)的隐变量在线监控长时程操作轨迹,仅用任务级成功/失败标签训练一个 causal sequence model 输出逐时刻…
failure detectionlong-horizon manipulationaction-conditioned world modelV-JEPA 2-ACfunctional conformal prediction
arXiv:2606.23085
2026-07-26
SAFE: Multitask Failure Detection for Vision-Language-Action Models
SAFE 发现 VLA 内部特征在失败时会落入同一 “failure zone”,据此从最后一层特征学习出单一标量失败分数,训练于已见任务并泛化到未见任务,再用 functional conformal prediction 平衡检测精…
Vision-Language-ActionVLAfailure detection失败检测conformal prediction
arXiv:2506.09937
2026-07-26
Q-VGM: Q-Guided Value-Gradient Matching for Flow-Matching VLA Policies
Q-VGM 把 critic 的动作梯度 ∇AQ 经 look-forward 估计与 keep-best 梯度上升转成残差速度目标,直接监督 flow-matching VLA 的速度场;无需动作似然、不反传去噪链、完全离线、推理不用…
VLAflow matchingoff-policy RLvalue-gradient matchingIQL critic
arXiv:2606.08015
2026-07-26
PPGuide: Steering Diffusion Policies with Performance Predictive Guidance
PPGuide 用 attention-based multiple instance learning 自监督地标注 rollout 中与成败相关的 observation-action 片段,训练轻量 performance pre…
diffusion policyclassifier guidancemultiple instance learningattentionself-supervised
arXiv:2603.10980
2026-07-26
Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring
Hide-and-Seek 把 VLA 失败检测建成“粗监督”问题:仅用轨迹级成功/失败标签,通过跨轨迹与轨迹内两种对比损失定位最具失败指示性的动作,无需任何逐步标注,并用 conformal prediction 做运行时报警,在 L…
VLA runtime monitoringfailure detectioncoarsely supervised learningcontrastive learningconformal prediction
arXiv:2605.30834
2026-07-26
From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning
DICE-RL 把 RL 当作作用在预训练生成式 BC 策略上的“分布收缩”算子:冻结 diffusion/flow 的 behavior prior、只学一个轻量 residual,配合 filtered BC 选择性正则与 best…
RL finetuningdiffusion policyflow matchingresidual policybehavior cloning
arXiv:2603.10263
2026-07-26
Accelerating Residual Reinforcement Learning with Uncertainty Estimation
用冻结 base policy 的不确定性把探索聚焦到它不自信的区域,并让 off-policy critic 观测 base action,从而在稀疏奖励下加速对 Gaussian / Diffusion 等随机 base polic…
Residual RLuncertainty estimationstochastic base policydiffusion policySoft Actor-Critic
arXiv:2506.17564
2026-07-23
逆约束强化学习综述:定义、进展与挑战 · A Comprehensive Survey on Inverse Constrained Reinforcement Learning
ICRL 综述:仅凭专家示范反推其隐式遵守的约束。统一「策略更新↔约束更新」交替框架,沿确定性→随机→有限示范→奖励与约束联合→多智能体逐步推广,并梳理基准、应用与开放问题。
Inverse Constrained RLICRL约束推断constraint inferencesafe RL
arXiv:2409.07569
2026-07-23
免重训的跨夹爪抓放:Learning-optimization Diffusion Policy
把「学习」与「优化」解耦的扩散策略:策略仍用 base gripper 的示范离线训练,仅在推理阶段通过 constrained denoising(gripper mapping + 安全约束的 QP 轨迹投影)适配新夹爪的 TCP …
diffusion policycross-gripper generalizationzero-shotconstrained denoisingsafety projection
arXiv:2502.15613
2026-07-23
从局部最优演示中学习约束(成本函数不确定下)
用演示满足的 KKT 最优性条件构造 MILP,从仅局部最优、且成本函数不确定的演示中反解参数化安全约束,并给出所恢复安全/不安全集的保守性保证;在 7-DOF 机械臂与 23 维四旋翼上优于基于采样的既有方法。
constraint learninglearning from demonstrationKKT conditionsinverse optimal controlmixed integer programming
arXiv:2001.09336
2026-07-23
When a Robot is More Capable than a Human: Learning from Constrained Demonstrators
受限接口(如 mode-switching joystick)采集的专家演示往往次优;LfCD-GRIP 从演示推断只依赖状态的 goal-proximity 奖励,用 MC-Dropout 置信度筛 anchor 并以时序插值为未知状…
learning from demonstrationinverse reinforcement learninggoal-proximity reward受限专家 constrained demonstratortemporal interpolation
arXiv:2510.09096
2026-07-23
VLMimic: Vision Language Models are Visual Imitation Learner for Fine-grained Actions
VLMimic 让 VLM 不再只当高层 planner,而是仅用 5 段人类视频直接学出细粒度动作层级的 skill:先 ground 出 object-centric 运动,用 semantic + geometric 两级分层约束…
visual imitation learningVision Language Modelhuman videoobject-centric interactionhierarchical constraints
arXiv:2410.20927
2026-07-23
Uncertainty-Aware Constraint Learning for Adaptive Safe Motion Planning from Demonstrations
从演示中学习「不确定约束」:用 robust optimization 恢复所有与演示一致约束的集合 F_θ 并转成约束信念,再据此做机会约束规划,并在执行中用传感数据更新信念、闭环重规划,在 7-DOF 机械臂与 12D 四旋翼上以概…
learning from demonstrationconstraint learningplanning under uncertaintychance-constrained planningrobust optimization
arXiv:2011.04141
2026-07-23
TacDiffusion: Force-domain Diffusion Policy for Precise Tactile Manipulation
TacDiffusion 让 diffusion model 在力域直接生成 6D wrench 作为阻抗控制的前馈力,仅用单个零件示教即可 zero-shot 迁移到多种高精度插装任务,平均成功率 95.7%;并用 dynamical…
diffusion policyforce-domain controltactile manipulation高精度装配 insertion6D wrench
arXiv:2409.11047
2026-07-23
TReF-6: Inferring Task-Relevant Frames from a Single Demonstration for One-Shot Skill Generalization
TReF-6 仅凭单条演示轨迹的几何结构,优化出一个 influence point 作为 6DoF 任务相关坐标系原点,再用 GPT-4o + Grounded-SAM 做语义锚定与新场景定位,据此重参数化 DMP,实现跨物体位姿与铰…
One-Shot Imitation LearningDynamic Movement PrimitivesTask-Relevant Frame6DoF reference frameinfluence point
arXiv:2509.00310
2026-07-23
TA-VLA: Elucidating the Design Space of Torque-Aware Vision-Language-Action Models
系统性研究把关节力矩 (joint torque) 信号注入 VLA 模型的设计空间,得出三条结论:力矩适配器放在 decoder 优于 encoder;历史力矩聚合成单个 token 最有效;把预测未来力矩作为辅助扩散目标能进一步提升…
VLAtorque-awareforce feedbackcontact-rich manipulationaction-torque diffusion
arXiv:2509.07962
2026-07-23
SafeBimanual: Diffusion-based Trajectory Optimization for Safe Bimanual Manipulation
给任意预训练双臂扩散策略加的即插即用测试期框架:把撕扯、碰撞等危险行为写成可微代价函数,在扩散去噪的最后若干步做梯度引导采样,并由 GPT-4o VLM 按任务阶段动态调度约束;RoboTwin 仿真成功率 +13.7%、不安全交互 −…
bimanual manipulationdiffusion policytest-time trajectory optimizationcost-guided samplingsafety constraints
arXiv:2508.18268
2026-07-23
SKIL: Semantic Keypoint Imitation Learning for Generalizable Data-Efficient Manipulation
SKIL 借助 vision foundation model 自动抽取语义关键点并构造 descriptor 作为稀疏观测,实现数据高效、可泛化的机器人模仿学习;真实任务测试平均成功率 72.8%(较基线相对提升 146%),挂毛巾等…
imitation learningsemantic keypointsvision foundation modeldata-efficient manipulationcross-embodiment learning
arXiv:2501.14400
2026-07-23
Reactive Diffusion Policy: Slow-Fast Visual-Tactile Policy Learning for Contact-Rich Manipulation
RDP 用慢-快双层策略把 latent diffusion 的复杂轨迹建模(慢策略,1–2 Hz)与高频触觉/力闭环控制(快策略 Asymmetric Tokenizer,>20 Hz)统一到一个框架,并配套用 AR 提供实时力…
visual-tactile imitation learningreactive policyslow-fast policylatent diffusion policyasymmetric tokenizer
arXiv:2503.02881
2026-07-23
ReKep:面向机器人操作的关系型关键点约束时空推理
ReKep 把操作任务表示为运行在语义关键点上的 Python 约束函数,通过分层优化实时求解末端位姿(SE(3))构成闭环策略,并由 DINOv2/SAM 与 GPT-4o 自动生成约束,在单臂与双臂平台上完成多阶段、野外、双臂与反应…
relational keypoint constraintsrobotic manipulationsemantic keypointsVLM · GPT-4oDINOv2
arXiv:2409.01652
2026-07-23
Patch Policy: Efficient Embodied Control via Dense Visual Representations
让 transformer 策略直接消费冻结 ViT 的 dense patch tokens:核心是 block-causal attention mask(帧内双向、帧间因果),在保留时间因果的同时利用大规模视觉预训练。轻量快速,性…
robot learningdense patch featuresVision Transformerblock-causal attentionbehavior cloning
arXiv:2607.18236
2026-07-23
PUCL: Positive-Unlabeled Constraint Learning for Inferring Nonlinear Continuous Constraints Functions from Expert Demonstrations
PUCL 把约束推断建模为 positive-unlabeled 学习:专家演示为可靠 feasible(positive),当前策略的高回报轨迹为 unlabeled;两步法先用 kNN 式距离度量挑出可靠 infeasible 数据…
constraint learningpositive-unlabeled learninglearning from demonstrationinverse constrained RLsafe policy
arXiv:2408.01622
2026-07-23
KALM: Keypoint Abstraction using Large Models for Object-Relative Imitation Learning
KALM 让大型预训练视觉-语言模型自动提议候选 keypoints,再用少量机器人示教验证其跨视角/跨实例一致性,蒸馏出「任务相关且一致」的稀疏关键点;策略在以关键点为中心的 object-relative 坐标系里用扩散模型预测动作…
imitation learningkeypoint abstractionVLMobject-relative framediffusion policy
arXiv:2410.23254
2026-07-23
K-VIL:基于关键点的视觉模仿学习
K-VIL 从少量人类演示视频中自动提取稀疏、以物体为中心、与本体无关的关键点几何约束(五类:p2p/p2l/p2P/p2c/p2S)任务表示,配合 local frames 与 VMP,并用新颖的 keypoint-based adm…
visual imitation learningkeypointgeometric constraintsprincipal manifold estimationobject-centric representation
arXiv:2209.03277
2026-07-23
Inferring geometric constraints in human demonstrations
从人类演示中推断几何约束:先用运动学拟合六类约束模型,再用力/力矩信息在歧义情形下消歧,无需已知工具接触几何即可同时判定约束类型与估计其参数。
learning by demonstrationgeometric constraintsconstraint inferenceforce/torquevirtual work
arXiv:1810.00140
2026-07-23
How Well do Diffusion Policies Learn Kinematic Constraint Manifolds?
以双臂 pick-and-place 为案例,量化 diffusion policy 对训练数据中运动学等式约束流形的学习程度:即便用完全满足约束的数据也只能学到粗略近似(200 条 clean 数据仍有 1.22cm/1.80° 误差…
diffusion policykinematic constraintbimanual manipulationimitation learningconstraint manifold
arXiv:2510.01404
2026-07-23
ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation
ForceVLA 把末端 6 轴力/力矩当作一等模态,用力感知 MoE 模块 FVLMoE 在 π0 的动作解码阶段自适应融合视觉-语言表征与实时力反馈,在 5 个真实接触密集任务上比 π0 基线平均成功率提升 23.2%(最高达 80…
Vision-Language-Actionforce-aware MoEcontact-rich manipulationflow matching力反馈 force-torque
arXiv:2505.22159
2026-07-23
FoAR: Force-Aware Reactive Policy for Contact-Rich Robotic Manipulation
FoAR 在 RISE 视觉模仿策略上并联高频 force/torque 分支,用 future contact predictor 输出的接触概率 φ 动态调节力信息使用,并以简单位置控制的 reactive control 完成擦写…
force-aware policycontact-rich manipulationforce/torque sensingRISEdiffusion policy
arXiv:2411.15753
2026-07-23
FILIC: Dual-Loop Force-Guided Imitation Learning with Impedance Torque Control for Contact-Rich Manipulation Tasks
FILIC 用双环结构把 Transformer 模仿学习策略(外环 25 Hz)与阻抗力矩控制(内环 2 kHz)结合,并用关节力矩加 MuJoCo 数字孪生做无传感器末端力估计,实现柔顺的力感知接触操作;估计末端力输入使仿真插孔成功…
imitation learningcontact-rich manipulationimpedance control阻抗力矩控制force estimation
arXiv:2509.17053
2026-07-23
FACTR: Force-Attending Curriculum Training for Contact-Rich Policy Learning
FACTR 用随训练逐渐减弱的视觉模糊课程,迫使 transformer 策略先学会利用外部关节力矩、不再过拟合视觉;配合低成本双边力反馈遥操作系统,将对未见物体的泛化成功率从无课程基线的 61.2% 提升到 87.5%(相对提升 43…
contact-rich manipulationforce feedbackcurriculum learningimitation learningbilateral teleoperation
arXiv:2502.17432
2026-07-23
Discrete Bimanual Manipulation for Wrench Balancing
双臂机器人共抓一块刚性托盘时,若质量分布不均,两臂承受的 wrench 会失衡并可能超出 payload。本文把平衡 wrench 建模成几何优化问题,用 Kalman filter 在线估计 COM,并把 Dexterous Mani…
bimanual manipulationdual-arm robotwrench balancingin-hand manipulationDexterous Manipulation Graph
原文
2026-07-23
DexForce: Extracting Force-informed Actions from Kinesthetic Demonstrations for Dexterous Manipulation
DexForce 在力触觉演示中直接测量指尖接触力,用弹簧刚度模型 x_f = x_o + k_f·f 把「观测动作」修正为能复现该力的「力感知动作」,再开环回放采集干净数据训练视觉扩散策略;六个接触密集任务平均成功率 76%,而不含力…
dexterous manipulationkinesthetic demonstrationforce-informed actionimitation learningdiffusion policy
arXiv:2501.10356
2026-07-23
C-LEARN:从示范中学习几何约束以完成共享自主下的多步操作
把多步操作任务表示为关键帧序列+每帧一组几何约束(TSR 体积约束与 CAD 姿态/轨迹约束),先从多次示范建够取抓取知识库,再仅凭一次示范学会完整任务并交给 Drake 优化式规划器求解;在共享自主框架下用双臂 Optimus 达到 …
learning from demonstrationgeometric constraintsshared autonomykeyframestask space regions (TSR)
原文
2026-07-23
Bi-KVIL:面向双臂操作的关键点视觉模仿学习
把关键点视觉模仿学习 K-VIL 扩展到双臂操作,从不到 10 段人类演示视频中联合抽取混合主从关系 HMSR、双臂协同策略与亚符号任务表示,可在杂乱新场景对同类物体做 category-level 泛化并由 ARMAR-6 复现。
visual imitation learningbimanual manipulationkeypointsmaster-slave relationshipobject-centric representation
arXiv:2403.03270
2026-07-23
Afford2Act: Language-Conditioned Affordance Distillation to Semantic Grounded 2D Keypoints for Robotic Manipulation
用语言条件的 affordance 先验自动蒸馏出一小组(K=19)语义 2D keypoints 作为操作策略输入,再以轻量 attention+gating 策略动态挑点;单视角 RGB、每任务 40 条示教,对未见物体达到 82%…
robotic manipulationaffordance2D keypointsimitation learningDINO
arXiv:2510.01433
2026-07-23
AdmitDiff Policy:面向通用接触密集操作的导纳视觉运动策略学习
把接触力作为与视觉、本体同等重要的一路观测:用低成本带触觉反馈的遥操作采集柔顺示范,用 diffusion 模型同时规划动作轨迹与期望接触力,再由 admittance controller 柔顺执行。五个接触密集任务上平均接触力降低 …
admittance controlcontact-rich manipulationvisuomotor policydiffusion policyconsistency model
arXiv:2409.14440
2026-07-23
Adaptive Compliance Policy: Learning Approximate Compliance for Diffusion Guided Control
ACP 让 diffusion policy 在预测位姿之外,额外在线预测随空间与时间变化的近似顺应性(刚度)——沿反馈力方向低刚度、其余方向高刚度,从人类演示学习“何时该软、沿哪个方向软”,在翻起物体与双臂擦拭花瓶等接触丰富任务上比 …
compliance controldiffusion policy接触丰富操作force-torque sensingstiffness matrix
arXiv:2410.09309
2026-07-23
ATK: Automatic Task-driven Keypoint Selection for Robust Policy Learning
ATK 用可微分掩码 + Gumbel-softmax 自动选出一组最小且任务相关的 2D 关键点作为策略状态表示,让视觉运动策略在背景、干扰物、光照变化下仍保持鲁棒的 sim-to-real 与真实世界模仿学习性能。
2D keypointstask-driven keypoint selectionsim-to-real transferimitation learningrobust visuomotor policy
arXiv:2506.13867
2026-07-23
A Projected Inverse Dynamics Approach for Dual-arm Cartesian Impedance Control
在 projected inverse dynamics 框架下把双臂协同操作的控制力矩正交分解:非约束分量实现物体处 6-DOF 笛卡尔阻抗,约束分量在摩擦锥内以最小力矩维持力闭合抓取;外部扰动由物体位移估计,全程无需接触点力/力矩传…
dual-arm manipulationCartesian impedance controlprojected inverse dynamics力闭合抓取 / internal forcefriction cone
arXiv:1707.00484
2026-07-23
A Bimanual Manipulation Taxonomy
面向机器人双臂操作的分类学:以协调、交互、手的角色与对称性四个关键维度组织人类双臂动作类别,并用基于接触图的表示 + 规则决策树在 KIT Bimanual Manipulation Dataset(120 条录制)上验证,总体准确率 …
bimanual manipulation双臂操作taxonomy动作分类contact graph
原文
2026-07-22
Test-Time Scaling for World Action Models via Zero-Shot Geometric Verification
Gated GeoBoN:一个训练无关的选择式 test-time scaling 框架——用冻结几何模型 VGGT 给 World Action Model 的候选 rollout 打「跨视角深度重投影一致性」的分来做 Best-of…
World Action Modeltest-time scalingBest-of-N机器人操作cross-view depth consistency
arXiv:2607.17454
2026-07-21
用场景图为机器人模仿学习扩展空间与时间上下文
把场景图作为显式、结构化的记忆:LLM 枚举任务相关物体,每步维护带外观与 2D/3D 位置的节点图并保留离开视野物体的信息,条件化扩散策略,从而在部分可观测下提升长时序移动操作与桌面操作的成功率。
imitation learningscene graphdiffusion policy长时序操作partial observability
arXiv:2606.01072
2026-07-21
SafeVLA:以约束学习实现视觉-语言-动作模型的安全对齐
SafeVLA 把 VLA 的安全性显式建模为约束马尔可夫决策过程(CMDP),通过主动引发五类安全关键风险并用拉格朗日松弛的 Safe RL 施加硬约束,在提升任务成功率(+3.85%)的同时把累计安全违规平均降低 83.58%,并对…
Vision-Language-ActionVLA 安全对齐Constrained MDPSafe RLLagrangian relaxation
arXiv:2503.03480
2026-07-21
Optimal Transport Q-Learning for Flow Policy Steering and Acceleration
OTQL 用 advantage-weighted conditional optimal transport flow matching 对次优 flow policy 做 RL 后训练:解 entropic OT 得到 noise-…
flow policyoptimal transportQ-learningRL post-trainingflow matching
arXiv:2607.06262
2026-07-21
Neuro-Symbolic Safety Guidance for Vision-Language-Action Models via Constrained Flow Matching
把符号化 CBF 约束求解交织进 flow matching VLA 的去噪循环:每一步都对整条预测轨迹检查碰撞并解最小范数修正,实现轨迹级、预测式的碰撞避免;在 SafeLIBERO 上达到 82.8% 碰撞避免率与 81.6% 任务…
Vision-Language-Actionflow matchingcontrol barrier functionneuro-symbolic碰撞避免
arXiv:2607.01378
2026-07-21
From Noise to Control: Parameterized Diffusion Policies (PDP)
PDP 用一个几何对齐的低维 behavior latent 取代随机噪声来操控扩散策略,让隐空间距离反映轨迹相似度;测试时冻结策略权重、只优化 latent 即可完成模式选择、平滑插值与约束适应,在 9 个操作域(仿真+真机)上约束偏…
diffusion policybehavior steeringimitation learningmultimodal demonstrationslatent space
arXiv:2606.00336
2026-07-19
DriftWorld: Fast World Modeling through Drifting
DriftWorld 用 drifting 生成模型把机器人世界模型做成单步前向生成:训练时学一条动作条件 drift,推理时一次前向即从当前观测与候选动作生成未来帧,达 30+ fps、平均比 diffusion 世界模型基线快 17…
world modelaction-conditioned video generationdrifting generative modelsone-step generationrobot manipulation
arXiv:2607.15065
2026-07-17
DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation
DenseReward 通过仿真自动合成物理真实的失败轨迹(碰撞、抓空、掉落、恢复等,无需人工标注),微调出一个从视觉观测与语言指令预测逐帧稠密奖励的模型;在 sim 与真机操作上奖励预测 MAE 均优于通用 VLM 与现有机器人奖励模…
dense reward modelfailure synthesisrobotic manipulationreinforcement learningvision-language reward
arXiv:2607.13033
2026-07-17
AMDP:用 Adjoint Matching 训练扩散策略的可扩展最大熵强化学习
把最大熵 RL 改写成随机最优控制问题,用 reciprocal adjoint matching 得到类似 score matching 的回归目标,免仿真、免链式反向传播地训练扩散策略;配合 error function squas…
diffusion policymaximum entropy RLadjoint matchingstochastic optimal controlSchrödinger bridge
arXiv:2606.22630
2026-07-16
Let the Dynamics Flow: Stable Flow Matching Dynamical Systems
SFMDS 把 flow matching 的强表达力与动力系统的形式化稳定性保证结合起来:用 flow matching 隐式建模机器人运动的向量场,同时把学到的速度约束在由正不变性 / Lyapunov 渐近稳定性推导出的可行集内。…
Flow Matching稳定动力系统Imitation LearningLyapunov stabilitypositive invariance
arXiv:2606.03834
2026-07-14
World–Value–Action Model: Implicit Planning for Vision–Language–Action Systems
WAV 把 VLA 的动作生成建模为隐空间中对高价值、动态可行轨迹的迭代推断,而非显式轨迹优化,在 LIBERO 与真实世界双臂操作任务上取得 SOTA 表现。
World-Value-Action (WAV)implicit planningvision-language-actionlatent trajectory planningworld model
arXiv:2604.14732

生成模型 · Generative Models 1

2026-07-23
CoDiG:面向机器人的约束感知扩散引导 · 自主赛车实时避障
CoDiG 把 barrier function 融入扩散模型去噪的 reverse SDE,在采样时用轻量 barrier 梯度把轨迹引向可行域,无需重训网络或外部投影;在微型自主赛车实机上配合 warm-start 实现 2.5 H…
diffusion modelconstraint-aware guidancebarrier function实时避障autonomous racing
arXiv:2505.13131