⏶7
以对象为中心的残差强化学习,用于零样本模拟到真实的VLA增强
发表
由
Kinam Kim 提交
作者: Kinam Kim, Namiko Saito, Heecheol Kim, Katsushi Ikeuchi, Jaegul Choo, Yasuyuki Matsushita
摘要
AI 生成总结
一个以物体为中心的残差强化学习框架,通过模拟训练的纠正策略提高了真实世界视觉-语言-动作模型的鲁棒性,尽管存在从模拟到真实的挑战,这些策略仍能实现零样本迁移。视觉-语言-动作 (VLA) 模型可以在各种操纵任务中泛化,但由于累积的执行错误,其基于模仿学习的策略在精确物理交互中仍然脆弱;纯粹在模拟中训练的强化学习策略能否零样本提高现实世界 VLA 的鲁棒性?残差强化学习 (Residual RL) 在冻结的 VLA 之上学习一个纠正策略,提供了一个自然框架,但现有方法面临一个根本的模拟到现实困境:特权状态方法需要有损蒸馏才能部署;基于图像的方法存在视觉领域差距;而现实世界强化学习成本高昂且不安全。我们提出了一个以物体为中心的残差强化学习框架,该框架利用物体姿态细化 VLA 动作,从而实现一个紧凑的观察空间,在模拟和现实之间一致地迁移。为了对齐这两个领域,我们还在模拟中重放相同的远程操作演示,以训练现实世界 VLA 的模拟对应物。残差强化学习策略仅在模拟中进行训练,并注入姿态噪声和 dropout,然后零样本迁移到真实机器人。在真实 Franka Research 3 (FR3) 机器人上的五个操纵任务中,我们的方法将零样本成功率从 42% 提高到 76%,并且改进后的 rollout 可以进一步重用于重新训练基础 VLA 以进行自我改进,而无需额外的远程操作。项目页面:https://www.microsoft.com/en-us/research/articles/object-centric-residual-rl/
TL;DR: 我们通过在模拟中完全使用RL训练一个小的残差校正策略,使冻结的视觉-语言-动作(VLA)策略在精确、接触丰富的任务中变得可靠。残差条件作用于物体姿态而非原始像素,因此它可以零样本迁移到真实机器人上,无需新的演示,也无需真实世界的RL。
亮点:
- 基础VLA保持冻结,我们只添加了一个学习到的校正
- 基于物体姿态,而非图像,因此没有视觉上的模拟到真实世界的鸿沟
- 在5项任务中,模拟从49%提升到87%,真实机器人从42%提升到76%
- 残差推出(rollouts)反向蒸馏回VLA,形成一个更强大的独立策略
🌐 项目页面:https://www.microsoft.com/en-us/research/articles/object-centric-residual-rl/
欢迎提问,欢迎反馈!