SeedPolicy:通过自演化扩散策略实现机器人操控的视野扩展

发表
yuxuan zhouyuxuan zhou 提交
作者: Youqiang Gui, yuxuan zhouYuxuan Zhou, Shen Cheng, Xinyang Yuan, Haoqiang Fan, Peng Cheng, Shuaicheng Liu

摘要

AI 生成总结
自进化门控注意力机制能够在长时程机器人操纵的扩散策略中实现高效的时间建模,以更低的计算要求实现卓越性能。
模仿学习(IL)使机器人能够从专家演示中习得操作技能。扩散策略(DP)能建模多模态专家行为,但随着观察窗口(horizon)的增加会出现性能退化,限制了长程操作。我们提出了自演进门控注意力(SEGA),这是一种时间模块,通过门控注意力维持随时间演进的隐状态,实现高效的循环更新,将长程观察压缩为固定大小的表示,同时过滤无关的时间信息。将 SEGA 集成到 DP 中产生了自演进扩散策略(SeedPolicy),它解决了时间建模瓶颈,并能以适度的开销实现可扩展的窗口扩展。在包含 50 个操作任务的 RoboTwin 2.0 基准测试中,SeedPolicy 优于 DP 和其他 IL 基线。在 CNN 和 Transformer 骨干网络上平均而言,SeedPolicy 在洁净设置下比 DP 实现了 36.8% 的相对提升,在随机化的挑战性设置下实现了 169% 的相对提升。与拥有 12 亿参数的视觉-语言-动作模型(如 RDT)相比,SeedPolicy 以少一到两个数量级的参数实现了极具竞争力的性能,展现了强大的效率和可扩展性。这些结果确立了 SeedPolicy 作为长程机器人操作的最先进模仿学习方法。代码见:https://github.com/Youqiang-Gui/SeedPolicy
查看 arXiv 页面查看 PDF

评论

yuxuan zhouyuxuan zhou
论文作者
论文提交者

本文解决了机器人操作中扩散策略(Diffusion Policy)的一个关键局限:随着观测时界的增加,难以建模长程时间依赖性。