模仿意图,而非仅仅是轨迹

发表
SII-huangrenmingSII-huangrenming 提交
作者: SII-huangrenmingRenming Huang, Chendong Zeng, Wenjing Tang, Jintian Cai, Cewu Lu, Panpan Cai

摘要

AI 生成总结
一种端到端的模仿学习方法,通过多尺度频率空间 token 化将行为意图从执行细节中解耦,从而在机器人操纵任务中实现高效学习、泛化和单样本技能迁移。
虽然模仿学习(IL)通过生成建模和预训练在灵巧操作方面取得了显著成功,但视觉-语言-动作(VLA)模型等前沿方法在适应环境变化和技能迁移方面仍面临困难。我们认为这是因为模型只是在模仿原始轨迹,而不理解其背后的意图。为了解决这个问题,我们建议在端到端模仿学习中明确将行为意图与执行细节解耦:即“模仿意图,而非仅仅是轨迹”(MINT)。我们通过多尺度频域 Token 化来实现这一点,它强制对动作块表示进行频谱分解。我们学习具有多尺度从粗到细结构的动作 Token,并强制最粗糙的 Token 捕捉低频全局结构,而较细的 Token 编码高频细节。这产生了一个有利于规划和迁移的抽象意图(Intent)Token,以及能够精确适应环境动态的多尺度执行(Execution)Token。基于这种层次结构,我们的策略通过下一尺度自回归生成轨迹,执行从意图到执行的渐进式推理,从而提升学习效率和泛化能力。关键的是,这种解耦通过简单地将演示中的意图 Token 注入到自回归生成过程中,实现了技能的一次性迁移(one-shot transfer)。在多个操作基准和真实机器人上的实验展示了最先进的成功率、优越的推理效率、针对干扰的强健泛化能力以及有效的一次性迁移。
查看 arXiv 页面查看 PDF

评论

SII-huangrenmingSII-huangrenming
论文作者
论文提交者

大家好,欢迎关注我们的工作:模拟意图,而不仅仅是轨迹