SIEVE:结合VLA模型的模仿学习中的结构感知数据选择

发表
Changti WuChangti Wu 提交
作者: Changti WuChangti Wu, Bin Yu, Zhaolong Shen, Shijie Lian, Xiaopeng Lin, Cong Huang, Zhirui Zhang, Lei Zhang, Kai Chen

摘要

AI 生成总结
SIEVE 是一种结构感知的数据选择方法,用于视觉-语言-动作模仿学习,它识别可重用的视觉-运动原语和转换接口,以提高策略学习效率。
视觉-语言-动作(VLA)模型通常通过模仿学习在大型机器人演示数据集上进行训练,但更多数据不一定能产生更好的策略,因为存在冗余、噪声和覆盖不均等问题。现有数据选择方法通常在轨迹或状态-动作级别评估演示,从而错过了构成长时程行为的可重用结构。在本文中,我们提出了SIEVE,一种针对VLA模仿学习的结构感知数据选择方法。SIEVE将演示视为可重用原语和过渡接口的组合。它首先从分段轨迹中发现视觉-运动原语,然后通过在收益递减的情况下最大化重用感知结构暴露来为组合模式分配选择预算。最后,它在每个组合模式桶中选择中心轨迹,以保留核心、稳定且有利于模仿的演示。在多个数据集、基准和VLA模型上的实验表明,SIEVE始终优于具有竞争力的数据选择基线。值得注意的是,SIEVE在仅使用50%的演示和50%的训练步骤的情况下,可以超越全数据训练,这表明通过原语和过渡捕获的可重用结构是高效VLA模仿学习的重要信号。
查看 arXiv 页面查看 PDF

评论

Changti WuChangti Wu
论文作者
论文提交者

🚀 VLA模型需要更多数据,还是更好的数据?

我们引入了SIEVE,一种用于VLA模仿学习的结构感知数据选择方法。

SIEVE不再将演示视为孤立的轨迹,而是将其视为可重用视觉-运动基元转换接口的组合。

SIEVE的作用:

🔹 从机器人轨迹中发现可重用基元
🔹 将数据预算分配给结构信息丰富的组合模式
🔹 选择对行为克隆更容易学习的核心、稳定演示

📊 结果:

✅ 持续超越强大的数据选择基线
✅ 适用于多个数据集、基准和VLA模型
✅ 仅用50%数据 + 50%训练步数即可超越全数据训练

💡 结论:

对于高效的VLA训练,选择可重用的行为结构可能比简单地增加机器人数据量更重要。