Deform360: 一个用于可变形世界模型的大规模多视角视触觉数据集

发表
Hongyu LiHongyu Li 提交
作者: Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li

摘要

AI 生成总结
引入了一个名为 Deform360 的大规模视觉触觉数据集,用于研究可变形物体动力学,从而实现 2D 视频和 3D 粒子世界模型在机器人操作任务中的比较。
预测物体动力学(即世界建模)是机器人操作的一个基本挑战,而对可变形物体进行建模则是一个特别困难的情况,因为它们具有高维状态空间和复杂的材料特性。目前的世界模型通过两种截然不同的范式来解决这个问题:在 2D 像素空间或更明确的 3D 几何空间中学习动力学。由于缺乏多样化、大规模的真实世界数据,对它们相对优势和局限性的系统理解仍然难以捉摸。为了解决这个问题,我们提出了 Deform360,一个大规模的视觉触觉数据集,包含 198 个日常生活物体、1,980 个交互序列,以及来自 41 个环视摄像头和双手触觉夹持器的超过 215 小时的观测数据,以捕捉全局运动和接触引起的局部变形。利用新颖的无标记视觉触觉 3D 跟踪管道来提取密集几何和运动,我们系统地评估了当前最先进的世界模型,将 2D 视频模型与 3D 粒子模型进行比较。最后,我们通过在可变形物体上执行机器人规划任务,初步演示了我们数据集的真实世界适用性。我们的分析揭示了结构先验和可扩展性之间权衡的关键见解,为未来可泛化可变形物体中心世界建模的研究提供了坚实的基准。项目网站:https://deform360.lhy.xyz
查看 arXiv 页面查看 PDF

评论

Hongyu LiHongyu Li
论文提交者

198种日常生活中可变形的物体。1,980次交互。41个环视摄像头和双手触觉抓手——为在真实世界可变形动力学上对2D和3D世界模型进行基准测试奠定了基础。