⏶94
RynnWorld-4D:用于机器人操作的4D具身世界模型
发表
由
taesiri 提交
作者: Haoyu Zhao, Xingyue Zhao,
Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li
摘要
AI 生成总结
一个多模态 4D 世界模型从单一 RGB-D 图像和语言指令生成同步的 RGB、深度和光流数据,通过统一的扩散过程和逆动力学策略学习实现高效的机器人操作。开放世界中的机器人操作不仅需要识别场景的外观,还需要预测其3D结构在交互下如何移动。我们认为,同步的RGB、深度和光流,即RGB-DF,提供了一种物理基础的表示,可以捕捉场景的底层4D动态。与2D像素视频相比,这种多模态协同作用将视觉外观与几何结构和时间运动对齐,创建了一个更接近机器人系统所需的低级末端执行器动作的表示空间,从而缩小了世界预测和策略学习之间的差距。基于这一洞察,我们引入了RynnWorld-4D,一个生成模型,它在一个统一的扩散过程中,从单个RGB-D图像和语言指令共同生成未来的RGB帧、深度图和光流。这个4D世界模型具有一个三分支架构,将跨模态注意力与逐帧3D RoPE集成,确保外观、几何和运动一致演变。为了大规模提供训练数据,我们整理了Rynn4DDataset 1.0,这是一个包含超过2.544亿帧的庞大数据集,涵盖以自我为中心的人机操作视频,并带有高质量的深度和光流伪标签。我们进一步提出了RynnWorld-4D-Policy,一个逆动力学头部,它在单次前向传递中消耗RynnWorld-4D的内部4D表示,绕过昂贵的多步去噪,以闭环方式输出机器人动作。实验表明,RynnWorld-4D生成了时间上和空间上连贯的4D预测,并且RynnWorld-4D-Policy在真实世界灵巧双手操作任务上取得了最先进的性能,特别擅长需要空间精度和时间协调的任务。