GigaWorld-1: 一个构建机器人策略评估世界模型的路线图

发表
JeffWangJeffWang 提交
作者: GigaWorld Team, maangyuanAngyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, JeffWangXiaofeng Wang, Xiaoyu Tian, Yang WangYang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

摘要

AI 生成总结
通过一项新基准系统地研究了用于机器人策略评估的世界模型,揭示了长时程推演一致性和机器人专用可控性对于可靠的策略评估比短期视觉真实感更为重要。
评估具身机器人基础模型仍然是一个关键瓶颈;与可以通过数字基准高效评估的大型语言模型不同,机器人策略需要缓慢、昂贵的真实世界运行,受硬件和人工监督的限制,这推动了人们对世界模型作为替代策略评估器的兴趣,然而,使世界模型可靠地用于策略评估的关键特性仍然知之甚少。这项工作系统地研究了用于机器人策略评估的世界模型,并介绍了 WMBench,这是一个由真实机器人远程操作数据和匹配的策略运行构建的基准,涵盖了各种操作任务,以实现跨模型家族、动作编码、运行范围和评估指标的受控比较。使用 WMBench,我们分析了 7 个视频世界模型、4 种动作表示方案,以及超过 324,000 次模拟策略运行与真实机器人执行的配对,并通过来自 CVPR 2026 GigaBrain Challenge 的大规模社区提交、精选的合成轨迹以及超过 12,000 小时的训练视频进一步丰富了我们的分析。我们的实验提供了三个核心见解:评估器质量主要由长视野、动作忠实的运行一致性决定,而非短期视觉真实感;预训练的收益不仅来自数据规模,还来自平衡通用世界知识与机器人特定可控性;以及包括动作编码、内存设计和以评估器为中心的后期训练在内的架构选择强烈决定了与真实世界机器人行为的一致性。基于这些结果,我们导出了一个实用的设计路线图,并在 GigaWorld-1 中实现它,这是一个专门为策略评估优化的世界模型,我们全面发布了我们的代码、模型、数据集和工具包,以推进具身基础模型的可扩展评估研究。
查看 arXiv 页面查看 PDF

评论