⏶91
WildWorld:面向生成式 ARPG、具有动作和显式状态的大规模动态世界建模数据集
发表
由
taesiri 提交
作者:
Zhen Li, Zian Meng, Shuwei Shi, Wenshuo Peng, Yuwei Wu, Bo Zheng,
Chuanhao Li,
Kaipeng Zhang
摘要
AI 生成总结
WildWorld 是一个用于动作条件世界建模的大规模数据集,它提供了来自写实游戏的显式状态标注,能够更好地理解潜状态动力学和长时一致性。动力系统理论和强化学习将世界演变视为由动作驱动的潜状态动力学,而视觉观测则提供关于状态的部分信息。近期的视频世界模型尝试从数据中学习这种以动作为条件的动力学。然而,现有数据集很少能满足这一需求:它们通常缺乏多样化且具有语义意义的动作空间,且动作直接与视觉观测绑定,而非通过底层状态介导。结果导致动作往往与像素级变化纠缠在一起,使模型难以学习结构化的世界动力学并在长时程内保持一致的演变。在本文中,我们提出了 WildWorld,这是一个具有显式状态标注的大规模动作条件世界建模数据集,自动采集自高保真 AAA 动作角色扮演游戏(《怪物猎人:荒野》)。WildWorld 包含超过 1.08 亿帧,涵盖 450 多种动作(包括移动、攻击和技能施放),并配有同步的每帧角色骨架、世界状态、相机姿态和深度图标注。我们进一步推导出 WildBench,通过动作遵循和状态对齐来评估模型。广泛的实验揭示了在建模语义丰富的动作和保持长时程状态一致性方面存在的持久挑战,强调了状态感知视频生成的必要性。项目主页:https://shandaai.github.io/wildworld-project/。
https://www.youtube.com/shorts/hMJbc9SsY6Q