⏶28
带表示自编码器的多人交互式世界模型
发表
由
taesiri 提交
作者: Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar,
Amélie Royer, Manu Orsini, Alyx Liao, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez
摘要
AI 生成总结
一个基于大量游戏数据训练的大规模多人世界模型,在复杂的基于物理的环境中展示了稳定的长时程推演,同时保持了多个智能体动作之间的一致性。我们引入了第一个适用于高度动态环境(由复杂物理交互控制)的多人世界模型。单人世界模型将其他智能体视为环境的一部分,而我们的模型则以多个智能体的动作流为条件,学习将场景变化归因于正确的玩家,并在他们动作的任意组合下保持一致。我们在《火箭联盟》游戏中研究这个问题,玩家在该游戏中以快速、紧密耦合的动态进行竞争与合作。我们的 50 亿参数潜在扩散模型在用公开可用的机器人收集的 10,000 小时游戏数据上进行训练,能够在单个 Nvidia B200 GPU 上实时生成四人比赛,每秒生成 20 帧。尽管仅在短片段上进行训练,但其运行在远超训练范围的时间内保持稳定:分布质量在长达五分钟(我们测量的最长范围)内保持稳定,实际上我们观察到运行可持续数小时而没有崩溃的迹象。我们系统地研究了核心设计选择:视频编解码器、生成目标和多人条件方案。此外,我们描述了行为如何随模型和数据规模的变化而变化,包括出现的能力和持续存在的故障模式。我们进一步开发了有针对性的评估,以探究模型的物理理解而非仅仅视觉外观。为了支持多人世界模型的持续研究,我们发布了我们的数据集、完整的训练和推理代码库以及实时演示。