世界行动模型:综述

发表
qiuhong shenqiuhong shen 提交
作者: Qiuhong Shen, Shihua Zhang, Yue Liao, LIQIIIIIQi Li, Zhenxiong Tan, Shizun Wang, Shuicheng Yan, Xinchao Wang

摘要

AI 生成总结
世界行动模型(World Action Models)是用于决策的预测性行动系统,其设计在表征丰富性与计算约束之间取得了平衡。
世界动作模型(WAMs)是具身预测-动作模型,旨在为动作提供未来预测。近期的 WAMs 重新利用了大型视频生成模型,而另一条研究路径则依赖于语言或视觉-语言主干模型,而不含视频生成核心。这种快速扩张模糊了通用世界模型、视频生成模型、动作基础视频世界模型、视觉-语言-动作策略以及 WAMs 之间的界限。本综述为该领域提供了一个统一的解释。首先厘清了这些边界,然后通过两个互补的视角组织了现有的研究工作。第一个视角探讨了每种方法需要生成的内容,涵盖渲染未来、潜空间未来和无需视频生成的动作推理。第二个视角根据预测基质、主干架构、动作耦合和部署制度对每种方法进行了剖析。这种结构分析支持了对交互性、因果关系、持久性、物理合理性和泛化能力的统一讨论,并进一步探讨了数据、评估和开放挑战。在这些维度上,出现了一种一致的设计模式:WAMs 不仅仅是带有动作头的视频生成器,而是预测-动作方法,其设计选择权衡了表征丰富度与计算、内存、延迟和动作标签成本之间的关系。该领域正朝着生成更少未来细节、同时保留控制所需关键信息的方法发展。综述主页:https://world-action-models.github.io/
查看 arXiv 页面查看 PDF

评论

qiuhong shenqiuhong shen
论文提交者

世界动作模型(World Action Models,简称 WAM)是能够对未来做出预测并支持动作决策的具身预测-动作模型。近期的 WAM 重新利用了大型视频生成模型,而另一个平行的方向则依赖于语言或视觉-语言骨干,无需视频生成核心。这种快速的扩张模糊了广义世界模型、视频生成模型、基于动作关联的视频世界模型、视觉-语言-动作(VLA)策略以及 WAM 之间的界限。本综述为该领域提供了一个统一的解释。它首先澄清了这些边界,然后通过两个互补的视角对现有工作进行了梳理。第一个视角关注每种方法需要生成什么,包括渲染好的未来、隐空间未来以及无需视频生成的动作推理。第二个视角通过预测基底、骨干网络、动作耦合和部署方案来解构每种方法。这种剖析支持对可交互性、因果性、持久性、物理合理性和泛化性进行统一探讨,随后介绍了数据、评估和开放性挑战。在这些维度上,出现了一种一致的设计模式:WAM 不仅仅是带有动作 head 的视频生成器,而是预测-动作方法,其设计选择在表示的丰富性与计算量、内存、延迟和动作标签成本之间进行权衡。该领域正在朝着产生更少未来但保留控制所需关键信息的方法发展。综述主页见 https://world-action-models.github.io/。