视频世界模型的潜空间记忆

发表
Weijie WangWeijie Wang 提交
作者: Weijie WangWeijie Wang, Haoyu Zhao, Yif YangYifan Yang, Feng ChenFeng Chen, Zeyu Zhang, Yefei He, Zicheng Duan, Donny ChenDonny Y. Chen, Yuqing Yang, Bohan Zhuang

摘要

AI 生成总结
视频世界模型的隐式空间记忆直接将 3D 场景信息存储在扩散隐空间中,消除了像素空间重建的开销,从而以更少的内存占用实现了更快的生成速度。
在生成的帧之间保持 3D 空间一致性的视频世界模型通常依赖于在 RGB 空间中构建的显式点云记忆。这种设计不仅计算成本高昂(需要重复渲染和 VAE 编码),而且本质上是有损的,因为在像素空间中的往返会丢弃已学习的隐式表征的丰富特征。在本文中,我们引入了用于视频世界模型的隐空间空间记忆(latent spatial memory),这是一种直接在扩散隐空间中存储场景信息的持久 3D 缓存,从而避免了像素空间重构。在此基础上,我们提出了 Mirage,这是一个隐空间空间记忆框架,它通过深度引导的反向投影将隐式 token 提升到 3D 中来构建记忆,并通过直接的隐空间变形合成新视角来查询该记忆。这种统一的公式既消除了像素空间重构的信息损失,也消除了重复编码和渲染的计算负担。实验表明,相较于显式 3D 基线,隐空间空间记忆实现了高达 10.57 倍的端到端视频生成速度提升,以及 55 倍的内存占用减少。利用扩散模型的几何先验,Mirage 在 WorldScore 上达到了最先进的性能,并在 RealEstate10K 上获得了极强的重构质量。
查看 arXiv 页面查看 PDF

评论

Weijie WangWeijie Wang
论文作者
论文提交者

隐式空间记忆(Latent Spatial Memory)直接将持久的 3D 场景内容作为隐式 Token(latent tokens)存储在视频世界模型中。