⏶68
视频世界模型的潜空间记忆
发表
由
Weijie Wang 提交
作者:
Weijie Wang, Haoyu Zhao,
Yifan Yang,
Feng Chen, Zeyu Zhang, Yefei He, Zicheng Duan,
Donny Y. Chen, Yuqing Yang, Bohan Zhuang
摘要
AI 生成总结
视频世界模型的隐式空间记忆直接将 3D 场景信息存储在扩散隐空间中,消除了像素空间重建的开销,从而以更少的内存占用实现了更快的生成速度。在生成的帧之间保持 3D 空间一致性的视频世界模型通常依赖于在 RGB 空间中构建的显式点云记忆。这种设计不仅计算成本高昂(需要重复渲染和 VAE 编码),而且本质上是有损的,因为在像素空间中的往返会丢弃已学习的隐式表征的丰富特征。在本文中,我们引入了用于视频世界模型的隐空间空间记忆(latent spatial memory),这是一种直接在扩散隐空间中存储场景信息的持久 3D 缓存,从而避免了像素空间重构。在此基础上,我们提出了 Mirage,这是一个隐空间空间记忆框架,它通过深度引导的反向投影将隐式 token 提升到 3D 中来构建记忆,并通过直接的隐空间变形合成新视角来查询该记忆。这种统一的公式既消除了像素空间重构的信息损失,也消除了重复编码和渲染的计算负担。实验表明,相较于显式 3D 基线,隐空间空间记忆实现了高达 10.57 倍的端到端视频生成速度提升,以及 55 倍的内存占用减少。利用扩散模型的几何先验,Mirage 在 WorldScore 上达到了最先进的性能,并在 RealEstate10K 上获得了极强的重构质量。
隐式空间记忆(Latent Spatial Memory)直接将持久的 3D 场景内容作为隐式 Token(latent tokens)存储在视频世界模型中。