⏶31
STARFlow-V:使用归一化流的端到端视频生成建模
发表
由
Jiatao Gu 提交
作者:
Jiatao Gu, Ying Shen, Tianrong Chen, Laurent Dinh, Yuyang Wang, Miguel Angel Bautista, David Berthelot, Josh Susskind, Shuangfei Zhai
摘要
AI 生成总结
STARFlow-V 是一款基于归一化流的视频生成器,支持端到端学习、鲁棒的因果预测以及高质量视频生成,且采样效率实用。归一化流(NFs)是用于连续数据的端到端基于似然的生成模型,最近在图像生成方面取得了令人鼓舞的进展,重新受到关注。然而,在视频生成领域,由于时空复杂性和计算成本显著更高,最先进的系统几乎完全依赖于基于扩散的模型。在这项工作中,我们通过提出 STARFlow-V 重新审视了这个设计空间,STARFlow-V 是一种基于归一化流的视频生成器,具有端到端学习、鲁棒的因果预测和原生似然估计等显著优势。STARFlow-V 基于最近提出的 STARFlow 构建,在时空潜在空间中运行,采用全局-局部架构,将因果依赖限制在全局潜在空间,同时保留丰富的局部帧内交互。这缓解了随时间推移的误差累积,这是标准自回归扩散模型生成的一个常见陷阱。此外,我们提出了流分数匹配,它为模型配备了一个轻量级的因果去噪器,以自回归方式提高视频生成的一致性。为了提高采样效率,STARFlow-V 采用了一种视频感知 Jacobi 迭代方案,将内部更新重新塑造为可并行化的迭代,而不会破坏因果关系。由于其可逆结构,同一个模型可以原生支持文本到视频、图像到视频以及视频到视频生成任务。从经验上看,STARFlow-V 实现了强大的视觉保真度和时间一致性,并且相对于基于扩散的基线具有实用的采样吞吐量。这些结果据我们所知首次证明了 NFs 能够进行高质量的自回归视频生成,将它们确立为构建世界模型的一个有前途的研究方向。代码和生成的样本可在 https://github.com/apple/ml-starflow 获取。
本文介绍了首个基于归一化流的视频模型,用于高质量自回归视频生成。