⏶14
Flex-Forcing:迈向统一的自回归和双向视频扩散模型
发表
由
Julius Berner 提交
作者: Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang
摘要
AI 生成总结
Flex-Forcing 通过在时间和去噪步骤上采用灵活的分块机制,使视频扩散模型能够在双向和自回归生成模式下运行,从而提高视频质量和推理速度。大规模生成模型的最新进展极大地推动了视频生成,但现有方法仍受限于僵化的推理范式。双向扩散模型在全局连贯性和视觉保真度方面表现出色,但推理速度较慢;而自回归模型则提供了高效的流式生成,但代价是长距离一致性和暴露偏差。我们引入了Flex-Forcing,一个统一的训练和推理框架,它使视频扩散模型能够在双向和自回归生成模式下无缝运行。其核心思想是一种在时间轴和去噪步骤上共同定义的灵活分块机制。这种设计允许模型 (1) 根据不同的设备预算执行灵活分块,(2) 在块之间执行双向推理以进行全局结构规划,同时在每个块内自回归生成帧以实现高效细致的合成,以及 (3) 在没有严格因果约束的情况下执行任意顺序、任意时间步的自回归生成。在多个视频生成基准上的大量实验表明,Flex-Forcing在视频质量、长视频稳定性方面始终优于采用固定推理调度的强基线,同时提供了更快的推理速度。
评论
论文提交者

