FlowLong:通过流形约束 Tweedie 匹配实现推理期长视频生成

发表
Jangho ParkJangho Park 提交
作者: Jangho ParkJangho Park, Geon Yeong Park, Gihyun Kwon, Jong Chul Ye

摘要

AI 生成总结
一种用于长视频生成的全新推理时方法,该方法使用带有 Tweedie 匹配的重叠滑动窗口和随机早期采样,以提高时序一致性和视觉质量。
将视频扩散模型的生成时程扩展到长序列仍然是一个长期存在且重要的挑战。现有的免训练方法分为两类:双向模型的扩展(这些模型与特定架构紧密耦合,且在长时程上会出现质量退化),以及自回归模型(这些模型由于曝光偏差会累积漂移误差,且往往会产生重复的运动模式)。为了解决这些问题,我们提出了一种用于长视频生成的、新意但简单的推理期方法,该方法与架构无关且无需额外训练。我们的方法通过重叠滑动窗口生成长视频,其中来自相邻窗口的预测干净样本通过 Tweedie 匹配进行融合,以在重叠区域强制执行流形约束和时间一致性。随后,随机早期采样通过在高噪声阶段的每次 Tweedie 匹配校正后注入新鲜噪声来同步每个窗口的轨迹,然后过渡到确定性 ODE 采样以保留细粒度的视觉保真度。该方法应用于各种视频生成模型,能够生成比原生窗口长度长数倍的视频,同时在时间一致性和视觉质量上优于免训练和自回归基准模型,并能进一步扩展到音视频联合生成和文本到 3DGS,无需任何微调。
查看 arXiv 页面查看 PDF

评论

Jangho ParkJangho Park
论文作者
论文提交者

FlowLong 是一种免训练、与模型无关的推理期方法,可将预训练的基于流(flow-based)的视频扩散模型的生成视界扩展到其原生长度之外——该方法统一适用于文本到视频、音视频联合以及文本到 3D 场景的生成。
项目页面:https://flowlong-video.github.io/
论文:https://arxiv.org/abs/2605.20910