⏶10
MV-Forcing:通过4D接地时空自强制实现长多视图视频生成
发表
由
Gal Fiebelman 提交
作者:
Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim
摘要
AI 生成总结
一个视频扩散框架通过 4D 几何桥接和时空蒸馏技术,结合时间上和视图上的自回归,生成了长且多视图一致的视频。视频扩散模型的最新进展使得通过时间自回归实现长单视图生成,或通过双向注意力实现短多视图合成。然而,生成动态场景的长时间、多视图一致视频仍然是一个未解决的问题。在这项工作中,我们提出了MV-Forcing,一个框架,它通过在顺序生成的视图之间引入4D几何桥,在一个单一扩散模型中组合时间自回归和视图自回归。我们的关键洞察是,自回归3D重建模型自然地在自回归生成的视图之间进行接口。给定一个完成的源视图,我们重建其3D结构并渲染下一个目标视点的几何先验,扩散模型将其精炼为高质量视频。为了将生成扩展到教师模型的固定时间窗口之外,我们引入了一种联合去噪机制,其中两个视图槽在训练期间都从噪声初始化,从而实现时间上无限制的生成。我们通过结合时空自强制的分布匹配蒸馏来蒸馏模型,弥合了时间自回归和视图序列自回归的训练-推理暴露偏差。在合成数据和真实世界数据上的大量实验表明,MV-Forcing使用单一的少量步骤学生模型,可以生成任意长度和视点数量的动态场景的几何一致多视图视频。
一个视频扩散框架通过结合时间自回归和视图自回归,并利用4D几何桥接和时空蒸馏技术,生成长时间、多视角一致的视频。