⏶17
Frame In-N-Out:无限制的可控图像到视频生成
发表
由
Boyang Wang 提交
作者:
Boyang Wang,
Xuweiyi Chen,
Matheus Gadelha,
Zezhou Cheng
摘要
AI 生成总结
一种高效的扩散 Transformer 架构利用“帧入帧出”技术解决了视频生成中的可控性、时间连贯性和细节合成问题。可控性、时间连贯性和细节合成仍然是视频生成中最关键的挑战。在本文中,我们重点关注一种常用但尚未被充分探索的电影技术,称为“入画”(Frame In)和“出画”(Frame Out)。具体来说,从图像到视频生成开始,用户可以控制图像中的对象自然地离开场景,或者提供新的身份参考进入场景,并由用户指定的运动轨迹引导。为了支持这项任务,我们引入了一个半自动策划的新数据集,一个针对此设置的综合评估协议,以及一个高效的身份保留运动可控视频扩散 Transformer 架构。我们的评估表明,我们提出的方法显著优于现有基线。
可控性、时间连贯性和细节合成仍然是视频生成中最关键的挑战。在本文中,我们专注于一种常用但探索不足的电影技术,称为“入画”和“出画”(Frame In and Frame Out)。具体来说,从图像到视频生成开始,用户可以控制图像中的物体自然离开场景,或者根据用户指定的运动轨迹提供新的身份参考进入场景。为了支持这项任务,我们半自动策划了一个新数据集,一个针对此设置的全面评估协议,以及一个高效的身份保持运动可控视频 Diffusion Transformer 架构。我们的评估表明,我们提出的方法显著优于现有基线。项目主页:https://uva-computer-vision-lab.github.github.io/Frame-In-N-Out/。