⏶44
Video-As-Prompt: 视频生成的统一语义控制
发表
由
Yuxuan BIAN 提交
作者:
Yuxuan Bian, Xin Chen, Zenan Li, Tiancheng Zhi, Shen Sang, Linjie Luo, Qiang Xu
摘要
AI 生成总结
Video-As-Prompt (VAP) 使用参考视频通过 Transformer 专家混合来引导冻结的视频扩散 Transformer,在语义控制视频生成方面取得了最先进的结果,具有强大的零样本泛化能力。视频生成中统一、可泛化的语义控制仍然是一个关键的开放挑战。现有方法要么通过从基于结构的控制中强制执行不适当的像素级先验而引入伪影,要么依赖于不可泛化的、特定于条件的微调或特定于任务的架构。我们引入了 Video-As-Prompt (VAP),这是一种将此问题重新定义为上下文生成的新范式。VAP 利用参考视频作为直接语义提示,通过即插即用的 Transformer 混合 (MoT) 专家引导冻结的视频扩散 Transformer (DiT)。该架构防止了灾难性遗忘,并通过时间偏置的位置嵌入进行引导,该嵌入消除了虚假映射先验,从而实现了稳健的上下文检索。为了支持这种方法并促进未来的研究,我们构建了 VAP-Data,这是最大的语义控制视频生成数据集,包含 100 多种语义条件下的 100K 对视频。作为单一统一模型,VAP 为开源方法树立了新的技术标杆,实现了 38.7% 的用户偏好率,可与领先的特定条件商业模型相媲美。VAP 强大的零样本泛化能力和对各种下游应用的支持标志着通用、可控视频生成方面取得了重大进展。
文本提示仍然无法为您提供真正想要的视频?
那就停止依赖文本——使用视频作为提示吧!
隆重推出“以视频为提示”(Video-As-Prompt)——首个用于语义可控视频生成的统一框架。
项目页面:https://bytedance.github.io/Video-As-Prompt/
代码:https://github.com/bytedance/Video-As-Prompt
数据集:https://huggingface.co/datasets/BianYx/VAP-Data
模型:https://huggingface.co/collections/ByteDance/video-as-prompt
演示视频:https://www.youtube.com/watch?v=S3zpLIMOU4c