UniVid:利用预训练视频生成模型统一视觉任务

发表
Lan ChenLan Chen 提交
作者: Lan Chen, Yuchao Gu, Qi MaoQi Mao

摘要

AI 生成总结
一个预训练的视频扩散变换器 UniVid,经过微调后可以处理各种视觉任务,而无需进行特定任务的修改,展示了跨模态和跨源的泛化能力。
大型语言模型在广泛的语料库上进行训练,成功地在一个生成框架内统一了各种语言任务。受此启发,大型视觉模型 (LVM) 等最新研究通过将任务组织成连续的视觉句子,将这种范式扩展到视觉领域,其中视觉提示作为指导输出的上下文。然而,这种建模需要跨模态和来源的任务特定预训练,这成本高昂且限制了向看不见任务的可扩展性。鉴于预训练的视频生成模型固有地捕获了时间序列依赖性,我们探索了一种更统一、更具可扩展性的替代方案:预训练的视频生成模型能否适应各种图像和视频任务?为了回答这个问题,我们提出了 UniVid,一个微调视频扩散 Transformer 来处理各种视觉任务而无需任务特定修改的框架。任务表示为视觉句子,其中上下文序列定义了任务和预期的输出模态。我们从两个角度评估 UniVid 的泛化能力:(1)跨模态推理,其中上下文由图像和视频组成,超出了 LVM 的单模态设置;(2)来自自然到标注数据的跨源任务,无需多源预训练。尽管仅在自然视频数据上进行训练,UniVid 在这两种设置下都表现良好。值得注意的是,理解和生成任务可以通过简单地反转该范式中的视觉句子顺序来轻松切换。这些发现突显了预训练视频生成模型作为可扩展和统一的视觉建模基础的潜力。我们的代码将在 https://github.com/CUC-MIPG/UniVid 发布。
查看 arXiv 页面查看 PDF

评论

Lan ChenLan Chen
论文提交者

observation