⏶16
UnityVideo:统一多模态多任务学习,增强世界感知视频生成
发表
由
Jiehui Huang 提交
作者: Jiehui Huang, Yuechen Zhang, Xu He, Yuan Gao, Zhi Cen, Bin Xia, Yan Zhou, Xin Tao, Pengfei Wan, Jiaya Jia
摘要
AI 生成总结
UnityVideo 作为一个统一框架,通过整合多种模态和范式来增强视频生成,从而提高质量并与现实世界约束对齐。最近的视频生成模型展示了令人印象深刻的合成能力,但仍受限于单模态条件,限制了其对世界的整体理解。这源于不足的跨模态交互和有限的模态多样性,无法全面表示世界知识。为了解决这些限制,我们引入了 UnityVideo,一个用于世界感知视频生成的统一框架,它在多个模态(分割掩码、人体骨骼、DensePose、光流和深度图)和训练范式下进行联合学习。我们的方法包含两个核心组件:(1) 用于统一异构训练范式的动态噪声化,以及 (2) 带有上下文学习器的模态切换器,通过模块化参数和上下文学习实现统一处理。我们贡献了一个包含 1.3M 样本的大规模统一数据集。通过联合优化,UnityVideo 加速了收敛,并显著增强了对未见数据的零样本泛化能力。我们证明 UnityVideo 实现了卓越的视频质量、一致性,并改善了与物理世界约束的对齐。代码和数据可在 https://github.com/dvlab-research/UnityVideo 找到。

项目网站 https://jackailab.github.io/Projects/UnityVideo/