⏶72
LongVie 2:多模态可控超长视频世界模型
发表
由
Jianxiong Gao 提交
作者:
Jianxiong Gao, Zhaoxi Chen, Xian Liu,
Junhao Zhuang, Chengming Xu, Jianfeng Feng, Yu Qiao, Yanwei Fu,
Chenyang Si, Ziwei Liu
摘要
AI 生成总结
LongVie 2 是一个端到端的自回归框架,通过三个渐进式训练阶段,提高了视频世界模型的可控性、视觉质量和时间一致性。在预训练视频生成系统上构建视频世界模型是迈向通用时空智能的重要而具有挑战性的一步。世界模型应具备三个基本属性:可控性、长期视觉质量和时间一致性。为此,我们采用渐进式方法——首先增强可控性,然后扩展到长期、高质量生成。我们提出了LongVie 2,一个端到端的自回归框架,分三个阶段进行训练:(1)多模态指导,它整合了密集和稀疏控制信号,提供隐式世界级监督并提高可控性;(2)输入帧上的降级感知训练,弥合了训练和长期推理之间的差距,以保持高视觉质量;(3)历史上下文指导,它对齐相邻剪辑之间的上下文信息,以确保时间一致性。我们进一步引入了LongVGenBench,一个包含100个高分辨率一分钟视频的综合基准,涵盖了各种真实世界和合成环境。广泛的实验表明,LongVie 2在长距离可控性、时间连贯性和视觉保真度方面达到了最先进的性能,并支持长达五分钟的连续视频生成,标志着在统一视频世界建模方面迈出了重要一步。
Huggingface:https://huggingface.co/Vchitect/LongVie2