LTX-2: 高效的联合音视频基础模型

发表
taesiritaesiri 提交
作者: Yoav HaCohenYoav HaCohen, Benny BrazowskiBenny Brazowski, Nisan ChiprutNisan Chiprut, Yaki BittermanYaki Bitterman, Andrew KvochkoAndrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna LifschitzDaphna Lifschitz, Dudu MosheDudu Moshe, Eitan Porat, Eitan RichardsonEitan Richardson, Guy ShiranGuy Shiran, Itay ChachyItay Chachy, Jonathan Chetboun, Michael FinkelsonMichael Finkelson, michael kupchickMichael Kupchick, Nir ZabariNir Zabari, Nitzan GuettaNitzan Guetta, Noa Kotler, Ofir BibiOfir Bibi, Ori GordonOri Gordon, Poriya Panet, Roi Benita, Shahar Armon, Victor Kulikov, Yaron Inger, Yonatan Shiftan, Zeev Melumian, Zeev Farbman

摘要

AI 生成总结
LTX-2 是一个开源的视听扩散模型,它使用具有跨模态注意力和无分类器引导的双流 Transformer 架构生成同步的视频和音频内容。
最近的文本到视频扩散模型能够生成引人注目的视频序列,但它们仍然是无声的——缺少音频提供的语义、情感和氛围线索。我们引入了 LTX-2,一个开源的基础模型,能够以统一的方式生成高质量、时间同步的视听内容。LTX-2 由一个非对称双流 Transformer 组成,包含一个 14B 参数的视频流和一个 5B 参数的音频流,通过双向音频-视频交叉注意力层与时间位置嵌入和用于共享时间步条件的跨模态 AdaLN 耦合。这种架构可以高效地训练和推理统一的视听模型,同时为视频生成分配比音频生成更多的容量。我们采用多语言文本编码器以实现更广泛的提示理解,并引入了模态感知无分类器引导(modality-CFG)机制,以改善视听对齐和可控性。除了生成语音,LTX-2 还产生丰富、连贯的音轨,跟随每个场景的人物、环境、风格和情感——包括自然的背景和拟音元素。在我们的评估中,该模型在开源系统中实现了最先进的视听质量和提示遵循度,同时以其计算成本和推理时间的一小部分提供了与专有模型相当的结果。所有模型权重和代码均已公开发布。
查看 arXiv 页面查看 PDF