⏶66
TUNA:驯服统一视觉表示,实现原生统一多模态模型
发表
由
taesiri 提交
作者: Zhiheng Liu,
Weiming Ren, Haozhe Liu,
Zijian Zhou,
Shoufa Chen, Haonan Qiu, Xiaoke Huang, Zhaochong An, Fanny Yang, Aditya Patel, Viktar Atliha, Tony Ng, Xiao Han, Chuyan Zhu, Chenyang Zhang, Ding Liu, Juan-Manuel Perez-Rua, Sen He, Jürgen Schmidhuber, Wenhu Chen, Ping Luo, Wei Liu, Tao Xiang, Jonas Schult,
Yuren Cong
摘要
AI 生成总结
TUNA是一种统一的多模态模型,使用级联VAE和表示编码器进行端到端多模态理解和生成,其性能优于解耦模型,并在各种基准测试中取得了最先进的结果。统一多模态模型(UMMs)旨在在单一框架内联合执行多模态理解和生成。我们提出了TUNA,一个原生UMM,通过将VAE编码器与表示编码器级联,构建了一个统一的连续视觉表示。这种统一的表示空间允许图像和视频的端到端处理,用于理解和生成任务。与以前采用解耦表示的UMMs相比,TUNA的统一视觉空间避免了由独立编码器引入的表示格式不匹配问题,在理解和生成方面均优于解耦方案。此外,我们观察到更强的预训练表示编码器在所有多模态任务中始终能带来更好的性能,突出了表示编码器的重要性。最后,在这种统一设置下,对理解和生成数据进行联合训练,使得两个任务能够相互受益而非相互干扰。我们对多模态理解和生成基准的广泛实验表明,TUNA在图像和视频理解、图像和视频生成以及图像编辑方面均取得了最先进的成果,证明了其统一表示设计的有效性和可扩展性。
@taesiri 感谢分享!你也能附上这个视频吗?
https://cdn-uploads.huggingface.co/production/uploads/62f8040c47d782a6e286ea8e/u2HlyektETEZQjoeHW9_h.mp4