TUNA:驯服统一视觉表示,实现原生统一多模态模型

发表
taesiritaesiri 提交
作者: Zhiheng Liu, Weiming RenWeiming Ren, Haozhe Liu, Zijian ZhouZijian Zhou, Shoufa ChenShoufa Chen, Haonan Qiu, Xiaoke Huang, Zhaochong An, Fanny Yang, Aditya Patel, Viktar Atliha, Tony Ng, Xiao Han, Chuyan Zhu, Chenyang Zhang, Ding Liu, Juan-Manuel Perez-Rua, Sen He, Jürgen Schmidhuber, Wenhu Chen, Ping Luo, Wei Liu, Tao Xiang, Jonas Schult, Yuren CongYuren Cong

摘要

AI 生成总结
TUNA是一种统一的多模态模型,使用级联VAE和表示编码器进行端到端多模态理解和生成,其性能优于解耦模型,并在各种基准测试中取得了最先进的结果。
统一多模态模型(UMMs)旨在在单一框架内联合执行多模态理解和生成。我们提出了TUNA,一个原生UMM,通过将VAE编码器与表示编码器级联,构建了一个统一的连续视觉表示。这种统一的表示空间允许图像和视频的端到端处理,用于理解和生成任务。与以前采用解耦表示的UMMs相比,TUNA的统一视觉空间避免了由独立编码器引入的表示格式不匹配问题,在理解和生成方面均优于解耦方案。此外,我们观察到更强的预训练表示编码器在所有多模态任务中始终能带来更好的性能,突出了表示编码器的重要性。最后,在这种统一设置下,对理解和生成数据进行联合训练,使得两个任务能够相互受益而非相互干扰。我们对多模态理解和生成基准的广泛实验表明,TUNA在图像和视频理解、图像和视频生成以及图像编辑方面均取得了最先进的成果,证明了其统一表示设计的有效性和可扩展性。
查看 arXiv 页面查看 PDF

评论

Yuren CongYuren Cong
论文作者

@taesiri 感谢分享!你也能附上这个视频吗?
https://cdn-uploads.huggingface.co/production/uploads/62f8040c47d782a6e286ea8e/u2HlyektETEZQjoeHW9_h.mp4

taesiritaesiri
论文提交者

哎呀!抱歉 @Yuren — 很遗憾,Hugging Face 不允许编辑缩略图视频。如果你愿意,我可以联系 Hugging Face 团队的人员来删除这篇论文,以便你重新提交。告诉我一声即可!

Yuren CongYuren Cong
论文作者

> 哎呀!抱歉 @Yuren — 遗憾的是,Hugging Face 不允许编辑缩略图视频。如果你愿意,我可以联系 Hugging Face 团队的某人,将论文删除,这样你就可以重新提交了。告诉我一声就行!

没关系 :) 没事