视觉作为统一的多模态生成

发表
Xuanke ShiXuanke Shi 提交
作者: Xiaoyang HanXiaoyang Han, LI, JianhuaJianhua Li, Kewang Deng, zukai chenZukai Chen, Xuanke ShiXuanke Shi, Sihan Wang, HHHHHHHHHBoxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang CaiZhongang Cai, Haiwen DiaoHaiwen Diao, Ziwei Liu, yl-1993Lei Yang, Dahua Lin, Quan WangQuan Wang

摘要

AI 生成总结
一个统一的多模态模型利用自然语言和视觉提示将计算机视觉任务表述为生成问题,在各种视觉任务中取得了与专业系统相当的性能。
我们将计算机视觉公式化为统一的多模态生成,其中异构视觉任务在统一多模态模型的原生文本和图像生成空间中表达,而无需任务特定的架构。在此公式下,SenseNova-Vision使用自然语言指令和可选的视觉提示来指定任务、目标区域或视图以及解码约定,并生成文本作为符号输出、图像作为密集空间预测,或混合文本和图像输出用于组合任务。为了支持大规模训练,我们将多样化的计算机视觉标注转换为与这些生成空间兼容的指令-响应示例,从而形成了SenseNova-Vision语料库,这是一个涵盖文本、图像和混合目标的计算机视觉指令-响应语料库。SenseNova-Vision从一个现成的预训练统一多模态模型开始,主要在此语料库上进行训练,并使用辅助多模态数据作为能力保持混合,不需要任务特定的预测头或架构修改。由此产生的模型涵盖了广泛的视觉任务,包括检测、OCR、关键点估计、分割、深度估计、表面法线预测、点图和相机姿态估计,同时支持结合类别、颜色、区域和其他视觉线索的语言定义变体。实验表明,单个统一模型可以在结构化视觉理解、密集几何预测、分割和多视图视觉几何方面与领先的任务专用系统相媲美。这些结果表明,统一多模态生成是将计算机视觉能力集成到通用基础模型中的可扩展途径。该模型和语料库均公开可用。
查看 arXiv 页面查看 PDF

评论

Xuanke ShiXuanke Shi
论文作者
论文提交者

统一多模态生成中的视觉(Vision as Unified Multimodal Generation)提出了一个统一的视觉观:感知、理解、编辑和生成都可以被表述为多模态生成。

我们希望这项工作能为构建更通用的视觉基础模型做出贡献。欢迎反馈和讨论!