LLaDA2.0-Uni:利用扩散大语言模型统一多模态理解与生成

发表
taesiritaesiri 提交
作者: Inclusion AI, Tiwei Bie, Haoxing chenHaoxing Chen, Tieyuan Chen, Zhenglin ChengZhenglin Cheng, Long Cui, Kai Gan, Zhicheng Huang, Zhenzhong Lan, Haoquan Li, Jianguo Li, Tao Lin, qinqiQi Qin, Hongjun Wang, Xiaomei Wang, Haoyuan WUHaoyuan Wu, Yi Xin, Junbo ZhaoJunbo Zhao

摘要

AI 生成总结
LLaDA2.0-Uni 是一款统一的离散扩散语言模型,它通过语义离散分词器、基于 MoE 的骨干网络和扩散解码器集成了多模态理解与生成,在实现高效推理和高保真图像生成的同时,达到了与专用视觉语言模型相当的性能。
我们提出了 LLaDA2.0-Uni,这是一个统一的离散扩散大语言模型(dLLM),在原生集成框架内支持多模态理解与生成。其架构结合了全语义离散分词器、基于混合专家模型(MoE)的 dLLM 主干网络以及扩散解码器。通过 SigLIP-VQ 将连续视觉输入离散化,该模型能够在主干网络中对文本和视觉输入进行块级掩码扩散,而解码器则将视觉标记重建为高保真图像。除了并行解码,通过主干网络中的前缀感知优化和解码器中的少步蒸馏,推理效率得到了进一步提升。在精心策划的大规模数据和量身定制的多阶段训练流水线的支持下,LLaDA2.0-Uni 在多模态理解方面足以媲美专用 VLM,同时在图像生成和编辑中表现出强劲性能。其对交错生成和推理的原生支持,为下一代统一基础模型建立了一种极具前景且可扩展的范式。代码和模型可在 https://github.com/inclusionAI/LLaDA2.0-Uni 获取。
查看 arXiv 页面查看 PDF

评论

Adrian Ciprian IancuAdrian Ciprian Iancu

喔吼!