Lance:通过多任务协同实现统一的多模态建模

发表
Mengqi HuangMengqi Huang 提交
作者: FengyiFengyi Fu, Mengqi Huang, ShaojinWuShaojin Wu, Yunsheng Jiang, Yufei Huo, Hao Li, Yinghang Song, Fei Ding, Jianzhu GuoJianzhu Guo, Qian He, Zheren Fu, Zhendong Mao, Yongdong Zhang

摘要

AI 生成总结
Lance 是一个统一的多模态模型,通过协同多任务训练和双流架构,集成了图像和视频的理解、生成与编辑能力。
我们推出了 Lance,这是一个轻量级的原生统一模型,支持图像和视频的多模态理解、生成和编辑。Lance 不依赖模型容量的扩展或以文本-图像为主的设计,而是通过协作多任务训练探索了一种实用的统一多模态建模范式。它基于两个核心原则:统一上下文建模和解耦能力路径。具体而言,Lance 从零开始训练,在共享的交错多模态序列上采用双流混合专家(MoE)架构,在实现联合上下文学习的同时,解耦了理解与生成的路径。我们进一步引入了模态感知的旋转位置编码,以减轻异构视觉标记(token)之间的干扰并增强跨任务对齐。在训练过程中,Lance 采用阶段式多任务训练范式,通过面向能力的优化目标和自适应数据调度,强化语义理解和视觉生成性能。实验结果表明,Lance 在图像和视频生成方面显著优于现有的开源统一模型,同时保持了强大的多模态理解能力。项目主页:https://lance-project.github.io
查看 arXiv 页面查看 PDF

评论

Mengqi HuangMengqi Huang
论文提交者

Lance 是一个原生统一的多模态模型,支持在单个框架内进行图像和视频的理解、生成与编辑(特别是视频的理解、生成和编辑)。
- 3B 规模的高效性:Lance 仅凭 3B 个激活参数,就在图像生成、图像编辑和视频生成基准测试中展现了强劲的性能。
- 从零开始训练:Lance 采用阶段式多任务方案构建,并完全在 128 块 A100 GPU 的预算内从零训练而成。

Adina YakefuAdina Yakefu

嗨 @CoreloneH - 恭喜发布🎉 有计划做一个 Demo 吗?

Jianzhu GuoJianzhu Guo
论文作者

谢谢!Demo 已在我们的路线图中。敬请期待!

Adina YakefuAdina Yakefu

太棒了,非常期待!
如果有什么我们可以帮忙的,请告诉我们。