⏶58
NextFlow:统一序列建模激活多模态理解与生成
发表
由
Liao Qu 提交
作者: Huichao Zhang,
Liao Qu, Yiheng Liu, Hang Chen, Yangyang Song, Yongsheng Dong, Shikun Sun, Xian Li, Xu Wang,
Yi Jiang, Hu Ye, Bo Chen, Yiming Gao, Peng Liu, Akide Liu, Zhipeng Yang, Qili Deng, Linjie Xing, Jiyang Liu, Zhao Wang, Yang Zhou, Mingcong Liu, Yi Zhang, Qian He, Xiwei Hu, Zhongqi Qi, Jie Shao, Zhiye Fu, Shuai Wang, Fangmin Chen, Xuezhi Chai, Zhihua Wu, Yitong Wang, Zehuan Yuan, Daniel K. Du, Xinglong Wu
摘要
AI 生成总结
NextFlow 是一种统一的仅解码器(decoder-only)自回归 Transformer,用于处理文本-图像交织 Token,通过创新的下一 Token 和下一尺度预测策略实现快速的多模态生成。我们推出了 NextFlow,这是一个在 6 万亿个交错的文本-图像离散 token 上训练的统一的仅解码器(decoder-only)自回归 Transformer。通过在统一的自回归架构中使用统一的视觉表示,NextFlow 原生地激活了多模态理解和生成能力,解锁了图像编辑、交错内容和视频生成的能力。考虑到模态的独特性质——文本是严格序列化的,而图像具有固有的层次性——我们保留了文本的下一个 token 预测,但对视觉生成采用了下一个尺度(next-scale)预测。这打破了传统的逐行扫描(raster-scan)方法,使得在仅 5 秒内生成 1024x1024 图像成为可能,比同类 AR 模型快了几个数量级。我们通过稳健的训练方案解决了多尺度生成的不稳定性。此外,我们引入了用于强化学习的前缀微调策略。实验证明,NextFlow 在统一模型中达到了最先进的性能,并在视觉质量上可与专门的扩散模型基准相媲美。
评论
论文作者
论文提交者
