⏶27
GoT-R1: 通过强化学习释放 MLLM 用于视觉生成的推理能力
发表
由
Duan Chengqi 提交
作者:
Chengqi Duan,
Rongyao Fang,
Yuqing Wang, Kun Wang, Linjiang Huang, Xingyu Zeng, Hongsheng Li,
Xihui Liu
摘要
AI 生成总结
GoT-R1通过使用强化学习改进语义空间推理来增强视觉生成,在复杂的组合任务中超越了现有模型。视觉生成模型在从文本提示创建逼真图像方面取得了显著进展,但对于指定多个对象、精确空间关系和属性的复杂提示仍然存在困难。有效处理此类提示需要对语义内容和空间布局进行显式推理。我们提出了 GoT-R1,这是一个应用强化学习来增强视觉生成中的语义-空间推理的框架。基于生成思维链(Generation Chain-of-Thought)方法,GoT-R1 通过精心设计的强化学习,使模型能够自主发现超越预定义模板的有效推理策略。为了实现这一点,我们提出了一个双阶段多维度奖励框架,该框架利用 MLLMs(多模态大语言模型)评估推理过程和最终输出,从而在整个生成流程中实现有效监督。该奖励系统以统一的方式评估语义对齐、空间准确性和视觉质量。实验结果表明,在 T2I-CompBench 基准上,尤其是在涉及精确空间关系和属性绑定的组合任务中,GoT-R1 显示出显著改进。GoT-R1 通过将复杂的推理能力成功转移到视觉生成领域,推进了图像生成领域的最新技术水平。为了促进未来的研究,我们将代码和预训练模型公开在 https://github.com/gogoduan/GoT-R1。
Github 参考 https://github.com/gogoduan/GoT-R1