将交错的多模态推理连接为一个统一的决策过程

发表
Zican HuZican Hu 提交
作者: Zican HuZican Hu, Xuyang Hu, Yiming Liu, Zuwei Long, Wei LiuWei Liu, Yunzhuo Hao, Jiawei Gu, Linjie Li, Yu Cheng, Zhenhong Sun, Weibo Gu, Xing Sun, Zhi Wang

摘要

AI 生成总结
BRAID 框架通过将文本-图像交互视为马尔可夫决策过程,并通过带有视觉-语言模型指导的强化学习实现联合优化,从而实现了统一的多模态推理。
统一多模态模型(UMM)已展现出有前景的交错文本-图像推理能力,但通过强化学习(RL)有效优化此类多轮生成仍然是一个开放的挑战。现有方法仅将RL应用于文本步骤,将图像生成降级为监督代理,阻止策略梯度通过异构模态的完整交错轨迹传播。这使得RL在UMM中的潜力在很大程度上尚未开发。在本文中,我们引入了BRAID(将交错多模态推理桥接为统一决策过程),一个简单的框架,它将多轮文本-图像-文本推理视为一个统一的马尔可夫决策过程(MDP),通过单一、有原则的RL目标实现文本和视觉生成的联合优化。BRAID计算共享的轨迹级优势,并将其连贯地传播到文本令牌和图像去噪路径中,每个路径都通过其模态原生的策略梯度机制进行优化。为了进一步解决长时程信用分配问题,BRAID采用了一个视觉-语言模型(VLM)判官,根据其推理效用对每个中间图像进行评分,提供密集的轮次级反馈,以在关键视觉分支处增强学习。在空间推理和视觉感知基准上的实验表明,BRAID始终优于各种基线,证实了带有视觉思维指导的统一MDP公式对于有效的多模态推理至关重要。
查看 arXiv 页面查看 PDF

评论

Zican HuZican Hu
论文作者
论文提交者

我们提出了BRAID,它将多轮文本-图像-文本推理转化为统一的马尔可夫决策过程,通过单一的、有原则的目标实现文本和视觉生成的联合RL优化。