⏶68
殊途同归:激励视觉语言模型中的发散性思维
发表
由
Xinyu Tian 提交
作者:
Xinyu Tian,
Shu Zou, Zhaoyuan Yang, Mengqi He, Peter Tu, Jing Zhang
摘要
AI 生成总结
强化学习增强了视觉语言模型的推理能力,但会遭受多样性崩溃;提出了一种新的多组策略优化方法来鼓励多样化的思维模式。最近的研究表明,强化学习(RL),特别是群体相对策略优化(GRPO),可以本质上激发并增强视觉语言模型(VLM)的推理能力。然而,尽管前景广阔,驱动 RL 模型有效性的底层机制及其局限性仍未得到充分探索。在本文中,我们强调了 RL 模型与基座模型之间的一个根本行为区别:前者倾向于进行更深但更窄的推理,而基座模型尽管在单一路径上不够精炼,却表现出更宽、更多样化的思维模式。通过进一步分析训练动态,我们发现 GRPO 容易出现多样性崩溃,导致模型过早收敛到有限的推理策略子集,同时丢弃大部分潜在的替代方案,从而陷入局部最优且扩展性较差。为了解决这个问题,我们提出了多群体策略优化(MUPO),这是一种简单而有效的方法,旨在激励跨多个解决方案的发散性思维,并证明了其在现有基准测试中的有效性。项目页面:https://xytian1008.github.io/MUPO/
我们发现了 GRPO 训练的 VLM 中存在的“多样性崩溃”现象,并提出了 MUPO,这是一个简单的即插即用替代方案,旨在激励跨多种解决策略的发散性推理,实现了新的最先进结果 (CVPR2026)。
项目页面👉: https://xytian1008.github.io/MUPO/
Github 仓库👉: https://github.com/xytian1008/MUPO