VIDEOP2R: 从感知到推理的视频理解

发表
Yifan JiangYifan Jiang 提交
作者: Yifan JiangYifan Jiang, Yueying Wang, Rui Zhao, Toufiq Parag, Zhimin Chen, Zhenyu Liao, Jayakrishnan Unnikrishnan

摘要

AI 生成总结
VideoP2R,一个过程感知强化微调框架,通过分别建模感知和推理,提升了视频推理和理解能力,并在多个基准测试中取得了最先进的结果。
强化微调 (RFT) 是一种由监督微调 (SFT) 和强化学习 (RL) 组成的两阶段框架,在提高大型语言模型 (LLM) 的推理能力方面已显示出可喜的成果。然而,将 RFT 扩展到大型视频语言模型 (LVLM) 仍然具有挑战性。我们提出了 VideoP2R,这是一种新颖的流程感知视频 RFT 框架,它通过将感知和推理建模为不同的过程来增强视频推理。在 SFT 阶段,我们开发了一个三步管道来生成 VideoP2R-CoT-162K,这是一个高质量、流程感知的感知和推理思维链 (CoT) 数据集。在 RL 阶段,我们引入了一种新颖的流程感知组相对策略优化 (PA-GRPO) 算法,该算法为感知和推理提供单独的奖励。大量实验表明,VideoP2R 在七个视频推理和理解基准中的六个上实现了最先进 (SotA) 的性能。消融研究进一步证实了我们流程感知建模和 PA-GRPO 的有效性,并表明模型的感知输出对于下游推理具有足够的信息。
查看 arXiv 页面查看 PDF

评论

Yifan JiangYifan Jiang
论文作者
论文提交者

Arxiv 链接 https://arxiv.org/abs/2511.11113v1
main Figure.001

Yifan JiangYifan Jiang
论文作者
论文提交者

强化微调(RFT)是一个由监督微调(SFT)和强化学习(RL)组成的两阶段框架,在提高大型语言模型(LLM)的推理能力方面已显示出可喜的成果。然而,将RFT扩展到大型视频语言模型(LVLM)仍然具有挑战性。我们提出了VideoP2R,一个新颖的流程感知视频RFT框架,通过将感知和推理建模为不同的过程来增强视频推理能力。在SFT阶段,我们开发了一个三步流水线来生成VideoP2R-CoT-162K,这是一个高质量的、流程感知的感知和推理思维链(CoT)数据集。在RL阶段,我们引入了一种新颖的流程感知分组相对策略优化(PA-GRPO)算法,为感知和推理提供单独的奖励。大量的实验表明,VideoP2R在七个视频推理和理解基准中的六个上取得了最先进(SotA)的性能。消融研究进一步证实了我们流程感知建模和PA-GRPO的有效性,并证明模型的感知输出对于下游推理具有足够的信息量。

Xu MaXu Ma

太棒了!感谢您富有洞察力的出色工作!