Vision-DeepResearch:激励多模态大语言模型中的深度研究能力

发表
Yu ZengYu Zeng 提交
作者: Wenxuan HuangWenxuan Huang, Yu ZengYu Zeng, QiuchenWangQiuchen Wang, Zhen FangZhen Fang, Shaosheng Cao, Zheng Chu, Qingyu Yin, Shuang Chen, Zhenfei Yin, Lin ChenLin Chen, Zehui Chen, Yao Hu, Philip Torr, Feng Zhao, Wanli Ouyang

摘要

AI 生成总结
Vision-DeepResearch 引入了一种多模态深度研究范式,实现了多轮、多实体、多尺度的视觉和文本搜索,并通过冷启动监督和强化学习集成了深度研究能力。
多模态大语言模型 (MLLMs) 在广泛的视觉任务中取得了显著成功。然而,受其内部世界知识容量的限制,先前的工作建议通过为视觉和文本搜索引擎增加“先推理后工具调用”的方法,在需要大量事实信息的任务上获得实质性提升。然而,这些方法通常在简单的设定下定义多模态搜索,假设单个完整级或实体级图像查询以及少量的文本查询就足以检索到回答问题所需的关键证据,这在存在大量视觉噪声的现实场景中是不切实际的。此外,它们的推理深度和搜索广度往往有限,难以解决需要聚合来自不同视觉和文本源证据的复杂问题。基于此,我们提出了 Vision-DeepResearch,它提出了一种全新的多模态深度研究范式,即执行多轮、多实体、多尺度的视觉和文本搜索,以在重噪声下稳健地命中现实世界的搜索引擎。我们的 Vision-DeepResearch 支持数十个推理步骤和数百次引擎交互,同时通过冷启动监督和 RL 训练将深度研究能力内化到 MLLM 中,从而产生了一个强大的端到端多模态深度研究 MLLM。它的表现大幅超过了现有的多模态深度研究 MLLM,以及基于 GPT-5、Gemini-2.5-pro 和 Claude-4-Sonnet 等强大闭源基础模型构建的工作流。代码将发布在 https://github.com/Osilly/Vision-DeepResearch
查看 arXiv 页面查看 PDF

评论

Yu ZengYu Zeng
论文作者
论文提交者

我们推出了首个长时程多模态深度研究 MLLM,引入了多轮、多实体和多尺度的视觉/文本搜索,并扩展到数十个推理步骤和数百次搜索引擎交互。通过结合 VQA 合成、轨迹合成、冷启动监督和强化学习,我们将深度研究能力内化到 MLLM 中。凭借 8B 和 30B-A3B 模型,我们在六个主流的以事实为中心的 VQA 基准测试中实现了最先进的性能,超越了基于 GPT-5、Gemini-2.5-Pro 和 Claude-4-Sonnet 等强大专有模型构建的深度研究系统。