Watching, Reasoning, and Searching:针对智能体视频推理的开放网络视频深度研究基准

发表
Yu_xmYu_xm 提交
作者: Chengwen LiuChengwen Liu, Yu_xmXiaomin Yu, Zhuoyue Chang, Zhe Huang, zhangshuoShuo Zhang, Heng Lian, Kunyi Wang, Rui Xu, Sen Hu, Jaden (Jianheng) HouJianheng Hou, Hao Peng, Chengwei Qin, Xiaobin Hu, Hong Peng, Ronghao Chen, Huacan WangHuacan Wang

摘要

AI 生成总结
VideoDR 基准测试通过在开放域设置下结合跨帧视觉提取、网络检索和多跳推理,实现了视频问答。
在现实世界的视频问答场景中,视频通常仅提供局部视觉线索,而可验证的答案则分布在开放网络中;因此,模型需要协同执行跨帧线索提取、迭代检索以及基于多步推理的验证。为了填补这一空白,我们构建了首个视频深度研究基准 VideoDR。VideoDR 聚焦于以视频为条件的开放域视频问答,要求进行跨帧视觉锚点提取、交互式网络检索以及基于视频与网络联合证据的多步推理;通过严格的人工标注和质量控制,我们获得了涵盖六个语义领域的的高质量视频深度研究样本。我们在工作流(Workflow)和智能体(Agentic)范式下评估了多个闭源和开源多模态大语言模型,结果显示 Agentic 并不总是优于 Workflow:其增益取决于模型在长检索链中维持初始视频锚点的能力。进一步分析表明,目标漂移和长程一致性是核心瓶颈。总之,VideoDR 为研究开放网络设置下的视频智能体提供了系统性基准,并揭示了新一代视频深度研究智能体面临的关键挑战。
查看 arXiv 页面查看 PDF

评论

Yu_xmYu_xm
论文作者
论文提交者

首个视频深度研究基准(benchmark)。

CristianoCCristianoC

优秀的论文!

Jianxiang TianJianxiang Tian

没有比这篇论文更好的了 👏

NoahNoah

我制作了一个播客来解释这些核心概念:
https://researchpod-share.vercel.app/episode/def8ab9d-82b2-44a3-847d-77135741a278

zerozero

这篇论文既有趣又具有实际意义,确实能够推动视频理解领域的进一步扩展。期待你们团队的下一项工作。