CiteVQA:为可信文档智能评估证据归因

发表
WangWang 提交
作者: Dongsheng Ma, Jiayu Li, Zhengren Wang, Yijie Wang, Jiahao Kong, Weijun Zeng, Jutao Xiao, Jie Yang, Wentao Zhang, Bin Wang, Conghui He

摘要

AI 生成总结
CiteVQA 引入了一个针对文档视觉语言模型的基准测试,评估答案准确性和证明材料的正确引用,揭示了当前模型中存在的显著归因幻觉。
多模态大语言模型(MLLM)在文档理解方面取得了显著进展,但当前的 Doc-VQA 评估仅对最终答案评分,而未核实支撑依据。这种仅看答案的方法掩盖了一个关键的失败模式:模型可能在正确定位到答案的同时,依据的却是错误的段落——在法律、金融和医学等高风险领域,这是一个重大风险,因为每一个结论都必须能回溯到特定的来源区域。为解决这一问题,我们引入了 CiteVQA 基准,它要求模型在给出每个答案的同时返回元素级的边界框引用,并对两者进行联合评估。CiteVQA 包含跨 7 个领域、两种语言、711 个 PDF 的 1,897 个问题,平均每个文档 40.6 页。为了确保保真度和可扩展性,标准引用由自动化流水线生成(通过掩码消融识别关键依据),随后通过专家评审进行验证。评估的核心是严格归因准确率(SAA),即只有当答案和引用区域均正确时才计分。通过对 20 个 MLLM 的审计,我们发现了一种普遍的“归因幻觉”:模型频繁给出正确答案却引用了错误区域。最强的系统(Gemini-3.1-Pro-Preview)的 SAA 仅为 76.0,而最强的开源 MLLM 仅达到 22.5。最终,在通往可靠文档智能的道路上,CiteVQA 揭示了一个仅看答案的评估所忽视的可靠性鸿沟,并提供了弥合这一鸿沟所需的测量工具。我们的代码仓库位于 https://github.com/opendatalab/CiteVQA
查看 arXiv 页面查看 PDF

评论

WangWang
论文提交者
CiteVQA:揭露文档智能中的“归因幻觉”

虽然多模态大语言模型(MLLMs)在文档理解方面取得了惊人的进步,但目前的评估几乎完全集中在最终答案的准确性上。这种“仅看答案”的方法掩盖了一种关键的失效模式:模型经常输出正确答案,但其依据却是完全错误的段落。在医疗、法律和金融等高风险领域,这种黑盒推理具有严重的风险,因为可信度需要验证。元素级引用 —— 即精准定位用于得出答案的具体段落、表格或图像的能力 —— 至关重要。通过强制模型提供精确的边界框引用,生成的每一项主张都变得可供人类用户直接进行视觉验证,成功弥补了文本生成与来源验证之间的鸿沟。

为了解决这一评估盲点,作者引入了 CiteVQA,这是一个旨在测试答案准确性和证据忠实度的基准。

  • 数据集: CiteVQA 包含 1,897 个复杂问题,涉及横跨七个领域的 711 份多页 PDF。与传统基准不同,它要求模型在给出每个答案的同时返回元素级边界框引用。
  • 严谨的新指标: 论文引入了 严格归因准确率 (SAA),这一评估指标仅在文本答案和引用的视觉区域均正确时才判定预测有效。
  • 关键发现: 对 20 个领先 MLLM 的详尽审计揭示了一种普遍现象,称之为“归因幻觉”。模型经常能答对问题,但无法引用正确的来源。最强的开源 MLLM 获得的 SAA 仅为 22.5,暴露了传统仅限答案指标完全忽略的巨大可靠性差距。