MuseBench:基准测试多模态大语言模型中的意图级别音视频艺术理解

发表
Jaehong YoonJaehong Yoon 提交
作者: Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon

摘要

AI 生成总结
引入了一个名为 Musebench 的综合基准,用于评估多模态大型语言模型在细致艺术理解方面的表现,揭示了当前模型与人类专家在创意领域专业知识表现之间存在的显著差距。
视听艺术涵盖多种创意学科,包括电影、视觉艺术、舞台表演和游戏设计,其中艺术意义源于视觉、听觉和叙事元素的精心组合(例如,通过幽闭恐惧的构图放大恐惧,或通过沉默和持续特写传达悲伤)。真正的艺术理解超越了识别所描绘的内容,而是推理为什么通过特定的创意选择来表达。尽管多模态大型语言模型(MLLM)取得了长足进展,但艺术理解的这一关键方面仍未得到充分探索,因为现有基准主要衡量感知识别,而忽略了对创意意图的推理。为了弥补这一空白,我们引入了Musebench,一个旨在评估MLLM细致艺术理解的综合基准。它包含4,016个问题,涵盖电影艺术、静态视觉艺术、舞台表演艺术和游戏艺术,这些问题从10K多个候选视频论文中提炼而来,这些论文将专业评论与视觉演示配对。为了大规模捕捉艺术分析的开放性,该基准结合了单选和可变选项多选问题。所有问题都通过一个四阶段迭代流程生成和完善,该流程结合了快捷过滤、对抗性干扰和专家验证。对28个最先进MLLM的全面零样本评估显示,即使是表现最好的模型也仅达到48.29%的准确率,远低于人类专家87.18%的性能,这暴露了当前模型在创意领域专业知识方面的显著差距。
查看 arXiv 页面查看 PDF

评论

Jaehong YoonJaehong Yoon
论文提交者

.