感知还是偏见:多模态大语言模型能否超越对性格的第一印象?

发表
Tim KangTim Kang 提交
作者: Caixin Kang, Tianyu Yan, Sitong Gong, Mingfang Zhang, Liangyang Ouyang, Ruicong Liu, Bo Zheng, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang

摘要

AI 生成总结
研究人员引入了一项新任务和数据集,用于评估多模态语言模型中的人格推理能力,揭示了准确预测与可靠推理过程之间存在的显著差距。
多模态大语言模型(MLLM)正越来越多地应用于面向人类的角色中,在这些角色中,性格感知至关重要。然而,现有的基准测试仅通过大五人格(Big Five)数值评分预测来评估这一能力,这就留下了一个悬而未决的问题:模型究竟是通过行为理解真正感知到性格,还是仅仅通过肤浅的模式匹配进行预先评判。我们通过三项贡献填补了这一空白:(i) 一项新任务:我们将“具据性格推理”(Grounded Personality Reasoning, GPR)正式化,该任务要求 MLLM 通过“评分、推理、寻据”的链条,将每个大五人格评分锚定在可观察的证据中。(ii) 一个新数据集:我们发布了 MM-OCEAN(包含 1,104 个视频、5,320 个多选题),该数据集由多智能体流水线产出并经人工验证,包含带时间戳的行为观察、基于证据的特质分析,以及七类线索寻据(cue-grounding)多选题。(iii) 基准测试与分析:我们设计了一个三层评估(评分、推理、寻据)以及四个样本级故障模式指标:偏见率(PR)、虚构率(CR)、集成失败率(IR)和整体寻据率(HR),并对 27 个 MLLM(13 个闭源,14 个开源)进行了基准测试。分析揭示了显著的“偏见差距”(Prejudice Gap):在整个领域中,有 51% 的正确评分并没有立足于检索到的线索,而整体寻据率仅在 0-33.5% 之间。这些发现暴露了“获得正确分数”与“因正确原因进行推理”之间的脱节,为 MLLM 中具据社会认知(grounded social cognition)的研究指明了路线。
查看 arXiv 页面查看 PDF

评论

Tim KangTim Kang
论文提交者

👋 AI 社区的小伙伴们,你们好!我们是 Perception or Prejudice 的作者。

多模态大语言模型(MLLM)是否真的理解人类性格,还是它们只是“因错误原因得出了正确分数”?🤔

我们的论文介绍了 MM-OCEAN,这是一个旨在评估 具身/落地性格推理(Grounded Personality Reasoning, GPR) 的多粒度基准测试。与粗暴的回归评分不同,我们通过一个严格的三层链条来审计 MLLM:顺序评级(Ordinal Rating)、开放式推理(Open-Ended Reasoning)和结构化线索定位(Structured Cue Grounding)(通过 5,320 个经专家验证的多选题)。

📉 核心结论:我们对 27 个前沿模型的评估揭示了一个普遍存在的 偏见差距(Prejudice Gap)——超过一半(51%)的正确性格评级完全没有实际行为线索的支持。

📦 所有成果均已开源:
* 数据集: https://huggingface.co/datasets/anonymous-mm-ocean/MM-OCEAN
* 代码: https://github.com/kkkcx/MM-OCEAN

我们非常希望听到您的想法和反馈!欢迎查看我们的工作,让我们一起探讨具备社交智能的 Agent 的下游安全与对齐问题!🚀