⏶124
想象感知 Token 增强多模态语言模型中的空间推理能力
发表
由
Weikai Huang 提交
作者: Mahtab Bigverdi, Linjie Li,
Weikai Huang, Yiming Liu, Jaemin Cho, Jieyu Zhang, Tuhin Kundu, Chris Dangjoo Kim, Zelun Luo, Linda Shapiro, Ranjay Krishna
摘要
AI 生成总结
想象感知 Token(IPT)通过提供中间感知表征(将模型从其他视角感知到的内容外化),增强了视觉语言模型的空间推理能力,表现优于传统的基于文本的推理方法。视觉-语言模型(VLM)在许多任务中表现出色,但当关键信息无法直接观察到时,它们在空间推理方面仍面临困难。许多此类问题需要“想象性感知(imaginative perception)”:推断从未见过的视角会看到什么,追踪穿过遮挡空间的路径,或者将部分观测整合进一个连贯的空间表征中。我们引入了想象感知 Token(Imaginative Perception Tokens, IPT),这是一种中间感知表征,它们将在替代空间配置下 VLM 会感知到的内容外显化,同时保持与观察到的输入一致。
为了研究这种能力,我们制定了三个任务:视角采择(Perspective Taking, PET)、路径追踪(Path Tracing, PT)和多视角计数(Multiview Counting, MVC),并构建了包含约 2 万个示例的数据集,其中附带真实的想象、答案和评估基准。以统一的 VLM BAGEL 作为骨干, IPT 监督持续改进了空间推理,并且即使在推理时不生成图像,也往往优于文本思维链(chain of thought)训练。在 MVC 上,IPT 将准确率提高了 3.4%,并在 PT 上实现了与强闭源模型极具竞争力的性能。我们进一步发现,将 IPT 和仅标签(label-only)监督相结合会产生额外的收益,而文本思维链会显著降低性能,这表明当空间计算被迫通过语言进行时存在模态错配。总的来说,IPT 为推理未观察到的空间结构提供了一个原则性的监督信号,在生成可解释的中间表征的同时提高了泛化能力。




模型能像人类一样在空间中进行视觉思考吗?隆重推出:由华盛顿大学(UW)、OpenAI、微软(Microsoft)和 AI2 联合打造的“想象感知 Token”(Imaginative Perception Tokens)。
“想象感知”(Imaginative Perception)通过教多模态语言模型将有用的视觉视角想象为图像,从而提高了它们的空间推理能力。这些想象出来的图像能帮助模型超越原始视角进行推理,并更准确地回答空间问题。
📄 论文:Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models
arXiv: https://arxiv.org/abs/2606.03988
💻 代码
• 训练: https://github.com/weikaih04/Imaginative-Perception-Token
• 评估: https://github.com/weikaih04/Imaginative-Perception-Token-Eval
🤗 数据与基准测试
• 数据集 (MVC + PET + PT): https://huggingface.co/collections/weikaih/imaginative-perception-token-data
• 空间心理建模基准测试 (人工验证): https://huggingface.co/collections/weikaih/spatial-mental-modeling-benchmark