MentalThink:在思维SVG世界中塑造思想

发表
LinkanghengLinkangheng 提交
作者: Kangheng Lin, Jisheng Yin, Dingming Li, En Yu, Yana Wei, Han Zhou, Liang Zhao, Hongyu Zhou, Hongbo PengHongbo Peng, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Jingyu Wang

摘要

AI 生成总结
MentalThink 使多模态大型语言模型能够通过生成和解释 SVG 代码作为空间问题解决的可执行中间表示来进行视觉-符号推理。
我们引入了MentalThink,一种视觉符号推理范式,它为多模态大语言模型(MLLM)配备了一个可执行的“心理”可视化机制。MentalThink的核心是一个“用SVG思考”的管道,模型在此管道中学习生成、渲染和解释可伸缩矢量图形(SVG)代码,作为多轮推理的中间视觉表示。通过创建结构化的矢量草图,模型可以外化空间假设,通过确定性渲染对其进行检查,并在受限的几何空间内进行推理,有效地模拟了人类心理意象的过程。我们通过一个两阶段训练框架实例化了这一范式,该框架结合了用于SVG语法对齐的监督微调(SFT)和多轮强化学习(RL),以鼓励对中间视觉假设进行迭代检查、修订和完善。广泛的评估表明,MentalThink在空间理解和推理基准上取得了卓越性能(例如,VSIBench上达到55.1%,MindCube上达到76.0%),这表明可执行矢量图形为动态视角转换、视觉反思和组合场景构建提供了一个可验证的视觉工作空间。
查看 arXiv 页面查看 PDF

评论

LinkanghengLinkangheng
论文提交者

MentalThink为多模态LLM提出了一种“用SVG思考”的流程。通过生成、渲染和解释可伸缩矢量图形(SVG),我们为模型配备了一个可执行机制,用于视觉符号推理和空间问题解决。
我们希望这项工作能启发新的方法来增强MLLM可验证的视觉推理能力。欢迎反馈和讨论!