⏶161
Thinking with Map:用于地理定位的增强并行地图增强型智能体
发表
由
xiaochonglinghu 提交
作者:
Yuxiang Ji, Yong Wang, Ziyu Ma, Yiming Hu,
Hailang Huang, Xuecai Hu, Guanhua Chen, Liaoni Wu, Xiangxiang Chu
摘要
AI 生成总结
大型视觉语言模型通过结合基于地图的推理和“地图中代理”循环优化,增强了图像地理定位能力,实现了优于现有模型的精度。图像地理定位任务旨在利用视觉线索预测在全球任何地方拍摄图像的具体位置。现有的大型视觉语言模型(LVLM)方法利用了世界知识、思维链推理和智能体能力,但忽略了人类常用的一种策略——使用地图。在这项工作中,我们首先为模型配备了“带地图思考”(Thinking with Map)的能力,并将其形式化为“地图中的智能体”循环。我们为此开发了一种两阶段优化方案,包括智能体强化学习(RL)以及随后的并行测试时缩放(TTS)。强化学习增强了模型的智能体能力以提高采样效率,而并行 TTS 使模型能够在做出最终预测前探索多条候选路径,这对于地理定位至关重要。为了在最新的野外图像上评估我们的方法,我们进一步提出了 MAPBench,这是一个完全由真实世界图像组成的综合性地理定位训练和评估基准。实验结果表明,我们的方法在大多数指标上优于现有的开源和闭源模型,特别是与具有谷歌搜索/地图接地模式的 Gemini-3-Pro 相比,Acc@500m 从 8.0% 提升到了 22.1%。
演示视频
https://cdn-uploads.huggingface.co/production/uploads/666a83e9b2d8397c1e545785/oHt9F1yp7_fXqhn0dZqdJ.mp4