⏶24
所有视觉Token都同等重要吗?用于视觉语言检索的对象证据保留Token合并
发表
由
Junha Jung 提交
作者:
Suhyeong Park,
Junha Jung, Jungwoo Park, Jaewoo Kang
摘要
AI 生成总结
对象感知令牌合并框架 SaMer 在保留查询可选的视觉证据的同时,压缩了图像侧令牌,实现了显著的存储减少和改进的检索性能。多向量视觉-语言检索通过最大相似度后期交互保留了细粒度的视觉证据,但密集的图像侧令牌使得存储和评分成本高昂。现有令牌压缩方法降低了此成本,但它们可能会移除或合并未来查询令牌可能需要选择的对象和区域级证据。我们提出了SaMer,一个对象感知令牌合并框架,它将图像侧后投影器令牌压缩为K个代表性质心,同时保留原始的后期交互接口。SaMer仅在训练期间使用对象标注作为合并先验以阻止跨实例混合,在推理时不需要真实边界框或检测器,并且仅使用冻结的视觉和语言骨干自适应共享投影层。在K=64时,SaMer移除了超过93%的图像侧令牌,并将ColPali存储减少了16.09倍,同时提高了Flickr30K和MSCOCO上的R@1。这些增益的产生是因为对象感知合并保留了查询可选的对象证据,而剪枝或仅特征池化可能会移除或合并这些证据。SaMer还优于压缩基线,并显示出更强的短语级接地能力,这表明高效的多向量检索不仅取决于减少令牌数量,还在于保留未来查询令牌需要选择的证据。
多向量视觉-语言检索通过最大相似度后期交互保留了细粒度视觉证据,但密集的图像侧令牌使得存储和评分成本高昂。现有的令牌压缩方法降低了这一成本,但它们可能会移除或折叠未来查询令牌可能需要选择的对象和区域级证据。我们提出了SaMer,一个对象感知的令牌合并框架,它将图像侧投影后令牌压缩成K个代表性质心,同时保留原始的后期交互接口。SaMer仅在训练期间使用对象标注作为合并先验,以阻止跨实例混合,推理时不需要真实边界框或检测器,并且仅使用冻结的视觉和语言骨干网络来适应共享投影层。当K=64时,SaMer移除了超过93%的图像侧令牌,并将ColPali存储减少了16.09倍,同时提高了Flickr30K和MSCOCO上的R@1性能。这些增益的产生是因为对象感知合并保留了查询可选择的对象证据,而修剪或仅基于特征的池化可能会移除或折叠这些证据。SaMer还优于压缩基线,并显示出更强的短语级接地能力,这表明高效的多向量检索不仅取决于减少令牌数量,还在于保留未来查询令牌需要选择的证据。