量化与扩展晚期交互检索模型的理论容量

发表
Julian KillingbackJulian Killingback 提交
作者: Julian Killingback, Varad Ingale, Hamed Zamani, Cameron Musco

摘要

AI 生成总结
MaxSim 相似性可以精确复制稀疏向量之间的内积并支持逻辑运算,而 Signed MaxSim 将此能力扩展到实值向量,同时提高了复杂查询类型上的检索性能。
使用MaxSim相似度函数的后交互检索模型已经表现出强大的经验性能,通常优于单向量密集和稀疏检索模型。尽管有这些经验发现,但关于MaxSim的理论表示能力以及它与其他检索方法的比较知之甚少。本文通过构造证明,MaxSim相似度可以精确复制任意两个具有可能无限维度的非负k稀疏向量之间的内积,仅需要O(k)的表示空间。此外,MaxSim可以表达一些相似度,而具有相同表示空间的标准向量内积无法表达。利用我们的理论框架,我们引入了Signed MaxSim,它允许后交互模型精确复制任何实值内积,我们证明标准MaxSim不具备此能力。我们还表明,MaxSim可以作为软OR操作的聚合器,以及正合取范式中逻辑表达式的评估器。我们的发现表明,对于任何非负向量,MaxSim至少与标准向量内积能力相当;而我们的扩展Signed MaxSim,对于任何向量都具备相同能力。这两种相似度都拥有内积无法复制的额外能力,这标志着对后交互方法的首次理论证明和量化之一。我们的理论发现得到了经验支持:在一个包含否定查询的检索任务中,Signed MaxSim在词汇转换下相对于标准ColBERT/MaxSim基线显著提高了域外性能,nDCG@10从0.597增加到1.000,在仅否定查询上从0.008增加到0.788。
查看 arXiv 页面查看 PDF
量化与扩展晚期交互检索模型的理论容量

评论

Julian KillingbackJulian Killingback
论文提交者

本文有助于解释MaxSim为何表现如此出色。它表明MaxSim可以精确地复制两个可能具有无限维度的稀疏向量之间的内积,其中后期交互表示的大小仅受原始向量中非零元素数量的影响。这有助于解释为什么后期交互模型能够很好地泛化,它们可以在不压缩任何信息的情况下编码长尾特征。这也意味着后期交互模型可以精确地复制任何使用严格非负向量的检索模型,例如SPLADE和BM25。

我们确实发现MaxSim无法复制任意实值向量之间的内积。为了解决这个问题,我们提出了Signed MaxSim,并证明它能够精确地复制任何实值向量内积,其中表示大小再次仅与原始向量中的非零元素相关。因此,此扩展至少与任何单向量检索模型和任何基于MaxSim的检索模型一样强大。

我们还表明,MaxSim和Signed MaxSim可以表示标准内积无法以相同表示大小复制的相似性,从而提供了内积模型和后期交互模型之间清晰的表示差距。

Tom AarsenTom Aarsen

非常棒 @jfkback。我看到 Signed MaxSim 在 LIMIT 风格的数据集上明显优于标准 MaxSim,但我很好奇你是否也在(Nano)BEIR / MTEB 风格的标准检索数据集上进行了训练和测试,或者这是否在你的待办事项列表中?我正在努力扩展 Sentence Transformers 的多向量功能,我很乐意实验 Signed MaxSim 是否严格更优。

  • Tom Aarsen
Julian KillingbackJulian Killingback
论文提交者

Tom 你好,我最初是使用带指令的 MSMarco 进行实验,并使用 NanoBEIR 进行验证,在 FollowIR 上进行评估的。我的实验结果大体表明 Signed MaxSim 与标准 MaxSim 相当相似,不过我确实相信在 NanoBEIR 中,平均得分最高的是一个 Signed MaxSim 模型。所以我认为 Signed MaxSim 在不需要过多轻易降低文档分数的数据上,应该与 MaxSim 表现相似。目前尚早,也许换一些不同的训练数据会有更多提升。

正是这些平庸的结果促使我转向使用合成数据进行评估。即使在那里,ColBERT 在域内表现良好,但它学习相似性的方式要复杂得多,这就是它无法像 Signed MaxSim 那样泛化的原因。

我的结论是,如果不需要处理负样本的特定能力(你可以将权重全部设置为 1,它就会变回标准 MaxSim),Signed MaxSim 应该与标准 MaxSim 表现非常相似。

在论文的下一版本中,我将添加更多的检索数据集结果,并分析 ColBERT 如何在我们的合成任务中处理否定。