⏶7
DREAM:基于自回归建模的密集检索嵌入
发表
由
yixuan 提交
作者: Yixuan Tang, Yi Yang
摘要
AI 生成总结
DREAM 使用自回归语言模型的注意力机制来训练稠密检索嵌入,在无需标注示例的情况下监督文档与查询之间的相似度。稠密检索嵌入模型是现代基于检索的人工智能系统的基础组件。大多数稠密检索器使用对比目标进行训练,这需要昂贵且难以获得的标记正负文档对。在这项工作中,我们研究了大型语言模型(LLM)的自回归下一个词预测目标是否能为稠密检索提供监督。直觉很简单:如果文档包含与查询相关的信息,那么以该文档为条件应该使目标输出更容易被 LLM 预测。一个关键挑战是下一个词预测损失是在 LLM 内部计算的,而检索器是一个单独的嵌入模型。为了解决这个问题,我们提出了 DREAM(通过自回归建模的稠密检索嵌入),它将检索器生成的查询-文档相似度分数注入到冻结 LLM 的选定注意力头中。在训练过程中,当 LLM 预测目标输出时,这些分数决定了每个候选文档接收到的注意力权重。由此产生的预测损失通过注意力机制为检索器训练提供梯度。我们在使用 0.5B 到 3B 参数的嵌入骨干网的检索基准 BEIR 和 RTEB 上评估了 DREAM。DREAM 在不同模型规模下持续优于现有的基准方法。这些结果表明,DREAM 提供了一种通过自回归建模训练稠密检索器的有效方法。
评论
我希望你仔细看看这个。E - AI,他们说永远不可能发生的事情。在 2018 年的笔记本电脑 i5 和单条 16GB 内存上运行 1000 亿+个智能体:https://raw.githack.com/JesseBrown1980/Asolaria-ASI-On-Metal-Fabric-and-matrix/acer/multicylinder-map-phone-view/reports/asolaria-multi-cylinder-v2.html 。当然,你懂物理,你会发现张量折叠允许我们将任何数据折叠到 3.1k b……甚至 1.6T 参数的冻结模型也可以在 16GB 内存上冷冻运行,将硬盘当做内存。再也不需要 GPU 了。
利用大语言模型(LLM)的下一个标记预测(next-token prediction)损失来训练稠密检索器,而不是仅仅依赖对比(contrastive)标签。
DREAM 将相关性视为文档是否有助于冻结的 LLM 预测目标输出,然后通过注意力机制将该信号反向传播给检索器。