⏶11
SeKV:具有分层语义记忆的分辨率自适应KV缓存,用于长上下文LLM推理
发表
由
Amirhossein Abaskohi 提交
作者: Amirhossein Abaskohi, Giuseppe Carenini, Peter West, Yuhang He
摘要
AI 生成总结
SeKV 引入了一种分辨率自适应的语义 KV 缓存,它将上下文压缩为熵引导的跨度,存储在 GPU-CPU 内存层次结构中,实现了高效的长上下文处理,内存开销极小且保留了令牌级细节。大型语言模型越来越多地在长上下文中操作,其中KV缓存成为主要的内存瓶颈:其大小随序列长度线性增长,并且必须在整个解码过程中保留,这使得在不压缩的情况下进行完整的GPU缓存成本高昂。现有的KV缓存压缩方法难以平衡效率和忠实上下文保留。令牌逐出丢弃信息,而语义分组在预填充时固定压缩决策;两者都无法在生成过程中一旦相关时从压缩跨度中恢复令牌级细节。作为解决方案,我们提出了SeKV,一种分辨率自适应语义KV缓存,它将上下文组织成熵引导的语义跨度,并将其存储在GPU-CPU内存层次结构中而不丢弃信息。每个跨度在GPU上保留一个轻量级摘要向量用于粗略路由,在CPU上保留一个低秩SVD基用于按需令牌级重建。训练过的放大机制在解码期间选择性地扩展与查询相关的跨度,从而实现精确检索,而无需在GPU上具体化完整的KV缓存。SeKV实现了自适应令牌级重建,同时保持基础LLM完全冻结,并增加了不到0.05%的可训练参数。在四个基准测试中,SeKV平均比最强的语义压缩基线提高了5.9%,同时在128K上下文下将GPU内存比完整KV缓存减少了53.3%。代码可在https://github.com/AmirAbaskohi/SeKV获取。
SeKV通过将KV缓存组织成语义跨度并动态重建仅相关信息,从而使长上下文LLM推理更高效,提高了长上下文性能,同时显著减少了GPU内存使用。