⏶7
GORGO: 跨区域网络感知LLM服务的在线调优
发表
由
Alessio Toniolo 提交
作者:
Alessio Ricci Toniolo,
Rome Thorstenson, Abinaya Dinesh
摘要
AI 生成总结
GORGO 是一种代理架构,通过在一个新的合成数据集上进行演化策略调整,综合考虑网络延迟、预填充成本和排队延迟,优化了 LLM 推理负载均衡。LLM 推理服务越来越多地将客户端请求代理到全球分布的引擎副本。在优化延迟和 TTFT 等指标时,负载均衡策略必须综合考虑 KV 缓存局部性、副本负载和可变网络延迟等因素。然而,现有系统在其成本模型中仅评估这些因素的一个子集,导致负载和 KV 缓存在副本之间分布不均。我们提出了 GORGO,一种代理架构,它使用可调参数全面考虑网络延迟、预填充成本和排队延迟。由于 LMSYS-Chat1M 和 WildChat-4.8M 等开源聊天数据集缺乏长上下文、高前缀重用数据,我们从长上下文生产元数据中发布了一个合成数据集 ART-Chat-2.5M。在 ART-Chat-2.5M 的调优窗口中,进化策略指导 GORGO 策略的参数直接优化 p95 TTFT。在保留评估窗口中,我们固定从调优中学到的参数值,并将 p95 TTFT 提高了 6.9-15.5%,p95 端到端 (E2E) 延迟提高了 14.3-30.9%,优于简单会话亲和性和前缀缓存等基线负载均衡策略。代码和 ART-Chat-2.5M 数据集可在 https://github.com/Arcadia-Research-Team/GORGO 找到。
在LLM推理的负载均衡中,TTFT(首个令牌生成时间)包含三个不同的成本:网络延迟、预填充时间(prefill time)和排队延迟。尽管缓存感知策略旨在重用现有KV缓存,但这些策略无法有效平衡负载,导致E2E(端到端)延迟崩溃。GORGO使用加权成本函数共同优化所有三个路由信号。在针对长上下文用户工作负载进行在线调优时,GORGO策略相较于现有策略(如简单会话亲和性)在TTFT和E2E延迟方面显示出6-30%的降低。