DSpark:结合半自回归生成的置信度调度推测解码

发表
taesiritaesiri 提交
作者: Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, Damai Dai, Zhengyan Zhang, Yixuan Wei, Yixuan Tan, Wenkai Yang, Runxin Xu, Yu Wu, Zhean Xu, Xuanyu Wang, Muyang Chen, Rui Tian, Xiao Bi, Zhewen Hao, Shaoyuan Chen, Huanqi Cao, Wentao Zhang, Anyi Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang

摘要

AI 生成总结
DSpark 通过将并行草稿生成与自适应验证相结合,提高了 LLM 推理速度,减少了浪费并改善了高并发设置下的吞吐量。
推测解码通过将草稿生成与目标验证解耦,加速了大型语言模型(LLM)的推理。虽然最近的并行草稿生成器能够在单次前向传播中高效地提出长令牌序列,但由于缺乏令牌间依赖性,它们存在接受率迅速下降的问题。此外,不加选择地验证这些扩展的块会浪费关键的批处理容量在具有高拒绝风险的令牌上,严重降低高并发服务系统的吞吐量。我们引入了DSpark,一个推测解码框架,它将高吞吐量并行生成与自适应、负载感知的验证相结合。为了保持草稿质量,DSpark采用半自回归架构,将并行骨干与轻量级序列模块耦合,以引入块内依赖建模并减轻后缀衰减。为了优化系统效率,DSpark采用置信度调度验证,根据估计的前缀存活概率和引擎特定的吞吐量配置文件,动态调整每个请求的验证长度。在跨不同领域的离线基准测试中,DSpark显著改善了最先进的自回归和并行草稿生成器的接受长度。当在DeepSeek-V4服务系统中部署并处理实时用户流量时,DSpark成功地减少了验证浪费。与已建立的生产基线(MTP-1)相比,DSpark在匹配吞吐量水平下将每用户生成速度提高了60%到85%。更重要的是,通过防止在严格交互性约束下出现严重的吞吐量下降,它实现了以前无法达到的性能等级,改变了我们服务系统的帕累托前沿。
查看 arXiv 页面查看 PDF

评论

wywwyw

下载