SpecBlock:基于动态树草案的块迭代投机解码

发表
weijieweijie 提交
作者: Weijie Shi, Qiang Xu, Fan Deng, Yaguang Wu, Jiarun Liu, Yehong Xu, Hao Chen, Jia Zhu, Jiajie Xu, Xiangjun Huang, Jian Yang, Xiaofang Zhou

摘要

AI 生成总结
采用 SpecBlock 的推测解码结合了块迭代起草和路径依赖,通过自适应机制在保持准确性的同时提高了 LLM 的推理速度。
推测解码通过起草候选续写的树并在一次目标前向传播中进行验证来加速 LLM 推理。现有的起草器分为两个阵营,各有优劣。自回归起草器(如 EAGLE-3)保留了每个起草路径上的依赖性,但每层树深都需要调用一次起草器,使得起草开销在每次迭代延迟中占据不小的比例。并行起草器通过在一次前向传播中预测多个未来位置来减少调用次数,但每个位置的预测并未参考其他位置,产生的路径常被验证器拒绝。在本文中,我们提出了 SpecBlock,一种结合了路径依赖和廉价起草的块迭代起草器。起草器的每次前向传播产生 K 个相互依赖的位置,我们称之为一个块(block)。起草树通过重复的块扩展而增长。两种机制显式地承载路径依赖,以保持后续起草位置的准确性:在块内,层级偏移将前一位置的隐状态带入每个解码器层;跨块时,每个新块可以从前一块的任何位置开始,继承其隐状态以延伸路径。为了在接受概率高的地方消耗验证器预算,一个共同训练的排序头取代了固定的 top-k 树,在起草期间分配每个位置的分支。为了避免在推理时从未产生的序列前缀上训练起草器,有效前缀掩码在早期位置错误时丢弃后续位置的损失。除了静态起草外,部署时的成本感知老虎机(bandit)利用免费的验证器反馈选择性地更新起草器,仅当预期吞吐量增益超过更新成本时才进行更新。实验表明,SpecBlock 以 EAGLE-3 44-52% 的起草成本实现了 8-13% 的平均加速提升,且成本感知自适应将这一领先优势扩大到了 11-19%。
查看 arXiv 页面查看 PDF

评论

weijieweijie
论文提交者
此评论已隐藏。
UrroUrro

爱了!