⏶145
Domino:在投机解码中将因果建模与自回归起草解耦
发表
由
黄佳诺 提交
作者:
Jianuo Huang, Yaojie Zhang, Qituan Zhang, Hao Lin, Hanlin Xu, Linfeng Zhang
摘要
AI 生成总结
Domino 是一种投机解码框架,它通过并行主干和轻量级因果细化头,将因果依赖建模与自回归草稿生成相解耦,从而提高 LLM 推理速度,在端到端执行和吞吐量方面都实现了显著加速。投机解码(Speculative decoding)通过起草多个 Token 并使用目标模型并行验证它们来加速 LLM 推理。然而,其在实际中的加速效果受到草稿质量与起草成本之间权衡的限制:自回归起草器建模了草稿 Token 之间的因果依赖关系,但会带来顺序开销;而并行起草器降低了起草成本,但减弱了块内依赖关系建模。在本文中,我们提出了 Domino,这是一个将因果依赖关系建模与昂贵的自回归草稿执行相解耦的投机解码框架。Domino 首先使用一个并行草稿骨干来产生整个数据块的初步草稿分布,然后应用轻量级的 Domino 头部利用依赖于前缀的因果信息来对其进行细化。为了稳定教师强制(teacher-forced)因果编码,我们进一步引入了基础锚定训练课程(base-anchored training curriculum),该课程首先加强并行骨干,然后逐渐将优化转向因果校正后的最终分布。在 Qwen3 模型上的实验表明,Domino 在 Transformers 后端下实现了多达 \(5.49\times\) 的端到端加速,在 SGLang 服务下实现了多达 \(5.8\times\) 的吞吐量加速。
Domino 是一种投机解码方法,它通过加入轻量级的因果修正来改进并行草稿生成(parallel drafting)。它的目标是在保持块并行(block-parallel)草稿生成效率的同时,恢复在完全并行草稿模型中丢失的一部分因果依赖关系建模。代码和模型可在以下地址获取:https://github.com/jianuo-huang/Domino