⏶11
用于自回归视频生成的投机解码
发表
由
Yuezhou Hu 提交
作者:
Yuezhou Hu,
Jintao Zhang
摘要
AI 生成总结
投机解码通过一种基于质量的路由机制被应用于自回归视频扩散,该机制在保持高视觉质量的同时实现了显著的加速。自回归视频扩散正在成为流式视频合成的一种有前景的范式,而步长蒸馏是加速推理的主要手段。大语言模型中占主导地位的加速策略——投机采样(speculative decoding)是否能有效地应用于自回归视频生成仍是一个悬而未决的问题,因为视频块(block)是连续的时空张量,没有用于精确拒绝采样的 Token 级分布。我们推出了 SDVG,它通过将 Token 验证替换为图像质量路由,将投机采样引入基于块的自回归视频扩散。一个 1.3B 的草稿模型(drafter)通过四个去噪步骤提出候选块;每个块经过 VAE 解码并由 ImageReward 进行评分,采用“最差帧聚合”——取每帧奖励的最小值,以捕捉平均法会掩盖的单帧伪影。评分高于固定阈值 tau 的块被接受进入 14B 目标模型的 KV 缓存;其余由目标模型重新生成。另外两个设计选择至关重要:第一个块始终被强制拒绝以锚定场景构图;tau 作为一个单一旋钮,可以描绘出平滑的质量-速度帕累托前沿。在 1003 个 MovieGenVideoBench 提示词(832x480)上,SDVG 在 tau=-0.7 时以 1.59 倍的加速保留了目标模型 98.1% 的 VisionReward 质量(0.0773 vs. 0.0788),并在 95.7% 的质量保留下达到 2.09 倍加速——同时始终优于仅由草稿模型生成的质量 17% 以上。该框架无需训练,无需架构更改,并可无缝集成到现有的自回归视频生成流程中。
我们展示了“自回归视频生成的投机解码”(SDVG),这是一个开创性的、无需训练的框架,成功将流行的大模型加速策略适配到自回归视频生成的连续时空领域。传统的投机解码依赖于离散 token 概率进行拒绝采样,这在处理连续视频块时根本无法奏效。SDVG 通过引入创新的“图像质量路由”来取代 token 级验证,克服了这一限制。在这种即插即用的架构中,一个轻量级的 1.3B 草稿模型快速生成候选视频块。随后,这些草稿由基于 ImageReward 的验证器进行严格评估,该验证器采用了一种新型的“最差帧聚合”策略,以检测平均分可能会忽略的孤立伪影。高质量的视频块被无缝注入到 14B 目标模型的 KV 缓存中,而拒绝的块则由目标模型重新生成。在 MovieGenVideoBench 上的评估显示,SDVG 在保持 98.1% 原始视觉质量的同时实现了 1.59 倍的推理加速,在保持 95.7% 质量时加速比可达 2.09 倍。SDVG 完全不需要修改架构,为实时视频合成提供了一种实用且高效的解决方案,是模型加速领域研究人员的必读之作。