⏶100
AnyFlow:基于同策略流图蒸馏的任意步视频扩散模型
发表
由
taesiri 提交
作者: Yuchao Gu,
Guian Fang, Yuxin Jiang, Weijia Mao, Song Han,
Han Cai, Mike Zheng Shou
摘要
AI 生成总结
AnyFlow 引入了一种新型的全步长(any-step)视频扩散蒸馏框架,通过流映射转移学习(flow-map transition learning)和反向模拟技术优化完整的 ODE 采样轨迹,从而改进了稠密一致性蒸馏。少步视频生成在一致性蒸馏(consistency distillation)的推动下取得了显著进展。然而,当测试时分配更多的采样步数时,一致性蒸馏模型的性能往往会下降,这限制了它们在任意步数(any-step)视频扩散中的有效性。这种局限性源于一致性蒸馏将原始的概率流 ODE 轨迹替换为一致性采样轨迹,从而削弱了 ODE 采样在测试时理想的缩放行为。为了解决这一问题,我们推出了 AnyFlow,这是首个基于流映射(flow maps)的任意步数视频扩散蒸馏框架。AnyFlow 不再只针对少数固定的采样步数进行模型蒸馏,而是优化完整的 ODE 采样轨迹。为此,我们将蒸馏目标从端点一致性映射 (z_{t} 映射到 z_{0}) 转向任意时间间隔内的流映射转换学习 (z_{t} 映射到 z_{r})。我们还进一步提出了流映射后向模拟(Flow Map Backward Simulation),它将完整的欧拉展开分解为快捷的流映射转换,从而实现高效的在线策略(on-policy)蒸馏,并减少测试时的误差(即少步采样中的离散化误差和因果生成中的曝光偏差)。在 1.3B 到 14B 参数规模的流式和因果架构上进行的广泛实验表明,AnyFlow 在少步制度下达到了与一致性模型相当或更优的性能,并能随采样步数预算增加而提升表现。
我们已经开源了代码、模型和演示。
📄论文: https://arxiv.org/abs/2605.13724
💻代码: https://github.com/NVlabs/AnyFlow
🎨预训练模型: https://huggingface.co/collections/nvidia/anyflow
🎬演示: https://nvlabs.github.io/AnyFlow/demo