⏶103
Stream-T1:流式视频生成的测试时扩展
发表
由
Mengqi Huang 提交
作者: Yijing Tu,
Shaojin Wu, Mengqi Huang, Wenchuan Wang, Yuxin Wang, Chunxiao Liu, Zhendong Mao
摘要
AI 生成总结
Stream-T1 通过带有时间引导的流式合成实现了高效的测试时视频生成,相比现有的基于扩散的方法,实现了更好的连贯性和质量。虽然测试时缩放(TTS)为增强视频生成提供了一个无需激增训练成本的有前景的方向,但目前基于扩散模型的测试时视频生成方法面临着巨大的候选样本探索成本,且缺乏时间引导。为了解决这些结构性瓶颈,我们建议将重点转向流式视频生成。我们发现,其分块合成和少步去噪的特性本质上适合 TTS,在显著降低计算开销的同时实现了细粒度的时间控制。基于这一洞察,我们推出了 Stream-T1,这是首个专门为流式视频生成量身定制的全面 TTS 框架。具体而言,Stream-T1 由三个单元组成:(1) 流缩放噪声传播(Stream-Scaled Noise Propagation),利用历史验证的高质量前块噪声主动精炼当前生成块的初始潜在噪声,有效建立时间依赖性并利用历史高斯先验引导当前生成;(2) 流缩放奖励剪枝(Stream-Scaled Reward Pruning),通过整合即时短期评估与基于滑动窗口的长期评估,全面评估生成的候选样本,在局部空间美学和全局时间连贯性之间取得最佳平衡;(3) 流缩放内存下沉(Stream-Scaled Memory Sinking),在奖励反馈的引导下,将从 KV 缓存中逐出的上下文动态路由到不同的更新路径,确保先前生成的视觉信息能有效锚定并引导后续视频流。在 5 秒和 30 秒的综合视频基准测试中,Stream-T1 展现出显著优势,大幅提升了时间一致性、运动平滑度和帧级视觉质量。
虽然测试时缩放(TTS)为增强视频生成提供了一个极具前景的方向,且无需激增训练成本,但当前基于扩散模型的测试时视频生成方法面临着昂贵的候选探索成本且缺乏时间引导。为了解决这些结构性瓶颈,我们建议将重点转向流式视频生成。我们发现其分块(chunk-level)合成和较少的去噪步骤本质上适用于 TTS,能显著降低计算开销,同时实现细粒度的时间控制。基于这一见解,我们推出了 Stream-T1,这是一个专为流式视频生成量身定制的开创性综合 TTS 框架。在 5 秒和 30 秒的综合视频基准测试中,Stream-T1 展现出深刻的优越性,显著提升了时间一致性、运动流畅度和帧级视觉质量。