Wan-Streamer v0.2: 更高分辨率,相同延迟

发表
Lianghua HuangLianghua Huang 提交
作者: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi

摘要

AI 生成总结
Wan-Streamer v0.2 通过优化的思考者-执行者架构和多 GPU 并行处理,在提高视觉分辨率的同时保持低延迟,从而增强音视频交互。
我们推出 Wan-Streamer v0.2,这是对原生流式、端到端音视频交互模型的延迟保持升级。v0.2 沿用了 v0.1 的建模公式,但将交互式输出流从 192x336 提高到 640x368,同时在 25 FPS 下保持约 200 毫秒的模型端信号到信号延迟。更高分辨率的流支持以场景为基础的特写镜头代理,其姿势、凝视、手部、附近物体和局部场景布局在实时对话中保持清晰可辨。为了支持更大的视频流而不增加用户可见的延迟,v0.2 将思考者(thinker)保留为单 GPU 低延迟路径,用于流式感知、构建生成缓存的短语言/状态 Transformer 通道以及最终解码。执行者(performer)则成为一个多 GPU 的 Ulysses 风格上下文并行组,用于昂贵的下一单元潜在生成。每个执行者进程将传入的 K/V 写入预分片的本地缓存中。长的高分辨率潜在视频序列在进程间进行分割以进行去噪并通过 Ulysses 通信进行收集,而短得多的音频潜在序列则无需序列分片即可生成。在这种分割中,思考者的语言/状态计算仅作为 K/V 条件到达执行者,因此无需在执行者组内部通信单独的语言序列。这将在视觉生成上集中额外硬件,同时保持思考者-执行者之间的紧凑边界,在包含 350 毫秒双向网络预算的情况下,将总远程交互延迟保持在约 550 毫秒。
查看 arXiv 页面查看 PDF

评论

Lianghua HuangLianghua Huang
论文提交者

一项保持延迟的Wan Streamer升级:从192p特写通话升级到640×368更清晰的通话和场景定位的中景智能体,仍保持25帧/秒,模型端延迟约200毫秒。
framework