⏶53
Avatar Forcing:面向自然对话的实时交互式头部数字人生成
发表
由
taesiri 提交
作者:
Taekyung Ki, Sangwon Jang, Jaehyeong Jo,
Jaehong Yoon, Sung Ju Hwang
摘要
AI 生成总结
Avatar Forcing 框架通过扩散强迫(diffusion forcing)和无标签偏好优化,实现了低延迟且具有表现力动作的实时交互式头部头像生成。数字人头像生成(Talking head generation)利用静态肖像创建栩栩如生的化身,用于虚拟交流和内容创作。然而,目前的模型尚未传达出真正的互动交流感,通常生成的单向响应缺乏情感参与。我们确定了实现真正互动化身的两个关键挑战:在因果约束下实时生成动作,以及在没有额外标注数据的情况下学习富有表现力和活力的反应。为了应对这些挑战,我们提出了 Avatar Forcing,这是一个用于交互式头像生成的新框架,通过扩散强迫(diffusion forcing)模拟实时用户-化身互动。这种设计允许化身处理实时的多模态输入(包括用户的音频和动作),并以低延迟对言语和非言语信号(如说话、点头和笑声)做出即时反应。此外,我们引入了一种直接偏好优化方法,利用通过舍弃用户条件构建的合成负样本,实现交互表现力的无标签学习。实验结果表明,我们的框架能够实现约 500ms 的低延迟实时交互,比基准模型快 6.8 倍,并能生成反应灵敏且富有表现力的化身动作,在对比测试中,其偏好率超过基准模型 80%。