⏶206
JoyAI-VL-Interaction:实时视觉-语言交互智能
发表
由
steven young 提交
作者: Dingyu Yao, Junhao Zhou,
Chenxu Yang, Chuanyu Qin, Haowen Hou, Zheming Liang, Congcong Wang, Yuhang Cao, Shenglong Ye, Shuai Xie, Shuhuan Gu, Haoyang Huang, Qingyi Si, Nan Duan,
Jiaqi Wang
摘要
AI 生成总结
一种视觉语言模型可实时连续运行,自主决定何时做出响应或进行委派,从而实现无需用户提示即可感知并对环境变化做出反应的交互式系统。现实世界中的许多时刻并不会等待用户提问。监控器上突然起火、视频通话中转瞬即逝的表情,或是直播间里观众想要的商品一闪而过。然而,当今的大模型在设计上大多仍是回合制的:它们只有在被提问时才会回答,甚至那些看似具有互动性的视频通话应用,其底层依然是问答系统,仅在被轮询或提示时做出反应。我们倡导一种不同的范式:一个像人一样存在于世界中的模型。它持续观察当前发生的事情,自主决定是发言还是保持沉默,进行实时互动,并在面对难题时将任务委派给后台模型。为了推动交互模型的发展及其在各领域的应用,我们做出了两个完全开源的贡献。首先,我们发布了 JoyAI-VL-Interaction,这是一个 8B 参数规模、视觉优先的视觉-语言交互(VL-interaction)模型。该模型在内部做出响应决策,每秒自行选择保持沉默、做出响应或委派给后台模型,并且在视觉触发的响应能力和时间感知方面表现优异。我们为其配备了一套可迁移的训练配方,从而激发出我们从未训练过的能力,例如引导购物者浏览不断变化的 App 屏幕,或根据幻灯片即兴演讲。其次,我们发布了一个围绕该模型构建的完整、可部署的系统。该系统将任何正在播放的视频流输入到模型中,使其真正存在于现实世界中。所有其他组件都是可插拔的,包括 ASR/TTS 模块、记忆体、可视化 UI 以及可连接到任何 API 或智能体的后台大脑。在六个真实场景中,人类评估者明显更青睐 JoyAI-VL-Interaction,其满意度大幅领先于豆包(Doubao)和 Gemini 的应用内视频通话助手。据我们所知,这是首个与训练配方、数据和完整可部署系统一同发布的开源、视觉驱动交互模型。
图 1:JoyAI-VL-Interaction 概述。

图 3:JoyAI-VL-Interaction 系统概述。
