⏶145
Video2GUI:合成大规模交互轨迹用于泛化 GUI 智能体预训练
发表
由
xwm 提交
作者: Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue,
Lei Li, Feifan Song, Sujian Li, Hao Tian
摘要
AI 生成总结
通过自动从互联网视频中提取交互轨迹,创建了一个大规模的 GUI 数据集,通过在此多样化集合上进行预训练,能够提升 GUI 智能体的性能。多模态大语言模型的最新进展推动了人们对图形用户界面(GUI)智能体日益增长的兴趣,然而,它们的泛化能力仍然受到缺乏横跨多样化真实世界应用的大规模训练数据的限制。现有的数据集严重依赖昂贵的人工标注,且通常局限于狭窄的领域。为了解决这一挑战,我们提出了 Video2GUI,这是一个完全自动化的框架,它直接从未标记的互联网视频中提取有据可依的 GUI 交互轨迹。Video2GUI 采用由粗到精的过滤策略,以识别高质量的 GUI 教程视频并将其转换为结构化的智能体轨迹。将该流水线应用于 5 亿个视频元数据条目后,我们构建了 WildGUI,这是一个大规模数据集,包含横跨 1,500 多个应用程序和网站的 1,200 万条交互轨迹。在 WildGUI 上对 Qwen2.5-VL 和 Mimo-VL 进行预训练,在多个 GUI 定位(grounding)和动作基准测试中带来了 5-20% 的持续改进,达到或超越了最先进的性能。我们将发布 WildGUI 数据集和 Video2GUI 流水线,以支持未来对 GUI 智能体的研究。
🚀 很高兴向大家介绍 Video2GUI——一个全自动框架,可以将无标注的 YouTube 视频在互联网规模下转化为定位精确的 GUI 交互轨迹。
现有的 GUI Agent 数据集依赖于昂贵的人工标注,且局限于狭窄的领域,这瓶颈了泛化能力。我们不禁要问:我们是否可以转而挖掘网络上现有的海量 GUI 教程?从 5 亿多部 YouTube 视频开始,我们的“由粗到细过滤 + VLM 驱动的轨迹提取 + 空间定位”流水线生产出了 WildGUI:包含 1270 万条轨迹、1.245 亿张截图,涵盖 Web、移动和桌面端的 1,500 多个应用和网站——这是迄今为止最大的开源 GUI 预训练数据集。
在 WildGUI 上预训练 Qwen2.5-VL 和 Mimo-VL,在 ScreenSpot-Pro,OSWorld-G,AndroidControl,CAGUI,OSWorld 和 AndroidWorld 上带来了 5–20% 的提升——达到或超越了最先进水平(SOTA)。在 ScreenSpot-Pro 上,准确率从 41.2% 提升至 56.9%,实现了近 38% 的相对增长。很高兴能与大家讨论流水线设计以及互联网规模的视频挖掘如何赋能下一代 GUI Agent。数据集和流水线即将发布!