ARC 章节:将一小时长的视频拆分为可导航的章节和分层摘要

发表
Junfu PuJunfu Pu 提交
作者: Junfu PuJunfu Pu, Teng Wang, Yixiao Ge, Yuying Ge, Chen Li, Ying Shan

摘要

AI 生成总结
ARC-Chapter是一个大型视频章节划分模型,通过海量训练数据和新的评估指标提高了性能,展示出卓越的成果和可迁移性。
时长视频(例如,讲座、播客、纪录片)的激增,对高效内容结构化的需求日益强烈。然而,现有方法受限于小规模训练,其注释通常简短且粗略,限制了其在长视频中处理细微过渡的泛化能力。我们推出了 ARC-Chapter,这是首个大规模视频分章节模型,它在超过百万级别的长视频章节上进行训练,并具有双语、时序定位和分层章节注释。为了实现这一目标,我们通过结构化流程整理了一个双语英中章节数据集,该流程将 ASR 转录、场景文本、视觉字幕统一为多级注释,从短标题到长摘要。我们证明了数据扩展(包括数据量和标签强度)在性能上带来了明显的提升。此外,我们设计了一种新的评估指标 GRACE,它结合了多对一的片段重叠和语义相似性,更好地反映了实际章节划分的灵活性。大量的实验表明,ARC-Chapter 以显著的优势确立了新的最先进水平,在 F1 分数上比之前的最佳提高了 14.0%,在 SODA 分数上提高了 11.3%。此外,ARC-Chapter 显示出卓越的可转移性,在 YouCook2 等下游任务(如密集视频字幕)上提升了最先进水平。
查看 arXiv 页面查看 PDF

评论

Junfu PuJunfu Pu
论文作者
论文提交者

ARC-Chapter 是腾讯 ARC 实验室推出的大规模模型,用于深度视频理解和结构化章节生成。ARC-Chapter 自动分析具有清晰叙事或语义结构的视频,将其分割成有意义的章节,识别精确的时间戳,并为每个部分生成摘要。