并行自回归解码用于全模态密集视频字幕生成

发表
Wenzheng ZengWenzheng Zeng 提交
作者: Wenzheng Zeng, Siyi Jiao, Chen Gao, Hwee Tou Ng, Mike Zheng Shou

摘要

AI 生成总结
一种用于密集视频字幕的并行自回归框架,通过利用时间上不同事件之间的弱局部依赖性来提高生成效率,同时保持时间定位的准确性。
密集视频字幕旨在生成视频事件的时间性描述,这有利于事件级视频理解和生成。在该领域,自回归视频大语言模型因其强大的生成和跨模态建模能力而成为一种普遍范式。然而,在逐令牌范式下生成密集字幕严重限制了推理效率,并随着视频长度和事件密度的增加而阻碍了可扩展性。在这项工作中,我们提出了一种并行化的自回归框架,它不仅提高了生成效率,还增强了时间性字幕的性能。我们的关键洞察是利用时间上独立事件之间微弱的局部依赖性来重构因果依赖图,从而实现无损并行生成。具体来说,具有微弱跨事件依赖性的令牌可以并行解码,而每个事件内紧密耦合的令牌则保留顺序解码以保持局部语义连贯性。为了实现这一洞察,我们引入了无损并行解码的两个关键组件:(1) 一个潜在的全局规划机制,它自动学习事件级结构并生成编码全局事件间因果关系的紧凑令牌,同时自适应地聚合事件级视听语义,指导后续的依赖重构和并行解码;(2) 一个事件分解的并行解码机制,它有效地平衡了局部关注与全局事件间意识。在各种基准上的实验证明了我们的方法在全模态事件定位和字幕生成方面在效率和性能上的明显优势。项目网站:https://github.com/showlab/PadCaptioner
查看 arXiv 页面查看 PDF

评论

Wenzheng ZengWenzheng Zeng
论文提交者

我们提出PadCaptioner,一个3B参数的全模态密集视频字幕模型,它实现了高效率和强大的接地字幕质量,性能优于7B参数的模型。

核心思想是利用时间上独立事件之间的弱局部依赖关系,重构因果令牌依赖,从而实现无损并行生成。

我们设计了一种潜在规划机制,能够自动确定具有非局部感知能力的并行化单元,从而指导后续的并行解码并提高事件接地和字幕质量。

代码将发布在 https://github.com/showlab/PadCaptioner。请给我们一个⭐以获取最新动态!