SemanticMoments:通过三阶矩特征实现的无需训练的动作相似度计算

发表
noam rotsteinnoam rotstein 提交
作者: Saar Huberman, Kfir Goldberg, Or Patashnik, Sagie Benaim, Ron Mokady

摘要

AI 生成总结
语义特征空间中的时间统计为以运动为中心的视频理解提供了一种可扩展的方法,其表现优于现有的 RGB、流和文本监督方法。
基于语义动作检索视频是一个基础性但尚未解决的问题。现有的视频表示方法过度依赖静态外观和场景上下文,而非动作动力学,这种偏见源自其训练数据和目标。相反,传统的以动作中心为输入的特征(如光流)缺乏理解高层动作所需的语义基础。为了证明这种固有偏见,我们引入了 SimMotion 基准测试,结合了受控的合成数据和全新的经过人工标注的真实世界数据集。我们展示了现有模型在这些基准测试上表现不佳,通常无法将动作与外观解耦。为了填补这一空白,我们提出了 SemanticMoments,这是一种简单的、无需训练的方法,它通过预训练语义模型的特征计算时间统计量(特别是高阶矩)。在我们的基准测试中,SemanticMoments 一致优于现有的 RGB、光流和文本监督方法。这证明了在语义特征空间中的时间统计量为以动作为中心的视频理解提供了可扩展且具有感知基础的基石。
查看 arXiv 页面查看 PDF
SemanticMoments:通过三阶矩特征实现的无需训练的动作相似度计算

评论

noam rotsteinnoam rotstein
论文提交者

像 VideoMAE 和 V-JEPA2 这样的现代视频表示模型往往偏向于外观而非动作。我们推出了 SemanticMoments,这是一种用于语义动作相似性的免训练表示方法。