⏶154
离场不离心:用于动态视频世界模型的混合记忆机制
发表
由
Dingkang Liang 提交
作者:
Kaijin Chen,
Dingkang Liang,
Xin Zhou,
Yikang Ding, Xiaoqiang Liu, Pengfei Wan, Xiang Bai
摘要
AI 生成总结
Hybrid Memory(混合记忆)通过将静态背景的归档存储与运动物体的动态追踪相结合,并利用带有标记化记忆和时空检索机制的专用架构,使视频世界模型能够在遮挡期间保持对动态主体的连贯追踪。视频世界模型在模拟物理世界方面展现出巨大潜力,但现有的记忆机制主要将环境视为静态画布。当动态主体消失在视线之外并随后重新出现时,现有方法往往难以应对,导致主体冻结、扭曲或消失。为了解决这一问题,我们引入了混合记忆(Hybrid Memory),这是一种新颖的范式,要求模型同时充当静态背景的精确档案保管员和动态主体的警觉追踪者,确保其在视野外间隔期间的运动连续性。为了促进这一方向的研究,我们构建了 HM-World,这是首个专门用于混合记忆的大规模视频数据集。它包含 5.9 万个高保真视频剪辑,具有解耦的摄像机和主体轨迹,涵盖 17 个多样化场景、49 个不同主体,并精心设计了出入场事件以严格评估混合连贯性。此外,我们提出了 HyDRA,这是一种专门的记忆架构,它将记忆压缩为 token,并利用时空相关性驱动的检索机制。通过选择性地关注相关的运动线索,HyDRA 有效地保留了隐藏主体的身份和运动。在 HM-World 上的广泛实验表明,我们的方法在动态主体一致性和整体生成质量方面均显著优于现有最先进的方法。

视频世界模型在模拟物理世界方面展现了巨大潜力,但现有的记忆机制主要将环境视为静态画布。当动态主体从视线中消失并随后重新出现时,现有方法往往难以应对,导致主体出现冻结、扭曲或消失。为了解决这一问题,我们引入了混合记忆(Hybrid Memory),这是一种要求模型同时充当静态背景的精确存档员和动态主体的警觉追踪者的新范式,以确保在视线外间隔期间的运动连续性。为了促进这一方向的研究,我们构建了 HM-World,这是首个专门用于混合记忆的大规模视频数据集。它包含 5.9 万个高保真片段,具有解耦的摄像机和主体轨迹,涵盖 17 个多样化场景、49 个不同主体,并精心设计了出场-入场事件,以严格评估混合连贯性。此外,我们提出了 HyDRA,这是一种专门的记忆架构,它将记忆压缩为 token,并利用时空相关性驱动的检索机制。通过有选择地关注相关的运动线索,HyDRA 有效地保留了隐藏主体的身份和运动。在 HM-World 上的广泛实验表明,我们的方法在动态主体一致性和整体生成质量方面均显著优于现有最先进的方法。