⏶366
揭秘视频推理
发表
由
taesiri 提交
作者:
Ruisi Wang,
Zhongang Cai,
Fanyi Pu,
Junxiang Xu,
Wanqi Yin,
Maijunxian Wang,
Ran Ji,
Chenyang Gu, Bo Li,
Ziqi Huang,
Hokin Deng,
Dahua Lin, Ziwei Liu,
Lei Yang
摘要
AI 生成总结
基于扩散的视频模型通过去噪步骤而非帧序列展示推理能力,在专门的 Transformer 层中表现出诸如工作记忆、自我修正和先感知后行动等行为。视频生成的近期进展揭示了一个意想不到的现象:基于扩散的视频模型展现出了非平凡的推理能力。此前的工作将其归因于帧链(Chain-of-Frames, CoF)机制,即认为推理是在视频帧之间顺序展开的。在这项工作中,我们挑战了这一假设并发现了一种截然不同的机制。我们证明,视频模型中的推理主要是在扩散去噪步(steps)中涌现的。通过定性分析和针对性的探测实验,我们发现模型在早期去噪步中探索多个候选方案,并逐渐收敛到最终答案,我们将这一过程称为步链(Chain-of-Steps, CoS)。除了这一核心机制外,我们还确定了几种对模型性能至关重要的涌现推理行为:(1) 工作记忆,实现持久引用;(2) 自我修正与增强,允许从错误的中间方案中恢复;(3) 先感知后行动,即早期步骤建立语义落地,后期步骤执行结构化操作。在单个扩散步内,我们进一步发现扩散 Transformer 内部存在自演化的功能分化,其中早期层编码稠密的感知结构,中间层执行推理,后期层整合隐表示。基于这些见解,我们提出了一种简单的无需训练的策略作为概念验证,证明了通过集成具有不同随机种子的相同模型的隐轨迹可以提升推理能力。总的来说,我们的工作提供了对视频生成模型中推理如何涌现的系统理解,为未来更好地利用视频模型的内在推理动力学作为智力的新基质提供了基础。
评论
论文作者
我们的 GitHub 仓库现已上线,用于讨论和即将发布的工具。关注我们以获取最新更新!
GitHub: https://github.com/OpenSenseNova/Demystifying_Video_Reasoning
主页:https://www.wruisi.com/demystifying_video_reasoning
YouTube 视频:https://youtu.be/Gs9TPZmzo-s
GitHub:https://github.com/OpenSenseNova/Demystifying_Video_Reasoning