⏶23
Light-Omni:智能体视频理解中具有长期记忆的反射优先于推理
发表
由
Nie 提交
作者: Chang Nie, Jiaju Wei, Junlan Feng, Chaoyou Fu, Caifeng Shan
摘要
AI 生成总结
Light-Omni 是一个多模态智能体框架,通过双重上下文状态实现高效的视频理解,在消除迭代推理的同时保持语义对齐,从而实现更快、更准确的视频处理。智能体视频理解使模型具备长期记忆,能够自主处理和响应连续、长时程的多模态流。然而,先进的视频智能体通常依赖“侦探式”的迭代推理进行动作控制(例如搜索)和证据聚合,这会带来高昂的成本和延迟。我们认为,这种繁重的推理主要是为了弥补检索中全局上下文的缺失和语义不对齐问题。本文介绍了Light-Omni,一个用于反射式轻量级视频理解的多模态智能体框架。它通过双重上下文状态实现这一点,在单次前向传递中即时构建所需的上下文。首先,我们维护一个全局状态,这是一个从情景记忆中持续整合的有限大小多模态脚本,作为Light-Omni的全局上下文。通过分层合并,它在保留最新细节的同时总结了过去事件。其次,在这个全局上下文的条件下,我们生成一个参数化潜在状态,它直接驱动自主动作并生成检索嵌入,且延迟极小。受益于这种耦合设计,Light-Omni实现了语义对齐的检索和反射式响应,同时避免了迭代推理。大量实验验证了Light-Omni在多个视频基准上的有效性。值得注意的是,它在平均精度上比M3-Agent提高了2.4%,速度提升了12.1倍,GPU内存效率提升了2.6倍。此外,它还作为一种记忆系统,提高了现有MLLM的性能和效率。项目页面:https://clare-nie.github.io/Light-Omni。
我们推出Light-Omni,一个用于长期视频理解的高效多模态智能体框架。先进的视频智能体通常由于繁重的“侦探式”迭代推理而面临高昂的延迟。为解决此问题,Light-Omni通过一种新颖的双态机制(全局和潜在状态)在单次前向传播中实现即时“反射式”响应。
主要亮点:
- 🔥 惊人的效率:与M3-Agent相比,实现了12.1倍的加速和2.6倍的GPU内存减少,并且无论视频长度如何,延迟几乎保持不变(约2.3秒)。
- 📈 SOTA性能:在VideoMME-long、LVBench和HippoVlog上实现了64.8%的平均准确率。
- 🛠️ 即插即用:作为一个基础记忆系统,可无缝提升现有MLLM(例如,Qwen2.5-VL、Qwen3-VL、Gemini-2.0-Flash)的性能。
代码、模型和数据集可在我们的仓库中获取!