研究人员推出了一种新颖的框架 ObjectStream,旨在通过使用潜在对象作为记忆锚点来增强流视频理解。这种无需训练的方法直接从冻结的 Video-LLM 表示中提取空间连贯的潜在对象,并将它们跨帧链接起来,在有限的内存预算内维护持久的历史记录。ObjectStream 保留了对象的历史、变化和最近的视觉上下文,使 Video-LLM 能够在不改变基础模型的情况下推理对象的身份、交互和状态变化。实验表明,在性能和效率方面都有显著提高,ObjectStream 在 OVO-Bench 实时视觉感知基准测试中将 Qwen2.5-VL-7B 的性能提高了 10.0 个点,同时将内存使用量和首次字节时间减少了约 50%。 AI
影响 增强了 Video-LLM 在实时分析和长视频理解方面的能力,可能改进监控、内容审核和自动视频摘要等应用。
排序理由 这是一篇描述视频理解新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Litmaps
- ObjectStream
- OVO-Bench Real-Time Visual Perception
- Qwen2.5-VL-7B
- ScienceCast
- scite Smart Citations
- Video-LLM
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →