研究人员开发了 VideoXAgent,这是一个用于理解长视频的在线代理工具集。该系统可以规划任务,按需使用 VLMs、OCR 和 ASR 等专业工具,并聚合证据来回答查询。VideoXAgent 旨在克服将整个视频打包到单个上下文窗口中带来的上下文遗忘和高计算成本的限制。与密集打包基线相比,它在 Video-MME-Long 和 MINERVA 等基准测试中表现出具有竞争力的性能,即使上下文占用空间显著减小。 AI
影响 这种方法可以实现对长视频内容更有效、更深入的分析,影响依赖视频数据处理的各个领域。
排序理由 该条目是一篇研究论文,详细介绍了一种新的长视频理解系统。[lever_c_demoted from research: ic=1 ai=1.0]
- facial recognition system
- Hugging Face
- LongVideoBench-Long
- LVBench
- MINERVA
- optical character recognition
- Video-MME-Long
- VideoXAgent
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →