研究人员开发了一个名为 Caption-once, Frames-on-Demand (CFD) 的新框架,旨在实现边缘设备上高效的长视频理解。该系统利用双轨道叙事索引,结合事件级故事骨架和剪辑级微日志,以减少重新字幕的需求。云端多模态大语言模型 (MLLM) 然后使用视觉需求路由器 (Visual-Need Router) 为感知查询选择性地检索关键帧,同时将时间结构问题保留在语言域内,从而优化计算和带宽使用。 AI
影响 这种方法可以显著提高在资源受限设备上分析长视频内容的可行性。
排序理由 该条目描述了一篇学术论文中提出的新颖框架和方法论。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Caption-once, Frames-on-Demand: Visual-Need Routing for Budget-Aware Agentic Long Video Understanding
- Hugging Face
- multimodal large language model
- Visual-Need Router
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →