OVO-Bench
PulseAugur coverage of OVO-Bench — every cluster mentioning OVO-Bench across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的VST范式使VideoLLMs能够同时观看和思考
研究人员推出了一种名为视频流思考(VST)的新范式,旨在使在线视频大语言模型(VideoLLMs)能够同时处理和推理视频内容。该方法通过将逻辑推理与传入的视频流相结合,旨在提高实时理解和认知能力,从而降低延迟。VST框架包括一个包含VST-SFT的后训练管道,用于将离线模型适应流式推理,以及通过自我探索进行端到端改进的VST-RL。在StreamingBench和OVO-Bench等基准上的评估证明了VST在各种视频理解任务中的效率和强大性能。
-
FOLIO系统通过聚焦语义记忆增强流媒体视频理解能力
研究人员推出FOLIO,一个新颖的、无需训练的系统,用于理解流媒体视频。FOLIO通过智能压缩和保留信息,解决了连续视频流中无限内存成本的挑战。它优先为关键实体和动作保留详细记录,同时保持周围上下文的紧凑性,利用动态焦点状态和混合检索机制进行高效查询。该方法在OVO-Bench和StreamingBench等基准测试中取得了最先进的性能,同时显著降低了内存需求。
-
SelectStream 框架通过选择性内存分配增强流媒体视频 AI
研究人员开发了 SelectStream,一个用于流媒体视频理解模型的新颖框架,该框架选择性地分配内存,以解决在固定计算预算下处理连续视频数据的挑战。与之前不加区分地注入历史记录的方法不同,SelectStream 使用条件查询的证据预算来优先考虑当前场景感知。该框架采用由惊喜驱动的窗口化、保留优先级的巩固以及图推理来管理内存,在 StreamingBench 和 OVO-Bench 等基准测试中取得了强劲的性能。