Video-R1
PulseAugur coverage of Video-R1 — every cluster mentioning Video-R1 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的VST范式使VideoLLMs能够同时观看和思考
研究人员推出了一种名为视频流思考(VST)的新范式,旨在使在线视频大语言模型(VideoLLMs)能够同时处理和推理视频内容。该方法通过将逻辑推理与传入的视频流相结合,旨在提高实时理解和认知能力,从而降低延迟。VST框架包括一个包含VST-SFT的后训练管道,用于将离线模型适应流式推理,以及通过自我探索进行端到端改进的VST-RL。在StreamingBench和OVO-Bench等基准上的评估证明了VST在各种视频理解任务中的效率和强大性能。
-
VideoLatent MLLM 通过高效的潜在自强制增强视频推理能力
研究人员开发了 VideoLatent,这是一种新颖的多模态大语言模型(MLLM),旨在增强视频理解和推理能力。与需要大量标注或计算成本高昂的先前方法不同,VideoLatent 采用了一种新颖的潜在自强制训练范式。该方法包括潜在对齐和多样性目标,仅依赖标准的视频-问答三元组,使其更具可扩展性和效率。在 14 个基准测试上的实验表明,VideoLatent 的性能优于现有模型,与 Video-R1 等模型相比,在训练和推理开销方面有显著降低。
-
新方法通过压缩内容和改进时序推理来提升视频问答能力
研究人员开发了新的方法来改进长视频问答(VQA)。其中一种方法 MemoryCard 将视频内容压缩成面向主题的“记忆卡”,以更好地捕捉事件级语义,并将准确率提高高达 21.8%。另一种方法 TLG 通过重建视频时间线并将问题路由到专用模型来专注于时序逻辑推理,在正式的时序逻辑推理基准测试中实现了 24.5 的绝对准确率提升。另一项关于隐式视频问答的研究表明,对于当前基准测试而言,感知能力比高级推理技术更关键。