实体
VideoHolmes
VideoHolmes
PulseAugur coverage of VideoHolmes — every cluster mentioning VideoHolmes across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的VST范式使VideoLLMs能够同时观看和思考
研究人员推出了一种名为视频流思考(VST)的新范式,旨在使在线视频大语言模型(VideoLLMs)能够同时处理和推理视频内容。该方法通过将逻辑推理与传入的视频流相结合,旨在提高实时理解和认知能力,从而降低延迟。VST框架包括一个包含VST-SFT的后训练管道,用于将离线模型适应流式推理,以及通过自我探索进行端到端改进的VST-RL。在StreamingBench和OVO-Bench等基准上的评估证明了VST在各种视频理解任务中的效率和强大性能。
-
新的DELTAVID框架提升视频大语言模型的细粒度感知能力
研究人员推出了一种新颖的DELTAVID框架,旨在提升视频多模态大语言模型(Video MLLMs)的细粒度时空感知能力。该方法将识别相似视频之间差异的任务转化为可训练信号,使模型能够精确识别局部变化、时间边界和空间证据。该框架得到了DELTAVID-10K和DELTAVID-Bench数据集的支持,这些数据集旨在促进这些感知技能的可扩展训练和可靠评估。实验表明,DELTAVID显著提升了跨视频差异理解的性能,并将这种改进的局部证据推…