VideoLLMs
PulseAugur coverage of VideoLLMs — every cluster mentioning VideoLLMs across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
StateTrace框架增强了VideoLLM对不可见对象的推理能力 · 已追踪2个来源
研究人员开发了StateTrace,一个新颖的面向对象的框架,旨在提高VideoLLM在长视频场景下的时空推理能力,特别是在物体可能暂时不可见的情况下。该框架构建了一个时空状态记忆来追踪物体轨迹和状态转换,使模型即使在物体不可直接观察时也能推断其状态。为了评估这一点,创建了一个名为HSR-Bench的新基准,包含超过1400个视频问答样本。实验表明,StateTrace显著提升了各种VideoLLM的性能,尤其将VideoLLaMA3…
-
新的PoisonVID攻击绕过了视频大语言模型的安全功能
研究人员开发了一种名为PoisonVID的新型攻击,可以绕过视频大语言模型(VideoLLMs)的安全措施。这些模型通过采样关键帧来审核用户生成的内容,但PoisonVID可以操纵这个采样过程。该攻击通过微妙地改变有害视频帧,使得VideoLLM的提示引导采样机制无法识别它们,从而有效地抑制安全警报。该方法在各种VideoLLM架构和有害内容类别中都显示出高成功率,甚至能够抵御多种防御机制。
-
新的GSTEP框架修剪VideoLLM的token以提高效率
研究人员开发了GSTEP,一个旨在提高视频大型语言模型(VideoLLMs)效率的新型修剪框架。与先前在片段内局部修剪token的方法不同,GSTEP将视频建模为连续的时空信息流。它通过结合时空信息来计算token级别的密度,从而实现全局token采样,平衡信息密度和覆盖范围。实验表明,GSTEP可以在保持高性能的同时修剪大部分视觉token,从而在不同模型和设置下改善准确性-效率的权衡。
-
新数据集VideoNorms测试视频大语言模型的文化意识
研究人员开发了VideoNorms,一个旨在评估视频大语言模型(VideoLLMs)文化意识的新数据集。该数据集包含来自美国和中国热门电视剧的3000多条人工判断,侧重于预测文化规范的遵守或违反情况以及识别支持证据。研究结果表明,当前VideoLLMs在处理中国文化规范方面的表现不如美国文化规范,并且在识别非语言证据方面更加困难。研究还指出,虽然视频模态至关重要,但仅仅扩大模型规模并不一定能提高在此任务上的性能。
-
新的VST范式使VideoLLMs能够同时观看和思考
研究人员推出了一种名为视频流思考(VST)的新范式,旨在使在线视频大语言模型(VideoLLMs)能够同时处理和推理视频内容。该方法通过将逻辑推理与传入的视频流相结合,旨在提高实时理解和认知能力,从而降低延迟。VST框架包括一个包含VST-SFT的后训练管道,用于将离线模型适应流式推理,以及通过自我探索进行端到端改进的VST-RL。在StreamingBench和OVO-Bench等基准上的评估证明了VST在各种视频理解任务中的效率和强大性能。
-
新基准NeMo挑战视频LLM的时序理解能力
研究人员推出了一种名为NeMoBench的新型任务和基准,旨在评估视频大语言模型(VideoLLMs)的时序理解能力。该任务借鉴了“大海捞针”测试,专注于检索式长上下文回忆和时序定位。NeMoBench包含31,000多个问答对,来源于数千个视频,并采用可扩展的自动化流程确保其持续更新。对20个最先进模型的实验揭示了它们在时序理解方面的当前优势和劣势。