LongVideoBench
PulseAugur coverage of LongVideoBench — every cluster mentioning LongVideoBench across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新的EC-RAG框架通过事件链增强长视频理解能力
研究人员推出了一种新颖的EC-RAG框架,旨在通过将内容组织成显式的事件链来改进长视频的理解。该方法将视频划分为语义连贯的片段,用多模态信号表示每个片段,并链接它们以保留时间顺序和事件间关系。EC-RAG提供事件级别的抽象,比帧级别检索更可靠的定位,结构化的多模态融合以更好地利用语音、文本和视觉线索,并且无需额外训练即可与现有的视频语言大模型即插即用。在Video-MME、MLVU和LongVideoBench上的实验表明,这种以事件…
-
新方法通过分析反事实视图来提升视频LLM推理能力
研究人员推出了一种新颖的视频多模态大语言模型(MLLM)训练后方法——行为包优化(BPO)。BPO通过计算反事实视图输出包的奖励,解决了MLLM依赖外观和语言先验而非时间证据的问题。该方法鼓励模型在发生无关干预时保持稳定,在关键证据被移除时保持敏感,并在没有证据时弃权。将其应用于Qwen2.5-7B-Instruct后,BPO显著提高了在TempCompass、MVBench和NExT-QA等基准测试上的准确性,并在Video-MME…
-
新框架增强AI视频理解和多视频推理能力 · 跟踪3个来源
研究人员开发了用于改进视频理解智能体的新框架。Video-RSI 通过让智能体修改自身的工具链以更好地从视频中获取和使用证据,专注于递归式自我改进,从而提高了准确性和效率。VidHarness 使用蒙特卡洛树搜索和不确定性感知验证来自动化长视频理解的工具链设计,在多个基准测试中表现优于现有方法。此外,SAMA 框架和 MVX-Bench 基准测试解决了多视频推理的局限性,使智能体能够跨多个视频进行结构化推理,并优于强大的基线。
-
新方法提升多模态大语言模型处理长视频的效率 · 追踪3个来源
研究人员正在开发新方法,以提高多模态大语言模型(MLLMs)处理长视频时的效率和准确性。VideoMM提出了一种自适应方法,将语义过滤与详细推理分开,使用经济高效的代理进行初步选择,然后将相关区域投影到高保真标记。CodecSight利用视频编解码器信号指导推理,减少计算量并提高流式传输能力,而无需模型特定的训练。Video-HolmesV2引入了一个基准和框架,强调深度视听耦合,并要求模型用精确的时空证据来证明答案,解决了以视觉为中…
-
新方法利用合成数据和时间分析增强AI对长视频的理解 · 跟踪4个来源
研究人员正在开发新方法,以改进大型多模态模型理解长视频的方式。一种名为SynMulti的方法使用合成数据生成管道,为对象计数和问答等任务创建无限的带注释视频数据,表明合成数据可以很好地泛化到现实世界场景。其他方法,如RIDGE和Temporal Tree of Thought (T^3),通过分析视频中的时间信号和分层结构来专注于高效帧选择,以更好地捕捉关键时刻和上下文。STITCH提供了一种无需训练的方法,将视频分割成有意义的时间块…
-
RT-NeuS 框架通过自适应时间验证加速视频问答
研究人员开发了 RT-NeuS,一个旨在显著加速长视频问答(LVQA)过程的新型框架。传统的视觉语言模型(VLMs)由于固定的帧预算,在处理长视频的时间复杂性方面存在困难,而现有的神经符号方法虽然更准确,但速度却非常慢。RT-NeuS 通过采用自适应采样来识别关键帧,并进行批处理命题检测以有效处理时间逻辑规范,从而将 NVIDIA H200 GPU 上的推理延迟降低高达 13 倍,同时保持高精度。
-
新的 DAGC 方法通过解耦时间粒度加速长视频 RAG
研究人员开发了一种名为密度感知图构建 (DAGC) 的新方法,以提高长视频检索增强生成 (RAG) 的效率。DAGC 将检索索引的时间粒度与细粒度证据解耦,创建了一个更紧凑的索引,从而在保持准确性的同时加快了处理速度。实验表明,DAGC 可以将索引大小减半,并将处理速度提高高达 1.7 倍,同时问答性能损失极小。
-
新研究优化长视频多模态大语言模型的视觉标记处理
研究人员正在探索优化多模态大语言模型(MLLMs)处理视觉信息的方法,尤其是在处理长视频方面。多篇论文介绍了用于选择、压缩和修剪视觉标记以提高效率和准确性的技术。一项研究强调,帧选择是最关键的因素,经典的算法如正交匹配追踪(Orthogonal Matching Pursuit)与新方法相比表现相当。其他方法则侧重于自适应标记化、基于注意力熵的秩保持修剪以及为持续学习动态生成标记。
-
新的基准和架构推动了 MLLMs 中的长视频理解
研究人员正在开发新的方法来改进多模态大语言模型 (MLLMs) 理解长视频的方式。一种方法 MoTE 使用任务专家混合 (Mixture of Task Experts) 将计算路由到特定任务模块,从而提高视频语言任务的准确性和效率。另一个重点是优化模型如何从长视频中提取相关信息,例如 VideoHarness-RSI 通过递归搜索有效的上下文构建程序,以及 TRACE 专注于证据支持的答案。此外,还推出了 Video-IFBench…
-
新的MEDR方法提高了多模态LLM视频处理效率
研究人员开发了一种名为MEDR的新型查询无关帧选择方法,旨在提高多模态大型语言模型处理长视频时的效率。与需要为每个问题选择帧的查询相关方法不同,MEDR创建了一个固定的帧集,可跨多个查询重复使用。该方法利用多信号事件建模和动态重评分来识别超越简单均匀采样的信息帧,在Video-MME和LongVideoBench等基准测试中准确率提高了多达1.23%。
-
新的LAVE框架通过重用潜在视觉证据增强视频代理规划能力
研究人员推出了一种新颖的LAVE框架,旨在增强视频工具使用代理的规划能力。LAVE通过允许代理重用先前工具调用的潜在视觉证据,而不是仅仅依赖文本摘要,来解决“工具观察瓶颈”问题。这种双通道接口保留了文本轨迹和非语言化的视觉更新,使代理能够整合相关且先前未被语言化的证据。在Video-MME等基准测试上的实验表明,LAVE在可比帧预算下显著提高了性能,整体得分提高了3.76分。
-
新框架提升AI长视频理解效率
研究人员开发了两个新框架EcoFrame和EviSelect,旨在提高大型语言模型处理长视频理解的效率。EcoFrame采用一种无需训练的方法,根据模型的输出不确定性和注意力模式来调整帧选择过程,实现了显著的加速,并且准确性与现有方法相当。EviSelect则采用一种基于目标模型内部注意力的动态视觉选择方法,通过自适应地调整采样率和空间分辨率,同时优化准确性和效率。
-
新的GCR框架通过优化帧选择来增强长视频问答
研究人员推出了一种新颖的GCR框架,旨在通过在有限预算内优化相关帧的选择来改进长视频问答。这种无需训练的方法通过防止帧聚类并增强文本和视觉证据之间的对齐来解决现有方法的局限性。GCR通过三个阶段的过程实现这一目标:Ground(定位)、Cover(覆盖)和Refine(精炼),通过选择与查询相关的锚点、用互补的视觉信息对其进行补充,并重新审视被遗漏的区域以获取潜在的更大价值来共同策划证据。在LongVideoBench和Video-M…
-
FORGE 方法在无需重新训练的情况下增强了 LLM 的视频理解能力
研究人员开发了 FORGE,一种用于提高多模态大语言模型 (MLLM) 长视频理解能力的新颖方法。这种模型无关的技术在推理时运行,无需额外的训练。FORGE 通过在 MLLM 的嵌入空间中创建查询条件几何来实现,有效平衡了帧选择的相关性和多样性。在 Video-MME 和 LongVideoBench 等基准测试上的实验表明,在各种 MLLM 中,关键帧选择和问答准确性均得到显著提高。
-
新框架通过自适应帧处理提升 MLLM 长视频理解能力 · 跟踪 3 个来源
三篇新研究论文介绍了增强多模态大语言模型(MLLM)长视频理解能力的新型框架。这些方法旨在通过自适应地选择和处理相关视频帧来克服固定上下文窗口的限制。ReMem 专注于解析问题的时序粒度并将帧与查询语义对齐,而 CADER 则动态推理证据置信度,绕过对简单问题的不必要处理。GenEvA 将选定的帧聚合为潜在证据表示,以最小的开销提高性能。
-
新的 VIBE 方法在无标注情况下改进了视频到文本模型的摘要
研究人员开发了 VIBE,一种用于视频到文本模型的无标注评估方法。VIBE 根据摘要与视觉内容的关联性及其在下游任务中的效用进行评估,旨在克服当前视觉语言模型输出冗长和重复的局限性。人类研究表明,使用 VIBE 选择的摘要与标准的 VLM 摘要或原始视频相比,任务准确率显著提高了 61.23%,响应时间缩短了 75.77%。
-
新的DELTAVID框架提升视频大语言模型的细粒度感知能力
研究人员推出了一种新颖的DELTAVID框架,旨在提升视频多模态大语言模型(Video MLLMs)的细粒度时空感知能力。该方法将识别相似视频之间差异的任务转化为可训练信号,使模型能够精确识别局部变化、时间边界和空间证据。该框架得到了DELTAVID-10K和DELTAVID-Bench数据集的支持,这些数据集旨在促进这些感知技能的可扩展训练和可靠评估。实验表明,DELTAVID显著提升了跨视频差异理解的性能,并将这种改进的局部证据推…
-
新的ReQuest管道增强了长视频问答的LLM能力
研究人员开发了ReQuest,这是一个旨在提高长视频问答能力的新型管道。该方法通过采用一种由不确定性驱动的、适应性问题选择关键帧的过程,解决了多模态大型语言模型中固定输入令牌预算的限制。ReQuest集成了一个轻量级选择器、一个根据模型不确定性触发额外推理的路由机制,以及一种自适应非最大抑制技术来选择相关且时间上多样化的帧。该系统作为一个即插即用解决方案,在Video-MME、MLVU和LongVideoBench等基准测试上提高了性…
-
新的QCA框架通过优化关键帧选择来增强长视频理解能力
研究人员开发了一个名为QCA的新框架,用于在长视频中选择关键帧以提高视频理解能力。该方法是查询和内容感知的,意味着它优先考虑与特定查询相关且能捕捉重要内容变化的帧。QCA动态地为不同的视频片段分配关键帧,并选择最大化多样性同时保持语义相关性的帧。该框架无需额外训练,即可集成到现有的Video-LLMs中,并在LongVideoBench等基准测试中展现出最先进的性能,其关键帧选择效率优于GPT-4o。
-
新的STAR框架提升LLM视频分析能力
研究人员开发了一个时空推理框架(STAR),以增强多模态大语言模型(MLLMs)的视频问答能力。STAR为GPT-4o等模型配备了视频工具包和战略调度系统,以改进时空推理。该方法已显示出显著的进步,包括在VideoMME基准上提高了8.2%,在LongVideoBench上提高了4.6%,为更智能的视频分析助手铺平了道路。