PulseAugur
中
实时 06:01:29
实体 Video-MME

Video-MME

PulseAugur coverage of Video-MME — every cluster mentioning Video-MME across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
21
90 天内 21
发布 · 30天
0
90 天内 0
论文 · 30天
21
90 天内 21
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 23 条
  1. TOOL · CL_284858 ·

    新的EC-RAG框架通过事件链增强长视频理解能力

    研究人员推出了一种新颖的EC-RAG框架,旨在通过将内容组织成显式的事件链来改进长视频的理解。该方法将视频划分为语义连贯的片段,用多模态信号表示每个片段,并链接它们以保留时间顺序和事件间关系。EC-RAG提供事件级别的抽象,比帧级别检索更可靠的定位,结构化的多模态融合以更好地利用语音、文本和视觉线索,并且无需额外训练即可与现有的视频语言大模型即插即用。在Video-MME、MLVU和LongVideoBench上的实验表明,这种以事件…

  2. TOOL · CL_280541 ·

    新方法通过分析反事实视图来提升视频LLM推理能力

    研究人员推出了一种新颖的视频多模态大语言模型(MLLM)训练后方法——行为包优化(BPO)。BPO通过计算反事实视图输出包的奖励,解决了MLLM依赖外观和语言先验而非时间证据的问题。该方法鼓励模型在发生无关干预时保持稳定,在关键证据被移除时保持敏感,并在没有证据时弃权。将其应用于Qwen2.5-7B-Instruct后,BPO显著提高了在TempCompass、MVBench和NExT-QA等基准测试上的准确性,并在Video-MME…

  3. RESEARCH · CL_270796 ·

    新框架增强AI视频理解和多视频推理能力 · 跟踪3个来源

    研究人员开发了用于改进视频理解智能体的新框架。Video-RSI 通过让智能体修改自身的工具链以更好地从视频中获取和使用证据,专注于递归式自我改进,从而提高了准确性和效率。VidHarness 使用蒙特卡洛树搜索和不确定性感知验证来自动化长视频理解的工具链设计,在多个基准测试中表现优于现有方法。此外,SAMA 框架和 MVX-Bench 基准测试解决了多视频推理的局限性,使智能体能够跨多个视频进行结构化推理,并优于强大的基线。

  4. TOOL · CL_219229 ·

    RT-NeuS 框架通过自适应时间验证加速视频问答

    研究人员开发了 RT-NeuS,一个旨在显著加速长视频问答(LVQA)过程的新型框架。传统的视觉语言模型(VLMs)由于固定的帧预算,在处理长视频的时间复杂性方面存在困难,而现有的神经符号方法虽然更准确,但速度却非常慢。RT-NeuS 通过采用自适应采样来识别关键帧,并进行批处理命题检测以有效处理时间逻辑规范,从而将 NVIDIA H200 GPU 上的推理延迟降低高达 13 倍,同时保持高精度。

  5. RESEARCH · CL_216170 ·

    新的基准和架构推动了 MLLMs 中的长视频理解

    研究人员正在开发新的方法来改进多模态大语言模型 (MLLMs) 理解长视频的方式。一种方法 MoTE 使用任务专家混合 (Mixture of Task Experts) 将计算路由到特定任务模块,从而提高视频语言任务的准确性和效率。另一个重点是优化模型如何从长视频中提取相关信息,例如 VideoHarness-RSI 通过递归搜索有效的上下文构建程序,以及 TRACE 专注于证据支持的答案。此外,还推出了 Video-IFBench…

  6. RESEARCH · CL_206606 ·

    新框架应对大型视觉语言模型中的视频推理挑战

    研究人员开发了新的框架来应对大型视觉语言模型(LVLMs)在视频推理方面的挑战。一种方法是“证据链”(Chain of Evidence, CoE),它通过使用轻量级的接地模块和证据锚定协议,将接地与推理解耦,以提高效率并减少幻觉。另一种方法是GroundFormer,它通过在定位之前根据问题语义对视频特征进行条件化,将问题意图与时间证据相结合,旨在改进问题区分性接地。这两种方法在各种视频理解基准测试中都展示了最先进的性能。

  7. TOOL · CL_206565 ·

    新的MEDR方法提高了多模态LLM视频处理效率

    研究人员开发了一种名为MEDR的新型查询无关帧选择方法,旨在提高多模态大型语言模型处理长视频时的效率。与需要为每个问题选择帧的查询相关方法不同,MEDR创建了一个固定的帧集,可跨多个查询重复使用。该方法利用多信号事件建模和动态重评分来识别超越简单均匀采样的信息帧,在Video-MME和LongVideoBench等基准测试中准确率提高了多达1.23%。

  8. RESEARCH · CL_206635 ·

    StreamOPD 通过新的训练后技术增强流式视频理解能力

    研究人员推出了一种名为 StreamOPD 的新颖训练后技术,旨在增强流式视频理解能力。该方法利用具有可验证奖励的 on-policy distillation 和时空线索门控机制,在无需额外推理时间内存的情况下,实现了接近教师模型的性能。StreamOPD 在 StreamingBench 和 OVO-Bench 等基准测试中表现出显著的改进,为开源流式视频研究提供了一种透明且可复现的方法。

  9. RESEARCH · CL_206315 ·

    新的VideoGAIA基准挑战高级AI助手进行多轮视频理解

    研究人员推出了VideoGAIA,这是一个旨在评估多模态大语言模型(MLLMs)在智能体视频理解方面能力的新基准。与侧重于单轮问答的先前基准不同,VideoGAIA要求模型进行多轮交互、利用外部工具并整合信息。这种先进的方法是必要的,因为目前领先的模型在更简单的任务上已接近饱和,在Video-MME等基准上准确率超过90%。初步评估表明,即使是GPT-5.5和Kimi-K3等前沿模型在VideoGAIA上也表现不佳,准确率低于60%,…

  10. RESEARCH · CL_193073 ·

    新的LAVE框架通过重用潜在视觉证据增强视频代理规划能力

    研究人员推出了一种新颖的LAVE框架,旨在增强视频工具使用代理的规划能力。LAVE通过允许代理重用先前工具调用的潜在视觉证据,而不是仅仅依赖文本摘要,来解决“工具观察瓶颈”问题。这种双通道接口保留了文本轨迹和非语言化的视觉更新,使代理能够整合相关且先前未被语言化的证据。在Video-MME等基准测试上的实验表明,LAVE在可比帧预算下显著提高了性能,整体得分提高了3.76分。

  11. RESEARCH · CL_183204 ·

    新框架提升AI长视频理解效率

    研究人员开发了两个新框架EcoFrame和EviSelect,旨在提高大型语言模型处理长视频理解的效率。EcoFrame采用一种无需训练的方法,根据模型的输出不确定性和注意力模式来调整帧选择过程,实现了显著的加速,并且准确性与现有方法相当。EviSelect则采用一种基于目标模型内部注意力的动态视觉选择方法,通过自适应地调整采样率和空间分辨率,同时优化准确性和效率。

  12. TOOL · CL_181006 ·

    新的GCR框架通过优化帧选择来增强长视频问答

    研究人员推出了一种新颖的GCR框架,旨在通过在有限预算内优化相关帧的选择来改进长视频问答。这种无需训练的方法通过防止帧聚类并增强文本和视觉证据之间的对齐来解决现有方法的局限性。GCR通过三个阶段的过程实现这一目标:Ground(定位)、Cover(覆盖)和Refine(精炼),通过选择与查询相关的锚点、用互补的视觉信息对其进行补充,并重新审视被遗漏的区域以获取潜在的更大价值来共同策划证据。在LongVideoBench和Video-M…

  13. TOOL · CL_169829 ·

    FORGE 方法在无需重新训练的情况下增强了 LLM 的视频理解能力

    研究人员开发了 FORGE,一种用于提高多模态大语言模型 (MLLM) 长视频理解能力的新颖方法。这种模型无关的技术在推理时运行,无需额外的训练。FORGE 通过在 MLLM 的嵌入空间中创建查询条件几何来实现,有效平衡了帧选择的相关性和多样性。在 Video-MME 和 LongVideoBench 等基准测试上的实验表明,在各种 MLLM 中,关键帧选择和问答准确性均得到显著提高。

  14. TOOL · CL_169822 ·

    新的LENS框架通过自适应关键帧采样增强AI视频理解能力

    研究人员开发了LENS,一个旨在改进多模态大语言模型(MLLMs)处理长视频方式的新框架。LENS通过自适应采样关键帧来解决有限上下文窗口的挑战。它动态地平衡空间细节(关注帧内的相关区域)和时间覆盖(跨多个帧聚合信息)。这种方法旨在通过捕捉高保真细节和长程上下文来增强模型理解视频的能力,在视频基准测试中表现优于先前的方法。

  15. TOOL · CL_152094 ·

    新的VideoTreeSearch框架实现了用于长视频问答的自纠错智能体

    研究人员推出了一种新颖的框架VideoTreeSearch (VTS),该框架通过将长视频问答任务视为自适应时间树上的自纠错搜索来改进该任务。与先前使用单一操作来缩小视频片段范围的方法不同,VTS采用了四种操作——放大(zoom_in)、缩小(zoom_out)、移动(shift)和回答(answer)——以实现显式的回溯和错误恢复。这种分层搜索方法通过轨迹合成管道进行训练,并通过准确性奖励进行强化,在CG-Bench和Haystac…

  16. TOOL · CL_152069 ·

    新方法高效选择视频帧以供MLLM分析

    研究人员开发了一种名为DAFS(动态注意力预算感知帧选择)的新颖方法,用于从长视频中高效选择相关帧,以供多模态大语言模型(MLLM)进行分析。这种无需训练的方法利用MLLM内的跨模态注意力来识别帧证据,而无需预先理解视频内容。通过将注意力分数转换为相关性指标,DAFS即使使用较小的MLLM选择器也能运行,并通过动态规划有效管理令牌预算,在Video-MME等基准测试中优于均匀采样和先前基于训练的方法。

  17. TOOL · CL_128730 ·

    新的DELTAVID框架提升视频大语言模型的细粒度感知能力

    研究人员推出了一种新颖的DELTAVID框架,旨在提升视频多模态大语言模型(Video MLLMs)的细粒度时空感知能力。该方法将识别相似视频之间差异的任务转化为可训练信号,使模型能够精确识别局部变化、时间边界和空间证据。该框架得到了DELTAVID-10K和DELTAVID-Bench数据集的支持,这些数据集旨在促进这些感知技能的可扩展训练和可靠评估。实验表明,DELTAVID显著提升了跨视频差异理解的性能,并将这种改进的局部证据推…

  18. RESEARCH · CL_123289 ·

    新的ReQuest管道增强了长视频问答的LLM能力

    研究人员开发了ReQuest,这是一个旨在提高长视频问答能力的新型管道。该方法通过采用一种由不确定性驱动的、适应性问题选择关键帧的过程,解决了多模态大型语言模型中固定输入令牌预算的限制。ReQuest集成了一个轻量级选择器、一个根据模型不确定性触发额外推理的路由机制,以及一种自适应非最大抑制技术来选择相关且时间上多样化的帧。该系统作为一个即插即用解决方案,在Video-MME、MLVU和LongVideoBench等基准测试上提高了性…

  19. TOOL · CL_115672 ·

    HiMu框架通过分层帧选择增强长视频问答能力

    研究人员开发了HiMu,一个旨在改进长视频问答任务帧选择的新型框架。该无训练系统将复杂查询分解为分层逻辑树,利用专门的视觉和音频处理专家。HiMu的方法使用模糊逻辑对专家信号进行归一化和组合,以保持时间顺序和模态绑定,在Video-MME和LongVideoBench等基准测试中表现优于先前的方法。

  20. RESEARCH · CL_84536 ·

    InternVideo3 增强视频理解能力,引入新推理框架

    研究人员推出了 InternVideo3,一个旨在提升长时视频理解和代理能力的新框架。该系统利用多模态上下文推理(MCR)将视频内容处理为不断演变的上下文,从而在延长时间内进行证据累积和验证。为了保持效率,InternVideo3 采用了多模态多头潜在注意力(M^2LA),该机制在不丢失 token 信息的情况下压缩键值缓存状态。该模型在各种视频理解基准测试中表现出色,并已被改编成一个能够进行证据支撑检索任务的视频代理。