PulseAugur
实时 04:30:04
实体 Video-MME

Video-MME

PulseAugur coverage of Video-MME — every cluster mentioning Video-MME across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 18
发布 · 30天
0
90 天内 0
论文 · 30天
9
90 天内 17
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/1 页 · 共 18 条
  1. RESEARCH · CL_206606 ·

    新框架应对大型视觉语言模型中的视频推理挑战

    研究人员开发了新的框架来应对大型视觉语言模型(LVLMs)在视频推理方面的挑战。一种方法是“证据链”(Chain of Evidence, CoE),它通过使用轻量级的接地模块和证据锚定协议,将接地与推理解耦,以提高效率并减少幻觉。另一种方法是GroundFormer,它通过在定位之前根据问题语义对视频特征进行条件化,将问题意图与时间证据相结合,旨在改进问题区分性接地。这两种方法在各种视频理解基准测试中都展示了最先进的性能。

  2. TOOL · CL_206565 ·

    新的MEDR方法提高了多模态LLM视频处理效率

    研究人员开发了一种名为MEDR的新型查询无关帧选择方法,旨在提高多模态大型语言模型处理长视频时的效率。与需要为每个问题选择帧的查询相关方法不同,MEDR创建了一个固定的帧集,可跨多个查询重复使用。该方法利用多信号事件建模和动态重评分来识别超越简单均匀采样的信息帧,在Video-MME和LongVideoBench等基准测试中准确率提高了多达1.23%。

  3. RESEARCH · CL_206635 ·

    StreamOPD 通过新的训练后技术增强流式视频理解能力

    研究人员推出了一种名为 StreamOPD 的新颖训练后技术,旨在增强流式视频理解能力。该方法利用具有可验证奖励的 on-policy distillation 和时空线索门控机制,在无需额外推理时间内存的情况下,实现了接近教师模型的性能。StreamOPD 在 StreamingBench 和 OVO-Bench 等基准测试中表现出显著的改进,为开源流式视频研究提供了一种透明且可复现的方法。

  4. RESEARCH · CL_206315 ·

    新的VideoGAIA基准挑战高级AI助手进行多轮视频理解

    研究人员推出了VideoGAIA,这是一个旨在评估多模态大语言模型(MLLMs)在智能体视频理解方面能力的新基准。与侧重于单轮问答的先前基准不同,VideoGAIA要求模型进行多轮交互、利用外部工具并整合信息。这种先进的方法是必要的,因为目前领先的模型在更简单的任务上已接近饱和,在Video-MME等基准上准确率超过90%。初步评估表明,即使是GPT-5.5和Kimi-K3等前沿模型在VideoGAIA上也表现不佳,准确率低于60%,…

  5. RESEARCH · CL_193073 ·

    新的LAVE框架通过重用潜在视觉证据增强视频代理规划能力

    研究人员推出了一种新颖的LAVE框架,旨在增强视频工具使用代理的规划能力。LAVE通过允许代理重用先前工具调用的潜在视觉证据,而不是仅仅依赖文本摘要,来解决“工具观察瓶颈”问题。这种双通道接口保留了文本轨迹和非语言化的视觉更新,使代理能够整合相关且先前未被语言化的证据。在Video-MME等基准测试上的实验表明,LAVE在可比帧预算下显著提高了性能,整体得分提高了3.76分。

  6. RESEARCH · CL_183204 ·

    新框架提升AI长视频理解效率

    研究人员开发了两个新框架EcoFrame和EviSelect,旨在提高大型语言模型处理长视频理解的效率。EcoFrame采用一种无需训练的方法,根据模型的输出不确定性和注意力模式来调整帧选择过程,实现了显著的加速,并且准确性与现有方法相当。EviSelect则采用一种基于目标模型内部注意力的动态视觉选择方法,通过自适应地调整采样率和空间分辨率,同时优化准确性和效率。

  7. TOOL · CL_181006 ·

    新的GCR框架通过优化帧选择来增强长视频问答

    研究人员推出了一种新颖的GCR框架,旨在通过在有限预算内优化相关帧的选择来改进长视频问答。这种无需训练的方法通过防止帧聚类并增强文本和视觉证据之间的对齐来解决现有方法的局限性。GCR通过三个阶段的过程实现这一目标:Ground(定位)、Cover(覆盖)和Refine(精炼),通过选择与查询相关的锚点、用互补的视觉信息对其进行补充,并重新审视被遗漏的区域以获取潜在的更大价值来共同策划证据。在LongVideoBench和Video-M…

  8. TOOL · CL_169829 ·

    FORGE 方法在无需重新训练的情况下增强了 LLM 的视频理解能力

    研究人员开发了 FORGE,一种用于提高多模态大语言模型 (MLLM) 长视频理解能力的新颖方法。这种模型无关的技术在推理时运行,无需额外的训练。FORGE 通过在 MLLM 的嵌入空间中创建查询条件几何来实现,有效平衡了帧选择的相关性和多样性。在 Video-MME 和 LongVideoBench 等基准测试上的实验表明,在各种 MLLM 中,关键帧选择和问答准确性均得到显著提高。

  9. TOOL · CL_169822 ·

    新的LENS框架通过自适应关键帧采样增强AI视频理解能力

    研究人员开发了LENS,一个旨在改进多模态大语言模型(MLLMs)处理长视频方式的新框架。LENS通过自适应采样关键帧来解决有限上下文窗口的挑战。它动态地平衡空间细节(关注帧内的相关区域)和时间覆盖(跨多个帧聚合信息)。这种方法旨在通过捕捉高保真细节和长程上下文来增强模型理解视频的能力,在视频基准测试中表现优于先前的方法。

  10. TOOL · CL_152094 ·

    新的VideoTreeSearch框架实现了用于长视频问答的自纠错智能体

    研究人员推出了一种新颖的框架VideoTreeSearch (VTS),该框架通过将长视频问答任务视为自适应时间树上的自纠错搜索来改进该任务。与先前使用单一操作来缩小视频片段范围的方法不同,VTS采用了四种操作——放大(zoom_in)、缩小(zoom_out)、移动(shift)和回答(answer)——以实现显式的回溯和错误恢复。这种分层搜索方法通过轨迹合成管道进行训练,并通过准确性奖励进行强化,在CG-Bench和Haystac…

  11. TOOL · CL_152069 ·

    新方法高效选择视频帧以供MLLM分析

    研究人员开发了一种名为DAFS(动态注意力预算感知帧选择)的新颖方法,用于从长视频中高效选择相关帧,以供多模态大语言模型(MLLM)进行分析。这种无需训练的方法利用MLLM内的跨模态注意力来识别帧证据,而无需预先理解视频内容。通过将注意力分数转换为相关性指标,DAFS即使使用较小的MLLM选择器也能运行,并通过动态规划有效管理令牌预算,在Video-MME等基准测试中优于均匀采样和先前基于训练的方法。

  12. TOOL · CL_128730 ·

    新的DELTAVID框架提升视频大语言模型的细粒度感知能力

    研究人员推出了一种新颖的DELTAVID框架,旨在提升视频多模态大语言模型(Video MLLMs)的细粒度时空感知能力。该方法将识别相似视频之间差异的任务转化为可训练信号,使模型能够精确识别局部变化、时间边界和空间证据。该框架得到了DELTAVID-10K和DELTAVID-Bench数据集的支持,这些数据集旨在促进这些感知技能的可扩展训练和可靠评估。实验表明,DELTAVID显著提升了跨视频差异理解的性能,并将这种改进的局部证据推…

  13. RESEARCH · CL_123289 ·

    新的ReQuest管道增强了长视频问答的LLM能力

    研究人员开发了ReQuest,这是一个旨在提高长视频问答能力的新型管道。该方法通过采用一种由不确定性驱动的、适应性问题选择关键帧的过程,解决了多模态大型语言模型中固定输入令牌预算的限制。ReQuest集成了一个轻量级选择器、一个根据模型不确定性触发额外推理的路由机制,以及一种自适应非最大抑制技术来选择相关且时间上多样化的帧。该系统作为一个即插即用解决方案,在Video-MME、MLVU和LongVideoBench等基准测试上提高了性…

  14. TOOL · CL_115672 ·

    HiMu框架通过分层帧选择增强长视频问答能力

    研究人员开发了HiMu,一个旨在改进长视频问答任务帧选择的新型框架。该无训练系统将复杂查询分解为分层逻辑树,利用专门的视觉和音频处理专家。HiMu的方法使用模糊逻辑对专家信号进行归一化和组合,以保持时间顺序和模态绑定,在Video-MME和LongVideoBench等基准测试中表现优于先前的方法。

  15. RESEARCH · CL_84536 ·

    InternVideo3 增强视频理解能力,引入新推理框架

    研究人员推出了 InternVideo3,一个旨在提升长时视频理解和代理能力的新框架。该系统利用多模态上下文推理(MCR)将视频内容处理为不断演变的上下文,从而在延长时间内进行证据累积和验证。为了保持效率,InternVideo3 采用了多模态多头潜在注意力(M^2LA),该机制在不丢失 token 信息的情况下压缩键值缓存状态。该模型在各种视频理解基准测试中表现出色,并已被改编成一个能够进行证据支撑检索任务的视频代理。

  16. TOOL · CL_30555 ·

    ReTool-Video 通过递归工具使用增强视频代理

    研究人员推出了 ReTool-Video,这是一种用于视频理解代理的新颖方法,可增强其推理能力。该方法利用一个包含 134 个专用工具的扩展工具库,包括用于过滤和聚合的元工具,以支持细粒度的组合推理。ReTool-Video 将高级视频意图递归地分解为可执行的工具链,从而实现动态参数修复和工具替换,以实现复杂的多模态操作。实验表明,ReTool-Video 在多个视频理解基准测试中优于现有基线。

  17. TOOL · CL_15761 ·

    LinMU 为多模态理解模型实现线性复杂度

    研究人员开发了 LinMU,一种新颖的视觉语言模型(VLM)架构,实现了线性复杂度,克服了当前模型二次复杂度的限制。这种新设计利用了 M-MATE 块,结合了状态空间模型和窗口注意力,以高效处理高分辨率图像和长视频。通过三阶段蒸馏过程,LinMU 在显著减少处理时间和提高吞吐量的同时,达到了现有模型的性能,使先进的多模态推理更加易于访问。

  18. FRONTIER RELEASE · CL_02309 ·

    推出 gpt-realtime 和 Realtime API 更新

    OpenAI 发布了 GPT-4.1,这是其 API 的新模型系列,在编码、指令遵循和长上下文理解方面提供了显著改进,性能优于 GPT-4o 等先前模型。该公司还推出了更小、更快的 GPT-4.1 mini 和 GPT-4.1 nano 变体。此外,OpenAI 推出了其最先进的语音到语音模型 gpt-realtime,旨在提供具有增强自然度和指令遵循能力的可靠语音代理,并更新了其 Realtime API。