PulseAugur
中
实时 00:59:24
实体 Video-MME-Long

Video-MME-Long

PulseAugur coverage of Video-MME-Long — every cluster mentioning Video-MME-Long across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_252237 ·

    VideoXAgent 通过在线代理工具集解决长视频理解问题

    研究人员开发了 VideoXAgent,这是一个用于理解长视频的在线代理工具集。该系统可以规划任务,按需使用 VLMs、OCR 和 ASR 等专业工具,并聚合证据来回答查询。VideoXAgent 旨在克服将整个视频打包到单个上下文窗口中带来的上下文遗忘和高计算成本的限制。与密集打包基线相比,它在 Video-MME-Long 和 MINERVA 等基准测试中表现出具有竞争力的性能,即使上下文占用空间显著减小。

  2. TOOL · CL_193450 ·

    MERIT框架简化超长视频理解

    研究人员开发了MERIT,一个用于理解超出当前多模态大语言模型实际处理限制的超长视频的新框架。MERIT采用两阶段方法,首先构建一个注重可检索性的查询无关记忆,然后进行基于检索的推理。该方法利用了情景多键表示进行精确记忆检索,并通过在推理时扩展检索片段周围的时间范围来捕获更广泛的语义上下文的邻居过滤机制。MERIT在EgoLifeQA、LVBench和Video-MME (Long)等基准测试中展示了最先进的性能。

  3. RESEARCH · CL_128737 ·

    新的AI框架通过先进的记忆和推理能力解决长视频理解问题

    研究人员正在开发先进的框架,以改进AI模型理解和推理长视频的方式。例如,Homer使用分层记忆系统,按时间因果联系组织信息,在M3-Bench-robot等基准测试中表现优于现有方法。Latent-VC通过在解码器中保留视觉记忆来解决“视觉锚定衰减”问题,从而实现更准确、更简洁的视频推理。EGAgent采用实体场景图和代理规划来实现以自我为中心的视频理解,而Light-Omni则提供了一种具有双重上下文状态以实现高效处理的反射式、轻量…