PulseAugur
中
实时 13:49:29
实体 LVBench

LVBench

PulseAugur coverage of LVBench — every cluster mentioning LVBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
11
90 天内 11
发布 · 30天
0
90 天内 0
论文 · 30天
11
90 天内 11
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. TOOL · CL_252237 ·

    VideoXAgent 通过在线代理工具集解决长视频理解问题

    研究人员开发了 VideoXAgent,这是一个用于理解长视频的在线代理工具集。该系统可以规划任务,按需使用 VLMs、OCR 和 ASR 等专业工具,并聚合证据来回答查询。VideoXAgent 旨在克服将整个视频打包到单个上下文窗口中带来的上下文遗忘和高计算成本的限制。与密集打包基线相比,它在 Video-MME-Long 和 MINERVA 等基准测试中表现出具有竞争力的性能,即使上下文占用空间显著减小。

  2. RESEARCH · CL_227206 ·

    新方法利用合成数据和时间分析增强AI对长视频的理解 · 跟踪4个来源

    研究人员正在开发新方法,以改进大型多模态模型理解长视频的方式。一种名为SynMulti的方法使用合成数据生成管道,为对象计数和问答等任务创建无限的带注释视频数据,表明合成数据可以很好地泛化到现实世界场景。其他方法,如RIDGE和Temporal Tree of Thought (T^3),通过分析视频中的时间信号和分层结构来专注于高效帧选择,以更好地捕捉关键时刻和上下文。STITCH提供了一种无需训练的方法,将视频分割成有意义的时间块…

  3. RESEARCH · CL_216170 ·

    新的基准和架构推动了 MLLMs 中的长视频理解

    研究人员正在开发新的方法来改进多模态大语言模型 (MLLMs) 理解长视频的方式。一种方法 MoTE 使用任务专家混合 (Mixture of Task Experts) 将计算路由到特定任务模块,从而提高视频语言任务的准确性和效率。另一个重点是优化模型如何从长视频中提取相关信息,例如 VideoHarness-RSI 通过递归搜索有效的上下文构建程序,以及 TRACE 专注于证据支持的答案。此外,还推出了 Video-IFBench…

  4. TOOL · CL_206601 ·

    新的CARVE探针通过破坏帧内容来审计视频代理的可靠性

    研究人员开发了CARVE,一种新的黑盒反事实探针,用于审计视频代理的可靠性。CARVE比较了当检索到的视频帧的语义内容被破坏时代理答案的变化,以及当同一管道在这些帧上重新执行时的情况。在对VideoExplorer风格的代理进行的实验中,CARVE显示出显著且可复现的效果,在帧内容被破坏时更频繁地改变代理的答案。该探针还显示出作为路由信号的潜力,提高了在基准数据集上的准确性。

  5. TOOL · CL_193450 ·

    MERIT框架简化超长视频理解

    研究人员开发了MERIT,一个用于理解超出当前多模态大语言模型实际处理限制的超长视频的新框架。MERIT采用两阶段方法,首先构建一个注重可检索性的查询无关记忆,然后进行基于检索的推理。该方法利用了情景多键表示进行精确记忆检索,并通过在推理时扩展检索片段周围的时间范围来捕获更广泛的语义上下文的邻居过滤机制。MERIT在EgoLifeQA、LVBench和Video-MME (Long)等基准测试中展示了最先进的性能。

  6. RESEARCH · CL_167440 ·

    新框架通过自适应帧处理提升 MLLM 长视频理解能力 · 跟踪 3 个来源

    三篇新研究论文介绍了增强多模态大语言模型(MLLM)长视频理解能力的新型框架。这些方法旨在通过自适应地选择和处理相关视频帧来克服固定上下文窗口的限制。ReMem 专注于解析问题的时序粒度并将帧与查询语义对齐,而 CADER 则动态推理证据置信度,绕过对简单问题的不必要处理。GenEvA 将选定的帧聚合为潜在证据表示,以最小的开销提高性能。

  7. TOOL · CL_152094 ·

    新的VideoTreeSearch框架实现了用于长视频问答的自纠错智能体

    研究人员推出了一种新颖的框架VideoTreeSearch (VTS),该框架通过将长视频问答任务视为自适应时间树上的自纠错搜索来改进该任务。与先前使用单一操作来缩小视频片段范围的方法不同,VTS采用了四种操作——放大(zoom_in)、缩小(zoom_out)、移动(shift)和回答(answer)——以实现显式的回溯和错误恢复。这种分层搜索方法通过轨迹合成管道进行训练,并通过准确性奖励进行强化,在CG-Bench和Haystac…

  8. TOOL · CL_135427 ·

    目标驱动数据优化加速多模态AI训练

    研究人员开发了一个名为目标驱动数据优化(GDO)的框架,以提高多模态指令调优的效率。GDO计算样本描述符,以创建针对特定目标的优化训练子集,与Uni-10x等现有方法相比,能够以更少的样本实现更快的收敛和更高的准确性。当应用于Qwen3-VL-8B-Instruct模型时,GDO在MVBench和VideoMME等基准测试中取得了优越的结果,证明了其在减少多模态训练中计算低效率方面的有效性。

  9. TOOL · CL_128730 ·

    新的DELTAVID框架提升视频大语言模型的细粒度感知能力

    研究人员推出了一种新颖的DELTAVID框架,旨在提升视频多模态大语言模型(Video MLLMs)的细粒度时空感知能力。该方法将识别相似视频之间差异的任务转化为可训练信号,使模型能够精确识别局部变化、时间边界和空间证据。该框架得到了DELTAVID-10K和DELTAVID-Bench数据集的支持,这些数据集旨在促进这些感知技能的可扩展训练和可靠评估。实验表明,DELTAVID显著提升了跨视频差异理解的性能,并将这种改进的局部证据推…

  10. RESEARCH · CL_97982 ·

    OmniAgent 使用主动感知进行高效视频理解 · 已追踪 2 个来源

    研究人员推出 OmniAgent,这是一种新颖的全模态智能体,用于视频理解,它利用基于部分可观察马尔可夫决策过程 (POMDP) 的迭代式观察-思考-行动 (Observation-Thought-Action) 循环。这种方法允许智能体选择性地将视听线索提炼成文本记忆,从而将推理复杂性与原始视频时长解耦,提高计算效率。该论文详细介绍了两种关键的训练方法:用于引导主动感知的智能体监督微调 (Agentic Supervised Fin…

  11. RESEARCH · CL_95864 ·

    新的基准和模型在机器人和推理领域推进视觉-语言能力 · 跟踪了10个来源

    近期研究探讨了多个领域中视觉-语言模型(VLM)的进展。DeCAL 引入了一个新的模型,用于灵巧操作,该模型集成了触觉感知和视觉-语言理解。ROBORMBENCH 强调了 VLM 奖励模型在机器人领域对释义的脆弱性,并提出了一个衡量这种不稳定的基准。KoNA 和 FPCO-Dialog 分别针对 VLM 中的选择性不合规和持续的错误前提,提出了新的基准和微调策略。MultihopSpatial 专注于提高 VLA 代理的多跳组合空间推…