PulseAugur
实时 10:15:04
实体 LVBench

LVBench

PulseAugur coverage of LVBench — every cluster mentioning LVBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_193450 ·

    MERIT框架简化超长视频理解

    研究人员开发了MERIT,一个用于理解超出当前多模态大语言模型实际处理限制的超长视频的新框架。MERIT采用两阶段方法,首先构建一个注重可检索性的查询无关记忆,然后进行基于检索的推理。该方法利用了情景多键表示进行精确记忆检索,并通过在推理时扩展检索片段周围的时间范围来捕获更广泛的语义上下文的邻居过滤机制。MERIT在EgoLifeQA、LVBench和Video-MME (Long)等基准测试中展示了最先进的性能。

  2. RESEARCH · CL_167440 ·

    新框架通过自适应帧处理提升 MLLM 长视频理解能力 · 跟踪 3 个来源

    三篇新研究论文介绍了增强多模态大语言模型(MLLM)长视频理解能力的新型框架。这些方法旨在通过自适应地选择和处理相关视频帧来克服固定上下文窗口的限制。ReMem 专注于解析问题的时序粒度并将帧与查询语义对齐,而 CADER 则动态推理证据置信度,绕过对简单问题的不必要处理。GenEvA 将选定的帧聚合为潜在证据表示,以最小的开销提高性能。

  3. TOOL · CL_152094 ·

    新的VideoTreeSearch框架实现了用于长视频问答的自纠错智能体

    研究人员推出了一种新颖的框架VideoTreeSearch (VTS),该框架通过将长视频问答任务视为自适应时间树上的自纠错搜索来改进该任务。与先前使用单一操作来缩小视频片段范围的方法不同,VTS采用了四种操作——放大(zoom_in)、缩小(zoom_out)、移动(shift)和回答(answer)——以实现显式的回溯和错误恢复。这种分层搜索方法通过轨迹合成管道进行训练,并通过准确性奖励进行强化,在CG-Bench和Haystac…

  4. TOOL · CL_135427 ·

    目标驱动数据优化加速多模态AI训练

    研究人员开发了一个名为目标驱动数据优化(GDO)的框架,以提高多模态指令调优的效率。GDO计算样本描述符,以创建针对特定目标的优化训练子集,与Uni-10x等现有方法相比,能够以更少的样本实现更快的收敛和更高的准确性。当应用于Qwen3-VL-8B-Instruct模型时,GDO在MVBench和VideoMME等基准测试中取得了优越的结果,证明了其在减少多模态训练中计算低效率方面的有效性。

  5. TOOL · CL_128730 ·

    新的DELTAVID框架提升视频大语言模型的细粒度感知能力

    研究人员推出了一种新颖的DELTAVID框架,旨在提升视频多模态大语言模型(Video MLLMs)的细粒度时空感知能力。该方法将识别相似视频之间差异的任务转化为可训练信号,使模型能够精确识别局部变化、时间边界和空间证据。该框架得到了DELTAVID-10K和DELTAVID-Bench数据集的支持,这些数据集旨在促进这些感知技能的可扩展训练和可靠评估。实验表明,DELTAVID显著提升了跨视频差异理解的性能,并将这种改进的局部证据推…

  6. RESEARCH · CL_97982 ·

    OmniAgent 使用主动感知进行高效视频理解 · 已追踪 2 个来源

    研究人员推出 OmniAgent,这是一种新颖的全模态智能体,用于视频理解,它利用基于部分可观察马尔可夫决策过程 (POMDP) 的迭代式观察-思考-行动 (Observation-Thought-Action) 循环。这种方法允许智能体选择性地将视听线索提炼成文本记忆,从而将推理复杂性与原始视频时长解耦,提高计算效率。该论文详细介绍了两种关键的训练方法:用于引导主动感知的智能体监督微调 (Agentic Supervised Fin…

  7. RESEARCH · CL_95864 ·

    新研究增强了用于医疗、检索和机器人任务的视觉-语言模型

    研究人员正在开发新方法来改进各种领域的视觉-语言模型(VLM)。一篇论文介绍了CoT-Mediate,一个用于评估生成推理如何影响VLM在医疗情境下预测的框架,发现推理的位置比其声明的来源更关键。另一项研究提出了ReToken,一个可学习的单一嵌入,通过选择相关的视觉标记来增强视觉检索,在Visual Haystacks和LVBench等基准测试中显示出显著的提升。对于机器人领域,BioVLN是一个专为生物医学实验室视觉-语言导航设计…