PulseAugur
中
实时 23:39:50
实体 QVHighlights

QVHighlights

PulseAugur coverage of QVHighlights — every cluster mentioning QVHighlights across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_245637 ·

    新的IAE-VTG方法改进了动作-实体视频时间定位

    研究人员推出了一种新颖的视频时间定位(VTG)方法IAE-VTG,该方法专门处理涉及实体执行动作的查询。与以往整体处理查询的方法不同,IAE-VTG将查询中的动作和实体信息解耦,以更好地与互补的视频特征对齐。这是通过细粒度解耦交互模块(FDIM)和交互敏感分配(ISA)训练策略实现的,该策略通过考虑时间重叠和语义兼容性来提高时间定位的准确性。在QVHighlights、Charades-STA和TACoS等基准数据集上的实验表明,IA…

  2. TOOL · CL_194007 ·

    新方法通过二元问题改进VLM时间定位

    研究人员开发了一种新颖的无训练方法FV-Action,用于视觉语言模型(VLM)的时间定位。该方法通过将任务从直接回归重构为一系列二元问题,解决了VLM自信地提供不正确事件时间戳的问题。通过分析输出窗口与事件宽度之间的关系,FV-Action显著提高了在Charades-STA等基准测试上的性能,优于现有的无训练方法,甚至一些有监督模型。

  3. TOOL · CL_185484 ·

    新的REZE方法提高了视频时间定位的准确性

    研究人员开发了REZE,一种新颖的无训练视频时间定位方法,通过将视频分割成片段并在片段级别评估查询相关性来提高准确性。该方法绕过了直接从大型视觉语言模型生成时间戳,而是使用确定性算法将片段级别的分数转换为所需的输出。REZE在QVHighlights等基准测试中展示了在精彩集锦检测和时刻检索方面的最先进性能,在某些情况下甚至超越了完全监督的方法。

  4. TOOL · CL_79965 ·

    新的SMART框架通过音频和镜头感知压缩增强视频片段检索

    研究人员开发了SMART,一种用于视频片段检索的新框架,通过整合音频线索和视觉信息来增强多模态理解。该方法利用了多模态大语言模型(MLLM),并采用了一种新颖的“镜头感知令牌压缩”技术,以选择性地保留每个视频镜头中的重要信息,从而保留细粒度的时间细节。在Charades-STA和QVHighlights等标准基准上的评估证明了SMART的有效性,显示出相比现有最先进方法的显著改进。

  5. TOOL · CL_66184 ·

    新框架CoSTL增强视频时刻检索和精彩片段检测

    研究人员推出CoSTL,一个旨在改进视频时刻检索和精彩片段检测的新框架。该方法通过关注视频中细粒度的图像级细节和更广泛的时间理解来解决现有方法的局限性。CoSTL利用文本驱动的编码器进行详细的空间表示,并利用多尺度模块处理时间动态,在四个基准数据集上取得了最先进的成果。

  6. TOOL · CL_65506 ·

    GIRL-DETR 通过强化学习提升视频时刻检索能力

    研究人员开发了 GIRL-DETR,一种通过解决轻量级模型的优化挑战来改进视频时刻检索的新方法。该方法在监督训练后冻结骨干网络,并采用三阶段渐进式强化学习策略直接优化不可微的评估指标。在基准数据集上的实验显示出显著的准确性提升,为强化学习在视频分析中的应用提供了新途径。