PulseAugur
实时 11:10:25
实体 ActivityNet: A large-scale video benchmark for human activity understanding

ActivityNet: A large-scale video benchmark for human activity understanding

PulseAugur coverage of ActivityNet: A large-scale video benchmark for human activity understanding — every cluster mentioning ActivityNet: A large-scale video benchmark for human activity understanding across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_181035 ·

    新的Event ActivityNet基准推动无修剪动作理解

    研究人员推出了Event ActivityNet,这是一个旨在推动视频中无修剪动作理解领域发展的新基准。该数据集源自现有的ActivityNet视频,包含3200多个视频,内容超过100小时。Event ActivityNet支持多种任务,包括动作识别、事件-语言对齐和时间动作定位,并为这些任务建立了新的基线性能指标。

  2. TOOL · CL_180206 ·

    新的PHA-Net通过原型对齐改进文本-视频检索

    研究人员开发了PHA-Net,一种用于文本-视频检索的新型网络,它利用共享原型来有效地对齐跨模态表示。该方法通过增强具有强语义的token并抑制较弱的token来解决文本和视频之间的语义不匹配问题。PHA-Net在多个基准测试中表现出显著的改进,包括MSR-VTT、ActivityNet、VATEX和Charades。

  3. RESEARCH · CL_70411 ·

    MLLMs 在多视频摘要中表现出位置偏差

    研究人员在多模态大语言模型(MLLMs)对多个视频进行摘要时,发现存在位置偏差。这种偏差意味着摘要的质量可能取决于视频呈现给模型的顺序。研究人员使用 ActivityNet 和 News 视频创建了一个新的基准,以测试九种不同 MLLMs 的这种效应,结果显示偏差受到视频领域和所用模型的具体影响。研究表明,当前的多视频摘要系统对输入顺序敏感,突显了对更鲁棒、顺序无关的多模态系统的需求。