ActivityNet: A large-scale video benchmark for human activity understanding
PulseAugur coverage of ActivityNet: A large-scale video benchmark for human activity understanding — every cluster mentioning ActivityNet: A large-scale video benchmark for human activity understanding across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的Event ActivityNet基准推动无修剪动作理解
研究人员推出了Event ActivityNet,这是一个旨在推动视频中无修剪动作理解领域发展的新基准。该数据集源自现有的ActivityNet视频,包含3200多个视频,内容超过100小时。Event ActivityNet支持多种任务,包括动作识别、事件-语言对齐和时间动作定位,并为这些任务建立了新的基线性能指标。
-
新的PHA-Net通过原型对齐改进文本-视频检索
研究人员开发了PHA-Net,一种用于文本-视频检索的新型网络,它利用共享原型来有效地对齐跨模态表示。该方法通过增强具有强语义的token并抑制较弱的token来解决文本和视频之间的语义不匹配问题。PHA-Net在多个基准测试中表现出显著的改进,包括MSR-VTT、ActivityNet、VATEX和Charades。
-
MLLMs 在多视频摘要中表现出位置偏差
研究人员在多模态大语言模型(MLLMs)对多个视频进行摘要时,发现存在位置偏差。这种偏差意味着摘要的质量可能取决于视频呈现给模型的顺序。研究人员使用 ActivityNet 和 News 视频创建了一个新的基准,以测试九种不同 MLLMs 的这种效应,结果显示偏差受到视频领域和所用模型的具体影响。研究表明,当前的多视频摘要系统对输入顺序敏感,突显了对更鲁棒、顺序无关的多模态系统的需求。