ActivityNet-1.3
PulseAugur coverage of ActivityNet-1.3 — every cluster mentioning ActivityNet-1.3 across labs, papers, and developer communities, ranked by signal.
-
新MGCA-Net推进视频中开放词汇量动作定位
研究人员推出MGCA-Net,一种专为开放词汇量时间动作定位(OV-TAL)设计的新型网络。该方法旨在识别和精确定位视频中的动作,涵盖所有类别,即使是那些未经过显式训练的类别。MGCA-Net采用多粒度策略,利用一个定位器、一个动作存在预测器以及在不同粒度(片段、视频和候选片段级别)上运行的分类器,以提高已知和新颖动作类别的准确性。在THUMOS'14和ActivityNet-1.3等标准基准上的评估表明,MGCA-Net在零样本时间…
-
SpikeTAD 使用 SNN 实现低功耗视频动作检测
研究人员开发了 SpikeTAD,一种用于视频端到端时序动作检测的新型脉冲神经网络 (SNN) 架构。该方法旨在解决传统人工神经网络的高功耗和模型尺寸大的问题,使其适用于在移动设备和神经形态芯片上部署。SpikeTAD 展现出具有竞争力的性能,在 THUMOS14 上达到 67.2% 的 mAP,在 ActivityNet-1.3 上达到 37.42% 的 mAP,同时保持显著更低的功耗。
-
ConTrans 模型推动零样本视频动作定位
研究人员开发了一个名为 ConTrans 的新模型,以改进视频中的零样本时序动作定位。该模型集成了卷积层和 Transformer 自注意力机制,以更好地捕捉局部帧相关性和长程全局上下文。ConTrans 在 ActivityNet-1.3 和 THUMOS14 数据集上树立了新的基准,在检测未见过动作方面优于现有方法。
-
LiquidTAD论文介绍高效、硬件无关的时序动作检测
研究人员推出了一种新颖的框架 LiquidTAD,用于视频中高效的时序动作检测。该方法将液态神经动力学提炼成并行时序算子,避免了复杂的 ODE 求解器,并实现了硬件无关的部署。与现有方法相比,LiquidTAD 在 THUMOS-14 和 ActivityNet-1.3 等基准数据集上实现了具有竞争力的准确性,同时显著减少了参数数量和计算开销。