ActivityNet Captions
PulseAugur coverage of ActivityNet Captions — every cluster mentioning ActivityNet Captions across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新框架通过VLM引导的过渡发现改进视频字幕生成
研究人员开发了一个名为Seeing Before Synthesizing (SBS)的新框架,以改进弱监督密集视频字幕生成。该方法使用视觉语言模型(VLMs)为事件之间的视频片段生成帧级叙述,并根据语义变化识别过渡。然后,该框架通过融合时间中点和语义变化点来优化视觉语言对齐,从而精炼这些过渡的时间掩码。在ActivityNet Captions和YouCook2数据集上的实验表明,SBS在视频事件定位和字幕生成方面均达到了最先进的性能。
-
新方法通过二元问题改进VLM时间定位
研究人员开发了一种新颖的无训练方法FV-Action,用于视觉语言模型(VLM)的时间定位。该方法通过将任务从直接回归重构为一系列二元问题,解决了VLM自信地提供不正确事件时间戳的问题。通过分析输出窗口与事件宽度之间的关系,FV-Action显著提高了在Charades-STA等基准测试上的性能,优于现有的无训练方法,甚至一些有监督模型。
-
AI框架通过新的路由增强语义视频通信
研究人员开发了一个用于语义视频通信的生成式AI框架,旨在传输意义而非原始数据。该系统解决了带宽限制下的时间建模和网络边缘的语义对齐方面的挑战。它利用多尺度时间卷积编码器和基于胶囊的动态路由机制来实现高效灵活的通信。
-
GenSpan 框架改进了复杂动作查询的视频检索
研究人员开发了 GenSpan,一个用于视频语料库瞬间检索的新框架,该框架专门解决了多动词查询的挑战。GenSpan 利用从字幕线索生成的辅助视频作为时间先验,指导检索过程。这种方法提高了视频和时间片段识别的准确性,尤其是在复杂动作序列方面,同时与现有方法相比还降低了计算需求。
-
新网络通过知识迁移实现无监督视频-文本匹配
研究人员开发了一种新颖的跨模态知识迁移网络,用于无监督时间句子定位。该方法旨在通过利用来自更简单、易于获得的跨模态任务的知识,来克服对昂贵、配对的视频-查询注释的依赖。该网络将来自图像-名词任务的实体感知外观知识和来自视频-动词事件的事件感知动作表示进行迁移,并将其改编为无监督使用,以在没有直接训练的情况下关联视频和查询以检索相关片段。
-
PEEK方法高效选择关键视频帧用于字幕生成
研究人员开发了PEEK,一种从视频中选择关键帧以生成字幕的高效方法。该技术将知识从大型教师模型蒸馏到小型模型中,使其能够以最小的计算开销识别最相关的帧。PEEK的性能优于现有方法,尤其是在使用少量帧时,并且与其他自适应采样方法相比,显著减少了处理时间。