MSR-VTT
PulseAugur coverage of MSR-VTT — every cluster mentioning MSR-VTT across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新框架对齐文本和视频分布以改进检索
研究人员推出了一种新颖的文本到视频检索框架——分布对齐桥(DAB),该框架将任务视为一个分布对齐问题。DAB不采用确定性匹配,而是将文本和视频嵌入建模为高斯分布,明确处理每种模态中的不确定性。该框架使用受扩散启发的桥梁迭代地将文本分布精炼至目标视频分布,并通过基于 Kullback-Leibler 散度的损失函数优化跨模态相似性。在 MSR-VTT 和 VATEX 等基准上的评估表明,DAB 超越了现有的概率和基于扩散的方法,提供了经…
-
新框架通过优先处理关键对象来改进视频字幕生成
研究人员开发了 ProCap,一个旨在增强视频字幕生成而无需重新训练现有大型视觉语言模型的新框架。该系统使用轻量级的评分机制来识别并将语义上重要的对象注入字幕,解决了遗漏和幻觉问题。ProCap 基于对象显著性、时间持久性和关系动态迭代地改进字幕,在人类评估中显著提高了感知完整性和准确性。
-
PEEK方法高效选择关键视频帧用于字幕生成
研究人员开发了PEEK,一种从视频中选择关键帧以生成字幕的高效方法。该技术将知识从大型教师模型蒸馏到小型模型中,使其能够以最小的计算开销识别最相关的帧。PEEK的性能优于现有方法,尤其是在使用少量帧时,并且与其他自适应采样方法相比,显著减少了处理时间。
-
新GLCCL方法提升文本-视频检索准确性
研究人员开发了一种名为全局-局部对比一致性学习(GLCCL)的新方法,以改进文本-视频检索。该方法使用一个无参数模块,在文本查询的指导下,从视频帧和完整视频中生成语义特征。采用了一种新颖的对比分数一致性损失函数,以增强模型区分相关和不相关视频-文本对的能力,从而在基准数据集上取得卓越的性能。