MSR-VTT
PulseAugur coverage of MSR-VTT — every cluster mentioning MSR-VTT across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新型 HyVol 模块提升多模态检索准确性
研究人员开发了一种名为超图正则化格拉姆体积(HyVol)的新型训练时模块,以增强多模态检索系统。该模块通过使用超图连接模态和相关候选对象来整合训练样本之间的语义关系。HyVol 在嵌入而非最终分数上运行,允许在训练后移除而不改变骨干架构或检索成本。在 MSR-VTT 和 VATEX 等基准测试上的实验显示,检索准确性显著提高,尤其是在视频到文本任务上。
-
新数据集和模型推动文本到长视频检索能力发展
研究人员推出了MELON,这是一个专为多事件文本到长视频检索设计的新大规模数据集,解决了现有数据集主要关注具有单一事件的短片段的局限性。MELON标注了长视频中的多个事件间隔,使模型能够更好地理解复杂的多事件结构。同时,还提出了一个名为TAME的框架,通过将时间建模集成到基于CLIP的架构中来增强文本视频检索。TAME利用专家混合层和帧-时间标记来捕捉局部帧细节和长距离时间依赖性,在标准的检索基准上表现出改进的性能。
-
新的WSV框架通过合成视频生成改进零样本视频字幕生成
研究人员开发了一个名为WSV的新框架,用于零样本视频字幕生成,该框架解决了仅文本训练与基于视频的推理之间的跨模态差距。该方法包括使用文本到视频模型生成合成视频潜在表示,然后由一个抛光器进行细化以提高保真度。最后,一个提示器根据这些抛光后的表示对GPT-2进行条件化以生成字幕。该方法在MSVD、MSR-VTT和VATEX数据集上的B@4得分达到52,CIDEr得分达到95.7。
-
新的PHA-Net通过原型对齐改进文本-视频检索
研究人员开发了PHA-Net,一种用于文本-视频检索的新型网络,它利用共享原型来有效地对齐跨模态表示。该方法通过增强具有强语义的token并抑制较弱的token来解决文本和视频之间的语义不匹配问题。PHA-Net在多个基准测试中表现出显著的改进,包括MSR-VTT、ActivityNet、VATEX和Charades。
-
新框架在不重新训练模型的情况下提高了视频字幕的准确性
研究人员开发了 ProCap,一个旨在增强视频字幕生成而无需重新训练现有大型视觉语言模型的新框架。该方法使用轻量级的评分机制,根据空间显著性、时间持久性和关系动态来识别和优先处理重要对象。然后,一个迭代的、由提示驱动的精炼循环将这些相关对象注入字幕中,与基线模型相比,甚至与 ChatGPT 和 Gemini 的直接比较相比,显著提高了完整性并减少了幻觉。
-
新框架对齐文本和视频分布以改进检索
研究人员引入了分布对齐桥梁(DAB),一个新颖的文本到视频检索框架,将任务视为分布对齐问题。DAB不进行直接匹配,而是将文本和视频嵌入建模为高斯分布,并纳入不确定性。该系统使用受扩散模型启发的桥梁,迭代地将文本分布向视频分布细化,并通过基于Kullback-Leibler散度的对比损失进行优化相似度。在MSR-VTT和VATEX等基准上的评估表明,DAB优于现有的概率和基于扩散的方法。
-
PEEK方法高效选择关键视频帧用于字幕生成
研究人员开发了PEEK,一种从视频中选择关键帧以生成字幕的高效方法。该技术将知识从大型教师模型蒸馏到小型模型中,使其能够以最小的计算开销识别最相关的帧。PEEK的性能优于现有方法,尤其是在使用少量帧时,并且与其他自适应采样方法相比,显著减少了处理时间。
-
新GLCCL方法提升文本-视频检索准确性
研究人员开发了一种名为全局-局部对比一致性学习(GLCCL)的新方法,以改进文本-视频检索。该方法使用一个无参数模块,在文本查询的指导下,从视频帧和完整视频中生成语义特征。采用了一种新颖的对比分数一致性损失函数,以增强模型区分相关和不相关视频-文本对的能力,从而在基准数据集上取得卓越的性能。