MSVD-Turkish: a comprehensive multimodal video dataset for integrated vision and language research in Turkish
PulseAugur coverage of MSVD-Turkish: a comprehensive multimodal video dataset for integrated vision and language research in Turkish — every cluster mentioning MSVD-Turkish: a comprehensive multimodal video dataset for integrated vision and language research in Turkish across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的WSV框架通过合成视频生成改进零样本视频字幕生成
研究人员开发了一个名为WSV的新框架,用于零样本视频字幕生成,该框架解决了仅文本训练与基于视频的推理之间的跨模态差距。该方法包括使用文本到视频模型生成合成视频潜在表示,然后由一个抛光器进行细化以提高保真度。最后,一个提示器根据这些抛光后的表示对GPT-2进行条件化以生成字幕。该方法在MSVD、MSR-VTT和VATEX数据集上的B@4得分达到52,CIDEr得分达到95.7。
-
新框架在不重新训练模型的情况下提高了视频字幕的准确性
研究人员开发了 ProCap,一个旨在增强视频字幕生成而无需重新训练现有大型视觉语言模型的新框架。该方法使用轻量级的评分机制,根据空间显著性、时间持久性和关系动态来识别和优先处理重要对象。然后,一个迭代的、由提示驱动的精炼循环将这些相关对象注入字幕中,与基线模型相比,甚至与 ChatGPT 和 Gemini 的直接比较相比,显著提高了完整性并减少了幻觉。
-
新框架对齐文本和视频分布以改进检索
研究人员引入了分布对齐桥梁(DAB),一个新颖的文本到视频检索框架,将任务视为分布对齐问题。DAB不进行直接匹配,而是将文本和视频嵌入建模为高斯分布,并纳入不确定性。该系统使用受扩散模型启发的桥梁,迭代地将文本分布向视频分布细化,并通过基于Kullback-Leibler散度的对比损失进行优化相似度。在MSR-VTT和VATEX等基准上的评估表明,DAB优于现有的概率和基于扩散的方法。