研究人员开发了一个名为WSV的新框架,用于零样本视频字幕生成,该框架解决了仅文本训练与基于视频的推理之间的跨模态差距。该方法包括使用文本到视频模型生成合成视频潜在表示,然后由一个抛光器进行细化以提高保真度。最后,一个提示器根据这些抛光后的表示对GPT-2进行条件化以生成字幕。该方法在MSVD、MSR-VTT和VATEX数据集上的B@4得分达到52,CIDEr得分达到95.7。 AI
影响 这项研究引入了一种弥合零样本视频字幕生成差距的新方法,通过利用合成视频数据,有可能提高生成字幕的准确性。
排序理由 该集群包含一篇详细介绍零样本视频字幕生成新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- 3D Causal VAE
- arXiv
- GPT-2
- Hugging Face
- MSR-VTT
- MSVD-Turkish: a comprehensive multimodal video dataset for integrated vision and language research in Turkish
- VATEX
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →