PulseAugur
实时 08:55:40
English(EN) Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning

新的WSV框架通过合成视频生成改进零样本视频字幕生成

研究人员开发了一个名为WSV的新框架,用于零样本视频字幕生成,该框架解决了仅文本训练与基于视频的推理之间的跨模态差距。该方法包括使用文本到视频模型生成合成视频潜在表示,然后由一个抛光器进行细化以提高保真度。最后,一个提示器根据这些抛光后的表示对GPT-2进行条件化以生成字幕。该方法在MSVD、MSR-VTT和VATEX数据集上的B@4得分达到52,CIDEr得分达到95.7。 AI

影响 这项研究引入了一种弥合零样本视频字幕生成差距的新方法,通过利用合成视频数据,有可能提高生成字幕的准确性。

排序理由 该集群包含一篇详细介绍零样本视频字幕生成新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的WSV框架通过合成视频生成改进零样本视频字幕生成

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Liangyu Fu, Junbo Wang, Yuke Li, Ya Jing, Xuecheng Wu, Zhiyong Wang ·

    观看合成视频:通过视觉合成对齐跨模态表示以实现零样本视频字幕生成

    arXiv:2608.11013v1 Announce Type: new Abstract: Text-only training is a popular paradigm in zero-shot video captioning, where the video distribution is not available to the model during training, leading to a cross-modal gap between the training (text-only) and the inference (vid…