PulseAugur
实时 12:00:24
English(EN) Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections

新数据集OSSL-v2增强了可复现的视频到音乐生成

研究人员推出了开放屏幕配乐库第二版(OSSL-v2),这是一个包含34,343个视频片段、总计246.4小时的可复现数据集,来源于公共领域电影。这个新的语料库旨在解决视频到音乐生成模型中常因使用短暂的YouTube链接而存在的复现性差距问题。该团队还开发了一种将对话作为视频到音乐生成条件信号的方法,通过整合对话音轨来增强现有模型,使音乐与屏幕上的语音更好地匹配。他们的研究方法在公共领域和商业电影上进行了评估,均显示出优于最先进基线方法的改进。 AI

影响 这项研究为训练视频到音乐生成领域的AI模型引入了一个更强大的数据集,有望提高AI生成配乐的质量和情感共鸣。

排序理由 该条目描述了一篇学术论文中提出的新数据集和一种新颖的视频到音乐生成方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新数据集OSSL-v2增强了可复现的视频到音乐生成

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Haven Kim, Zachary Novack, Julian McAuley, Hao-Wen Dong ·

    利用公共领域电影集进行对话感知视频到音乐生成

    arXiv:2608.11576v1 Announce Type: cross Abstract: Video-to-music generation has drawn growing interest for its role in conveying the emotion of visual media, including film. Progress in the field, however, is hampered by a reproducibility gap: models are often trained on crawled …