研究人员推出了开放屏幕配乐库第二版(OSSL-v2),这是一个包含34,343个视频片段、总计246.4小时的可复现数据集,来源于公共领域电影。这个新的语料库旨在解决视频到音乐生成模型中常因使用短暂的YouTube链接而存在的复现性差距问题。该团队还开发了一种将对话作为视频到音乐生成条件信号的方法,通过整合对话音轨来增强现有模型,使音乐与屏幕上的语音更好地匹配。他们的研究方法在公共领域和商业电影上进行了评估,均显示出优于最先进基线方法的改进。 AI
影响 这项研究为训练视频到音乐生成领域的AI模型引入了一个更强大的数据集,有望提高AI生成配乐的质量和情感共鸣。
排序理由 该条目描述了一篇学术论文中提出的新数据集和一种新颖的视频到音乐生成方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Open Screen Soundtrack Library version 2
- OSSL-v2
- ScienceCast
- YouTube
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →