研究人员发布了LAION-BVD,一个包含1000万小时内容的新开源视频数据集,内容来源于8000万个下载的视频。该数据集专为多模态预训练设计,整合了视频、音频和图像模态。在LAION-BVD上训练的模型在多个基准测试中表现出竞争力,并且随着训练和模型规模的增加,性能有所提升。该数据集从提取的视频帧中获得的独特视觉分布也显示出在图像-文本检索任务中的潜力。 AI
影响 这个大规模、开放访问的视频数据集可以通过提供丰富的模型训练资源来加速多模态AI的研究和开发。
排序理由 该集群包含一篇详细介绍用于多模态预训练的新数据集的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →