研究人员推出了OpenVE-3M,这是一个用于指令引导视频编辑的大规模开源数据集。该数据集包含两大类编辑:空间对齐和非空间对齐,其质量和多样性均超越了现有数据集。为了评估性能,他们还开发了OpenVE-Bench,一个包含431个视频-编辑对的基准测试。在OpenVE-3M数据集上训练的拥有50亿参数的模型OpenVE-Edit,在OpenVE-Bench上取得了最先进的成果,性能优于更大的基线模型。 AI
影响 该数据集和模型推动了指令引导视频编辑的能力和评估,有望改进内容创作工具。
排序理由 该集群描述了一个新的用于视频编辑的学术数据集和基准测试,以及一个在该数据集上训练的模型。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Haoyang He
- Hugging Face
- OpenVE-3M
- OpenVE-Bench
- OpenVE-Edit
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →