研究人员推出了 Goku,一个用于指令驱动视频编辑的大规模数据集和基准,旨在克服现有数据集仅关注单一任务外观编辑的局限性。Goku 包含 200 万个高质量视频编辑对,支持多任务和结构化操作,如精确的主题移动控制。配套的 Goku-Edit 模型采用多模态大语言模型进行指令理解,并采用双分支设计进行结构和外观编辑。还发布了一个基准 Goku-Bench,包含 1,000 个经人类验证的案例和 7 个新指标,结果显示 Goku-Edit 在指令遵循方面比其他开源模型提高了高达 8%。 AI
影响 提升了指令驱动视频编辑的能力,可能使用户能够进行更复杂和富有创意的用户驱动视频编辑。
排序理由 该集群描述了一个用于视频编辑的新数据集、基准和模型,作为研究论文发布。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Goku
- Goku-Bench
- Goku-Edit
- Gotit.pub
- Hugging Face
- multimodal large language model
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →