研究人员推出了一系列名为KVAE的新型分词器,专为多模态生成模型设计。这些分词器,包括KVAE-Audio、KVAE-3D和KVAE-2D,专门为跨音频、视频和图像数据的文本条件生成任务而构建。该论文详细介绍了这些模型的开发、训练和消融研究,并与社区分享了代码和训练细节。评估表明,KVAE分词器在各种重建和生成指标上均达到或超过了现有开源替代品的性能。 AI
影响 这些新型分词器有望提高音频、视频和图像任务的多模态生成模型的效率和质量。
排序理由 该集群描述了一篇学术论文中提出的一系列新型分词器,详细介绍了它们的架构和性能。
- FLUX.2
- HunyuanVideo 1.5
- Kirill Chernyshev
- KVAE-2D
- KVAE-3D
- KVAE-Audio
- MMAudio
- MovieGen
- StableAudio
- variational auto-encoder
- Wan-2.2
- kandinskylab/kvae
- kandinskylab/KVAE-Audio
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →