实体
kandinskylab/KVAE-Audio
kandinskylab/KVAE-Audio
PulseAugur coverage of kandinskylab/KVAE-Audio — every cluster mentioning kandinskylab/KVAE-Audio across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的KVAE分词器旨在推进多模态生成模型
研究人员推出了一系列名为KVAE的新型分词器,专为多模态生成模型设计。这些分词器,包括KVAE-Audio、KVAE-3D和KVAE-2D,专门为跨音频、视频和图像数据的文本条件生成任务而构建。该论文详细介绍了这些模型的开发、训练和消融研究,并与社区分享了代码和训练细节。评估表明,KVAE分词器在各种重建和生成指标上均达到或超过了现有开源替代品的性能。
-
kandinskylab发布KVAE-Audio,一款高保真音频自编码器
kandinskylab发布了KVAE-Audio,一款新的连续全频带音频自编码器。该模型能有效地将原始音频波形压缩成紧凑的潜在表示,并以高保真度重建语音、音乐和通用声音。它被设计用作生成模型的潜在空间,内部测试表明,当KVAE-Audio集成到流程中时,文本到音频生成质量有所提高。