kandinskylab发布了KVAE-Audio,一款新的连续全频带音频自编码器。该模型能有效地将原始音频波形压缩成紧凑的潜在表示,并以高保真度重建语音、音乐和通用声音。它被设计用作生成模型的潜在空间,内部测试表明,当KVAE-Audio集成到流程中时,文本到音频生成质量有所提高。 AI
影响 这款音频自编码器有望提高文本到音频生成模型的质量和效率。
排序理由 该条目描述了一个新模型发布及其技术规格和评估结果。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Trending Models 阅读 →
- AudioCaps
- AudioSet
- DACVAE
- Diffusion Transformer
- kandinskylab/KVAE-Audio
- KVAE-Audio
- LibriSpeech
- MMAudio
- MovieGen Audio
- MUSDB18-HQ
- Same Love
- Song Describer
- Stable Audio 3
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →