研究人员开发了一个名为NAPE(下一个音频块嵌入预测)的新自监督学习框架,用于音频表示。该方法借鉴了成功的语言和视觉模型,训练了一个因果Transformer来预测音频频谱图中后续的块嵌入,依据的是之前的嵌入。NAPE在多个音频和语音基准测试中取得了最先进的微调性能,展示了与编码器尺寸一致的可扩展性,并能在没有明确监督的情况下产生有意义的注意力模式。 AI
影响 这种极简的音频表示学习方法有望简化和提高各种音频和语音任务的性能。
排序理由 该集群包含一篇详细介绍新模型和方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →