研究人员推出了一种新颖的音频自监督学习框架NAPE(Next-Audio-Patch-Embedding prediction)。该方法利用因果Transformer,通过预测对数梅尔频谱图的后续补丁嵌入来从先前的嵌入中学习,并将因果掩码和停止梯度作为其主要的训练信号。NAPE在六个音频和语音基准测试中取得了最先进的微调性能,展示了随着编码器尺寸的持续扩展和强大的线性探测结果。 AI
影响 NAPE在音频表示学习方面的成功可能会影响未来跨模态的自监督学习方法。
排序理由 该集群描述了一篇关于新颖音频处理自监督学习框架的最新研究论文。
在 Hugging Face Daily Papers 阅读 →
- NAPE
- Umberto Cappellazzo
- audio learners
- causal Transformer
- Hugging Face
- Language Modeling
- log-mel spectrogram
- self-supervised learning
- visual representation learning
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →