PulseAugur
实时 06:47:44
English(EN) Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners

新的NAPE框架推动音频表示学习

研究人员开发了一个名为NAPE(下一个音频块嵌入预测)的新自监督学习框架,用于音频表示。该方法借鉴了成功的语言和视觉模型,训练了一个因果Transformer来预测音频频谱图中后续的块嵌入,依据的是之前的嵌入。NAPE在多个音频和语音基准测试中取得了最先进的微调性能,展示了与编码器尺寸一致的可扩展性,并能在没有明确监督的情况下产生有意义的注意力模式。 AI

影响 这种极简的音频表示学习方法有望简化和提高各种音频和语音任务的性能。

排序理由 该集群包含一篇详细介绍新模型和方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的NAPE框架推动音频表示学习

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Umberto Cappellazzo, Xubo Liu, Stavros Petridis, Maja Pantic ·

    向前聆听:下一个补丁嵌入预测实现可扩展音频学习器

    arXiv:2608.19863v1 Announce Type: cross Abstract: Self-supervised learning (SSL) has driven substantial progress in audio representation learning, though existing methods have increasingly relied on elaborate pre-training recipes to reach competitive performance. A markedly diffe…