实体
UrbanSound8k
UrbanSound8k
PulseAugur coverage of UrbanSound8k — every cluster mentioning UrbanSound8k across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
AudioPG 使用合成数据进行高效音频模型预训练
研究人员开发了 AudioPG,一个使用程序化生成的合成数据而非真实录音进行音频模型预训练的新颖框架。这种方法显著降低了训练成本、策展工作量和隐私担忧。使用 AudioPG 训练的基于 Transformer 的模型在各种真实音频基准测试中表现强劲,达到了高准确率,并在单个 GPU 上在 20 分钟内完成了预训练。对模型潜在空间的分析表明,物理声学因素出现在不同的子空间中,从而产生了可解释的表征。
-
新评分方法提升音频-语言AI的噪声鲁棒性
研究人员开发了一种名为漂移增强评分(Drift-Augmented Scoring, DAS)的新技术,以提高零样本音频-语言分类模型在声学噪声下的鲁棒性。该方法在余弦评分上增加了一个小额奖励,当噪声音频嵌入朝着文本提示预测的方向漂移时,会奖励相应的类别。DAS在UrbanSound8K和FSD50K等基准数据集上展示了显著的改进,在各种噪声条件下提高了准确率和mAP得分。
-
扩散模型在零样本环境声音分类方面取得进展
研究人员开发了一种新颖的扩散模型,用于零样本环境声音分类,这项任务在历史上一直面临性能不佳的困境。该新模型为未见过的类别生成合成嵌入,然后将这些合成嵌入与现有嵌入结合起来训练分类器。在六个音频数据集上的实验表明,该扩散模型显著优于先前的基线方法,使其成为该音频分析领域的挑战性问题的一种有前途的方法。