ESC-50
PulseAugur coverage of ESC-50 — every cluster mentioning ESC-50 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新框架评估音效生成系统
研究人员开发了一个新的音效(SFX)生成系统评估框架,解决了对逼真音频的需求,同时保持感知同一性并允许可控的变化。该框架引入了一个两阶段协议,包括一个参考引导的音频到音频变化任务以及针对变形和修复等操作的能力特定分析。这种方法结合了客观指标和人类研究,揭示了不同生成方法之间的权衡,其中 AudioX 在 SFX 变形的参考对齐和多样性之间显示出强大的平衡。
-
MJEPA架构通过统一编码器简化视听学习
研究人员推出了一种新颖的视听学习架构MJEPA,该架构使用单一的统一编码器来处理两种模态。这种方法通过采用单一的预测目标,在模态内部和跨模态进行操作,从而简化了现有方法。研究表明,跨模态预测至关重要,因为缺失跨模态预测会导致表示能力下降,而包含跨模态预测则通过利用另一种模态的优势,显著提升了每种模态的表示能力。MJEPA模型,特别是冻结的ViT-g变体,在AudioSet-20K和ESC-50等音频基准测试中表现出色,并且在视频任务上…
-
MJEPA:统一的视听学习架构揭晓
研究人员推出 MJEPA,这是一种新颖的联合嵌入预测架构,专为视听学习而设计。该方法使用单一的统一编码器来处理两种模态,通过在模态之间和模态内部使用单一的预测目标来简化学习过程。研究表明,跨模态预测对性能至关重要,MJEPA 的表征受益于跨模态学习。MJEPA 模型取得了优异的成果,在 AudioSet-20K 上超越了之前的冻结基线,并在其他基准测试中取得了有竞争力的性能,同时使用的视频数据量显著减少。
-
AudioPG 使用合成数据进行高效音频模型预训练
研究人员开发了 AudioPG,一个使用程序化生成的合成数据而非真实录音进行音频模型预训练的新颖框架。这种方法显著降低了训练成本、策展工作量和隐私担忧。使用 AudioPG 训练的基于 Transformer 的模型在各种真实音频基准测试中表现强劲,达到了高准确率,并在单个 GPU 上在 20 分钟内完成了预训练。对模型潜在空间的分析表明,物理声学因素出现在不同的子空间中,从而产生了可解释的表征。
-
新判据预测滞后谱嵌入的有效性
研究人员开发了一种新的判据,用于确定多元时间序列的无训练滞后谱嵌入的适用性。该判据基于平稳性和时间耦合性,可预测称为 D(tau) 的描述符是否能有效运行。该方法包括一个两部分的预测试:增强的 Dickey-Fuller 平稳性检查和功率基线饱和度检查。研究在各种数据集上验证了该判据,结果显示在符合判据的数据集上表现具有竞争力,而在不符合的数据集上则可预测地失败。
-
扩散模型在零样本环境声音分类方面取得进展
研究人员开发了一种新颖的扩散模型,用于零样本环境声音分类,这项任务在历史上一直面临性能不佳的困境。该新模型为未见过的类别生成合成嵌入,然后将这些合成嵌入与现有嵌入结合起来训练分类器。在六个音频数据集上的实验表明,该扩散模型显著优于先前的基线方法,使其成为该音频分析领域的挑战性问题的一种有前途的方法。