ESC-50
PulseAugur coverage of ESC-50 — every cluster mentioning ESC-50 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的MADS描述符集超越频谱摘要,增强音频分析能力
研究人员开发了MADS(多视图声学描述符集),这是一个新的19维描述符集,旨在捕捉音频信号中超越传统频谱摘要的更丰富的物理动态。MADS编码激励、阻尼和周期性等属性,旨在提供对声音生成事件的更全面理解。在ESC-10和ESC-50等数据集上的评估表明,与现有的手工制作基线相比,MADS在较低的维度下实现了强大的性能,并将其定位为未来音频建模的基础层。
-
好奇心驱动的MoE框架提升了边缘设备的AI模型稳定性和准确性
研究人员开发了一种新颖的好奇心驱动的量化混合专家(MoE)框架,专为资源受限的设备设计。该方法解决了在进行激进量化时保持准确性的挑战,同时确保可预测的推理延迟。通过利用贝叶斯认知不确定性,该框架将任务路由到异构专家,包括具有不同比特精度的BitNet和BitLinear模型。在音频分类基准上的评估表明,在准确性损失极小的情况下,实现了显著的节能和压缩,同时跨折方差大幅降低,表明稳定性有所提高。
-
新研究发现LLM中跨模态可迁移的情感轴
研究人员在大型语言模型中识别出一个内部方向,该方向能有效追踪文本的情感,被称为效价轴(V-axis)。该V轴可以使用一组最小的情感锚定叙事来发现,显著减少了对大量标记数据的需求。研究表明,该V轴不仅限于文本,它还表现出跨模态的可迁移性,包括视觉、音频甚至人脑记录,并且在没有特定模态训练的情况下取得了高性能。
-
新框架评估音效生成系统
研究人员开发了一个新的音效(SFX)生成系统评估框架,解决了对逼真音频的需求,同时保持感知同一性并允许可控的变化。该框架引入了一个两阶段协议,包括一个参考引导的音频到音频变化任务以及针对变形和修复等操作的能力特定分析。这种方法结合了客观指标和人类研究,揭示了不同生成方法之间的权衡,其中 AudioX 在 SFX 变形的参考对齐和多样性之间显示出强大的平衡。
-
MJEPA架构通过统一编码器简化视听学习
研究人员推出了一种新颖的视听学习架构MJEPA,该架构使用单一的统一编码器来处理两种模态。这种方法通过采用单一的预测目标,在模态内部和跨模态进行操作,从而简化了现有方法。研究表明,跨模态预测至关重要,因为缺失跨模态预测会导致表示能力下降,而包含跨模态预测则通过利用另一种模态的优势,显著提升了每种模态的表示能力。MJEPA模型,特别是冻结的ViT-g变体,在AudioSet-20K和ESC-50等音频基准测试中表现出色,并且在视频任务上…
-
MJEPA:统一的视听学习架构揭晓
研究人员推出 MJEPA,这是一种新颖的联合嵌入预测架构,专为视听学习而设计。该方法使用单一的统一编码器来处理两种模态,通过在模态之间和模态内部使用单一的预测目标来简化学习过程。研究表明,跨模态预测对性能至关重要,MJEPA 的表征受益于跨模态学习。MJEPA 模型取得了优异的成果,在 AudioSet-20K 上超越了之前的冻结基线,并在其他基准测试中取得了有竞争力的性能,同时使用的视频数据量显著减少。
-
AudioPG 使用合成数据进行高效音频模型预训练
研究人员开发了 AudioPG,一个使用程序化生成的合成数据而非真实录音进行音频模型预训练的新颖框架。这种方法显著降低了训练成本、策展工作量和隐私担忧。使用 AudioPG 训练的基于 Transformer 的模型在各种真实音频基准测试中表现强劲,达到了高准确率,并在单个 GPU 上在 20 分钟内完成了预训练。对模型潜在空间的分析表明,物理声学因素出现在不同的子空间中,从而产生了可解释的表征。
-
新判据预测滞后谱嵌入的有效性
研究人员开发了一种新的判据,用于确定多元时间序列的无训练滞后谱嵌入的适用性。该判据基于平稳性和时间耦合性,可预测称为 D(tau) 的描述符是否能有效运行。该方法包括一个两部分的预测试:增强的 Dickey-Fuller 平稳性检查和功率基线饱和度检查。研究在各种数据集上验证了该判据,结果显示在符合判据的数据集上表现具有竞争力,而在不符合的数据集上则可预测地失败。
-
扩散模型在零样本环境声音分类方面取得进展
研究人员开发了一种新颖的扩散模型,用于零样本环境声音分类,这项任务在历史上一直面临性能不佳的困境。该新模型为未见过的类别生成合成嵌入,然后将这些合成嵌入与现有嵌入结合起来训练分类器。在六个音频数据集上的实验表明,该扩散模型显著优于先前的基线方法,使其成为该音频分析领域的挑战性问题的一种有前途的方法。