PulseAugur
实时 14:29:56
实体 UrbanSound8k

UrbanSound8k

PulseAugur coverage of UrbanSound8k — every cluster mentioning UrbanSound8k across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_229003 ·

    好奇心驱动的MoE框架提升了边缘设备的AI模型稳定性和准确性

    研究人员开发了一种新颖的好奇心驱动的量化混合专家(MoE)框架,专为资源受限的设备设计。该方法解决了在进行激进量化时保持准确性的挑战,同时确保可预测的推理延迟。通过利用贝叶斯认知不确定性,该框架将任务路由到异构专家,包括具有不同比特精度的BitNet和BitLinear模型。在音频分类基准上的评估表明,在准确性损失极小的情况下,实现了显著的节能和压缩,同时跨折方差大幅降低,表明稳定性有所提高。

  2. RESEARCH · CL_206460 ·

    新的PRISM框架解决了音频-文本模型中的严重声学噪声问题

    研究人员开发了PRISM,一个新颖的、无需训练的框架,用于将音频-文本基础模型(ATMs)适应于严重的声学噪声。该方法基于仿射噪声假设,估计并逆转多模态潜在空间中的低秩仿射偏移。PRISM通过几何校正和静态投影矩阵实现适应,与基于梯度的方法相比,推理速度显著提高。该框架还引入了置信度感知回归(CAR)来解决复音陷阱(polyphonic trap),这是子空间缩胀中的一种失效模式,进一步提高了在UrbanSound8K等数据集上的性能。

  3. TOOL · CL_93715 ·

    AudioPG 使用合成数据进行高效音频模型预训练

    研究人员开发了 AudioPG,一个使用程序化生成的合成数据而非真实录音进行音频模型预训练的新颖框架。这种方法显著降低了训练成本、策展工作量和隐私担忧。使用 AudioPG 训练的基于 Transformer 的模型在各种真实音频基准测试中表现强劲,达到了高准确率,并在单个 GPU 上在 20 分钟内完成了预训练。对模型潜在空间的分析表明,物理声学因素出现在不同的子空间中,从而产生了可解释的表征。

  4. RESEARCH · CL_70578 ·

    新评分方法提升音频-语言AI的噪声鲁棒性

    研究人员开发了一种名为漂移增强评分(Drift-Augmented Scoring, DAS)的新技术,以提高零样本音频-语言分类模型在声学噪声下的鲁棒性。该方法在余弦评分上增加了一个小额奖励,当噪声音频嵌入朝着文本提示预测的方向漂移时,会奖励相应的类别。DAS在UrbanSound8K和FSD50K等基准数据集上展示了显著的改进,在各种噪声条件下提高了准确率和mAP得分。

  5. TOOL · CL_66097 ·

    扩散模型在零样本环境声音分类方面取得进展

    研究人员开发了一种新颖的扩散模型,用于零样本环境声音分类,这项任务在历史上一直面临性能不佳的困境。该新模型为未见过的类别生成合成嵌入,然后将这些合成嵌入与现有嵌入结合起来训练分类器。在六个音频数据集上的实验表明,该扩散模型显著优于先前的基线方法,使其成为该音频分析领域的挑战性问题的一种有前途的方法。