PulseAugur
实时 10:57:15
实体 Audio-Text Foundation Models

Audio-Text Foundation Models

PulseAugur coverage of Audio-Text Foundation Models — every cluster mentioning Audio-Text Foundation Models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_206460 ·

    新的PRISM框架解决了音频-文本模型中的严重声学噪声问题

    研究人员开发了PRISM,一个新颖的、无需训练的框架,用于将音频-文本基础模型(ATMs)适应于严重的声学噪声。该方法基于仿射噪声假设,估计并逆转多模态潜在空间中的低秩仿射偏移。PRISM通过几何校正和静态投影矩阵实现适应,与基于梯度的方法相比,推理速度显著提高。该框架还引入了置信度感知回归(CAR)来解决复音陷阱(polyphonic trap),这是子空间缩胀中的一种失效模式,进一步提高了在UrbanSound8K等数据集上的性能。