研究人员开发了PRISM,一个新颖的、无需训练的框架,用于将音频-文本基础模型(ATMs)适应于严重的声学噪声。该方法基于仿射噪声假设,估计并逆转多模态潜在空间中的低秩仿射偏移。PRISM通过几何校正和静态投影矩阵实现适应,与基于梯度的方法相比,推理速度显著提高。该框架还引入了置信度感知回归(CAR)来解决复音陷阱(polyphonic trap),这是子空间缩胀中的一种失效模式,进一步提高了在UrbanSound8K等数据集上的性能。 AI
影响 这项研究提供了一种更快、无需训练的方法来提高音频-文本模型在嘈杂环境中的鲁棒性。
排序理由 该集群描述了一篇详细介绍改进音频-文本模型新方法的最新研究论文。
在 Hugging Face Daily Papers 阅读 →
- Affine Bias Regression
- Affine Noise Hypothesis
- arXiv
- Ashish Anand Shukla
- Audio-Text Foundation Models
- Confidence-Aware Regression
- Hugging Face
- Polyphonic Trap
- PRISM
- Test-Time Adaptation
- UrbanSound8k
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →