PulseAugur
实时 10:06:12
实体 SAM Audio

SAM Audio

PulseAugur coverage of SAM Audio — every cluster mentioning SAM Audio across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_145843 ·

    研究发现音频分离损害零样本 ASR 性能

    一项新的研究论文调查了一个违反直觉的发现,即音频分离会降低零样本自动语音识别 (ASR) 系统的性能。该研究在嘈杂的孟加拉语和英语语音上,评估了 SAM-Audio 作为 OpenAI 的 Whisper 模型预处理步骤的效果。与预期相反,应用 SAM-Audio(提高了 PSNR 等音频质量指标)导致在所有测试的 Whisper 变体和数据集上,词错误率 (WER) 和字符错误率 (CER) 都有所增加。这表明信号级别的质量提升并不…

  2. RESEARCH · CL_82554 ·

    新方法探测和引导音频AI模型中的注意力

    研究人员开发了新的方法来理解和操纵大型音频语言模型的内部工作机制。一种名为指令引导向量的方法允许重定向模型内的时间注意力,使其能够在不重新训练的情况下专注于特定的声音事件。另一种方法使用因果干预来解析音频分离模型中的注意力动态,揭示了一个双通路文本条件机制,并催生了一种称为层选择性注意力缓存的加速方法。

  3. RESEARCH · CL_82193 ·

    新方法增强音视频学习,避免遗忘

    研究人员开发了一种用于音视频场景下类别增量学习(CIL)的新方法,解决了在获取新知识的同时不丢失先前学习信息这一挑战。该方法通过一种新颖的注意力策略,利用SAM-Audio多模态模型的音频特征来指导视觉表示。为了进一步对抗灾难性遗忘,该方法在特征和logit层面都纳入了双层蒸馏目标,在音视频CIL基准测试中表现优于现有最先进技术。