PulseAugur
实时 22:58:56
实体 Umberto Cappellazzo

Umberto Cappellazzo

PulseAugur coverage of Umberto Cappellazzo — every cluster mentioning Umberto Cappellazzo across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_118106 ·

    新的VIB-AVSR方法增强了基于大语言模型的语音识别在嘈杂条件下的性能

    研究人员推出了一种名为VIB-AVSR的新方法,用于增强视听语音识别模型。该方法将变分信息瓶颈层集成到大语言模型骨干中,以提高在嘈杂音频条件下的鲁棒性。VIB-AVSR旨在稳定表示,而无需更改模型架构或额外训练数据,并在各种噪声级别和类型下展示了更少的性能下降。

  2. TOOL · CL_80299 ·

    新框架解码视听语音识别中的模态贡献

    研究人员开发了 Dr. SHAP-AV,一个利用 Shapley 值分析视听语音识别模型如何平衡声学和视觉信息的框架。在六个模型和不同噪声水平下的实验表明,虽然模型在嘈杂条件下会增加视觉依赖性,但音频贡献仍然很重要。分析还揭示了模态平衡在语音生成过程中会发生变化,并且信噪比是模态加权的主要驱动因素,这表明当前模型存在持续的音频偏见。