研究人员开发了 GIVE-KWS,一个利用视觉语音线索来提高噪声鲁棒性的关键词识别新系统。通过引入门控交叉注意力机制,GIVE-KWS 将查询音频与唇部运动相结合,展示了显著的性能提升。与基准系统相比,该系统在 -10 dB 信噪比下实现了 72.9% 的未见关键词错误率降低,突显了视觉表示中的音素信息对于有效噪声鲁棒性的重要性。 AI
影响 增强了语音识别系统在嘈杂环境中的鲁棒性,可能改善真实世界应用中的用户体验。
排序理由 该集群包含一篇详细介绍新系统和基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →