研究人员开发了一种新颖的多任务学习框架,以提高非规范语音(如病理语音或带口音的语音)的音素识别能力。该方法通过分层架构和交叉注意力融合,将音素预测分解为发音方式、发音部位和清浊等发音特征。该系统还结合了半监督学习和分阶段训练策略,以处理有限且嘈杂的临床语音数据。在代理数据集上的实验表明,与基线模型相比,性能显著提升,并且错误模式具有可解释性,与音韵学特征一致。 AI
影响 这项研究有望为多样化和临床人群带来更鲁棒、更具可解释性的语音识别系统。
排序理由 关于语音识别新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →