研究人员探索了自动语音识别(ASR)系统适应儿童语音的更好方法,同时保留对成人语音的识别性能。该研究比较了全微调(full fine-tuning)、LoRA和权重空间合并(weight-space merging)等技术在不同ASR架构(包括编码器-解码器、编码器-CTC和基于AudioLLM的系统)上的表现。实验重点关注阿拉伯语和英语儿童语音,结果表明,虽然自适应至关重要,但直接方法可能会降低成人语音识别的性能。权重空间合并技术通常能在儿童自适应和成人保留之间取得更好的平衡,尤其是在某些ASR架构上。 AI
影响 这项研究可能带来更强大的ASR系统,能够准确地转录儿童和成人语音,从而提高不同用户群体的可访问性和可用性。
排序理由 学术论文,详细介绍了ASR自适应技术的实证研究。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →