研究人员开发了DLM-AN,一个利用自监督语音标记上的掩码离散扩散的可控口音归一化新系统。该方法通过选择性地重用源标记来实现可调节的口音强度,从而使语言学习和配音等应用能够根据需要保留或减少口音。该系统还包含一个持续时间比率预测器,以匹配母语者的语速,并在降低词错误率的同时提供平滑的口音控制方面表现出卓越的性能。 AI
影响 这项研究可以为语言学习和内容本地化等应用提供更细致的语音合成和分析工具。
排序理由 该集群包含一篇详细介绍语音处理新技术的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →