研究人员推出了MGhana-ST,一个专为四种低资源加纳语言(Ga、Twi、Ewe和Fante)设计的语音翻译数据集。该数据集包含配对的音频和英语翻译,并标注了口头和非口头事件,旨在推动非洲语言语音技术的研究。使用Whisper-small模型的实验表明,在数据稀缺的情况下,扁平化多语言训练并未使所有语言受益,与单语言训练相比,一些语言的性能有所下降。 AI
影响 该数据集及其分析可以为代表性不足的语言的语音技术未来的研究和开发提供信息。
排序理由 该集群描述了一篇介绍数据集和低资源语言多语言训练权衡实验结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →